[뉴스] 앤트로픽, 클로드 코드에 플러그인 평가 기능 추가
조회 1 · 댓글 0
앤트로픽(Anthropic)이 9월 11일 클로드 코드(Claude Code)에 플러그인 평가 기능을 추가했습니다. 새로 들어온 명령은 "claude plugin eval" 하나이고, 클로드 코드 2.1.269 이상에서 동작합니다. 내가 만든 플러그인이나 스킬이 실제로 값을 하는지 정량으로 측정하는 도구입니다.
동작 방식은 단순합니다. 준비한 평가 케이스를 두 번 돌립니다. 한 번은 플러그인을 올린 상태로, 한 번은 안 올린 상태로 실행한 뒤 그 차이를 비교합니다. 이 차이가 플러그인이 실제로 기여한 몫입니다. 채점기는 여섯 종류를 제공합니다.
- 계산형(무료) - regex, tool_used, tool_order, file_exists. 정규식 일치, 특정 도구 사용 여부, 도구 호출 순서, 파일 생성 여부를 기계적으로 확인합니다.
- 판정 모델형(과금) - llm, baseline. 별도 판정 모델을 불러 결과 품질을 채점하므로 비용이 붙습니다.
결과는 JSON과 HTML 리포트로 나옵니다. 채점기별 판정과 판정 모델 투표까지 남아서 어디서 점수가 갈렸는지 추적할 수 있습니다. CI에 걸 수 있도록 통과 기준을 정하는 "--threshold"(예: 0.8), 비용 상한을 거는 "--max-cost-usd" 같은 옵션도 있고, 전체 실행 전에 예상 비용을 먼저 보여줍니다.
플러그인과 스킬을 실전에 붙이기 전에 이게 정말 도움이 되는지를 눈대중이 아니라 재현 가능한 숫자로 확인할 수 있게 된 점이 의미가 있어 보입니다. 여러 명이 스킬을 함께 관리하는 팀이라면 통과 기준을 CI 게이트로 걸어두고 회귀를 막는 식으로 쓸 수 있습니다.
로그인 후 답글을 남길 수 있습니다.