클로드스킬마트스킬 둘러보기바로 쓰는 문장영상으로 배우기터미널 사용법스킬이 뭐예요?
목록으로

에이전트 벤치마크 프레임워크

AI 에이전트의 응답 품질을 점수화하고 베이스라인과 비교해 품질 저하(회귀)를 배포 전에 잡아내는 벤치마크 설계 스킬.

개발·코딩고급53044AI 점수 7/10마지막 업데이트: 2026. 8. 8.

무엇을 해주나

  • 에이전트(code-reviewer, security-reviewer, verifier 등)의 품질을 0~100점으로 채점하는 루브릭 체계를 제공합니다: 완전성 30점 / 정확성 30점 / 실행가능성 20점 / 형식 준수 20점.
  • fixtures(입력 코드), ground-truth(기대 결과 JSON), rubrics, baselines, results로 구성된 표준 디렉터리 구조를 정의합니다.
  • 회귀 판정 규칙을 명시합니다: 단일 픽스처 10점 이상 하락, 평균 5점 이상 하락, PASS→FAIL 전환, 형식 준수 80 미만.
  • 에이전트별 픽스처 수·통과 임계치, 추적 지표(정확도, 오탐율, 응답시간 p50/p95, 토큰 사용량)를 표로 정리합니다.
  • GitHub Actions 워크플로 예시로 PR에서 회귀 시 빌드 실패시키는 CI 게이트 구성까지 안내합니다.

이런 분께 추천

  • 커스텀 서브에이전트/스킬을 여러 개 운영하며 프롬프트를 자주 수정하는 분
  • "프롬프트를 고쳤는데 정말 나아졌는지" 감이 아니라 숫자로 확인하고 싶은 분
  • 팀 단위로 에이전트를 배포하며 품질 회귀를 CI에서 막고 싶은 분

활용 예시

  1. 코드 리뷰 에이전트 정의를 수정하기 전 --save-as before로 현재 점수를 저장하고, 수정 후 --compare before로 픽스처별 점수 변화를 확인합니다.
  2. missing-error-handling.ts 같은 픽스처와 기대 발견 항목(JSON)을 작성해, 에이전트가 try/catch 누락을 HIGH 심각도로 잡아내는지 자동 검증합니다.
  3. 주간 회귀 스위트를 돌려 security-reviewer가 하드코딩된 API 키를 계속 잡는지 확인하고, 점수가 61점으로 떨어지면 회귀 리포트를 근거로 변경을 롤백합니다.

주의: 문서의 node ~/.claude/benchmarks/run.mjs 러너 스크립트는 스킬에 포함되어 있지 않으므로, 규격에 맞춰 직접 구현하거나 Claude에게 만들어 달라고 요청해야 합니다.

· · · 설치 가이드 · · ·

설치 없이 지금 한 번 써보기

아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.

이 파일의 지시를 읽고 그대로 따라서 나를 도와줘:
https://raw.githubusercontent.com/vibeeval/vibecosystem/HEAD/skills/agent-benchmark/SKILL.md

내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)

Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.

쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.

Claude 앱에 설치 (터미널 필요 없음)
  1. 아래 버튼으로 ZIP 파일을 받으세요.
  2. Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
  3. Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
ZIP 내려받기
Claude Code에 설치

Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요

클로드스킬마트에서 찾은 스킬을 설치해줘.
GitHub 저장소 vibeeval/vibecosystem 의 skills/agent-benchmark 폴더를 내 ~/.claude/skills/agent-benchmark/ 에 그대로 복사해줘.
설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.

직접 명령으로 설치하기

git clone https://github.com/vibeeval/vibecosystem.git /tmp/vibecosystem && mkdir -p ~/.claude/skills && cp -r /tmp/vibecosystem/skills/agent-benchmark ~/.claude/skills/

제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.

  1. 터미널을 엽니다(macOS는 터미널, Windows는 WSL 또는 Git Bash).
  2. 저장소를 내려받습니다: git clone https://github.com/vibeeval/vibecosystem.git
  3. 스킬 폴더를 만듭니다: mkdir -p ~/.claude/skills
  4. 스킬을 복사합니다: cp -r vibecosystem/skills/agent-benchmark ~/.claude/skills/
  5. Claude Code를 재시작하고 /skills(또는 스킬 목록 확인 명령)로 agent-benchmark가 보이는지 확인합니다.
  6. Node.js 18 이상이 설치되어 있는지 확인합니다: node -v
  7. Claude Code에서 "agent-benchmark 스킬 규격대로 ~/.claude/benchmarks 디렉터리와 run.mjs 러너를 만들어 줘"라고 요청해 실행 스크립트를 생성합니다.
  8. 첫 픽스처와 ground-truth 파일을 1개씩 만든 뒤 벤치마크를 실행해 베이스라인을 저장합니다.