AI 에이전트 평가 설계
AI 에이전트의 품질을 재현 가능한 데이터셋·채점 기준·회귀 게이트로 평가해 릴리스 여부를 판단하도록 돕는 스킬.
개발·코딩고급★ 154⑂ 32AI 점수 9/10마지막 업데이트: 2026. 8. 9.
무엇을 해주나
AI 에이전트를 "느낌"이 아니라 증거로 판단하도록 평가 체계를 설계해 줍니다.
- 평가 목적과 테스트 대상(모델 / 툴 / 검색 / 정책 / 인프라)을 분리해 정의
- 대표 케이스 + 경계·롱테일·잘못된 입력·툴 실패·프롬프트 인젝션 케이스로 데이터셋 구성, 홀드아웃 분리
- 결정적 체크 / 루브릭 기반 모델 채점 / 블라인드 사람 검수 중 가장 덜 주관적인 채점 방식 선택
- 프롬프트·모델 버전·시드·재시도·타임아웃을 고정해 베이스라인과 후보를 동일 조건에서 비교
- 실패 분류표, 불확실성, 릴리스 게이트(핵심 케이스 통과 + 비회귀 + 운영 한계)와 결정 메모 산출
scripts/aggregate_results.py로 결과 JSONL의 점수 범위·누락 라벨·통과율 분모를 검증하고 요약 생성
이런 분께 추천
- LLM 에이전트/코파일럿을 실제 배포하며 배포 판단 근거가 필요한 엔지니어
- 프롬프트나 모델을 교체할 때 성능이 정말 좋아졌는지 확인하려는 팀
- 프로덕션 장애를 회귀 테스트 케이스로 자산화하려는 QA·플랫폼 담당자
활용 예시
- "고객지원 에이전트 v1과 v2 비교": 해결 정확도, 인용 충실도, 정책 준수, 에스컬레이션 판단, 지연, 비용 기준을 정의하고 버전 라벨을 가린 뒤 3회 반복 실행해 ship/hold/부분 롤아웃 결정
- "이번 프롬프트 변경이 회귀를 만들었는지 확인": 홀드아웃 세트로 베이스라인 대비 델타를 계산하고 케이스 카테고리별 슬라이스 분석
- "운영 중 발생한 오답 20건을 회귀 픽스처로 전환": 개인정보를 제거한 뒤 고정 케이스로 저장하고 릴리스 게이트에 편입
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/seb1n/awesome-ai-agent-skills/HEAD/agent-engineering/agent-evaluation/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 seb1n/awesome-ai-agent-skills 의 agent-engineering/agent-evaluation 폴더를 내 ~/.claude/skills/agent-evaluation/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/seb1n/awesome-ai-agent-skills.git && mkdir -p ~/.claude/skills && cp -r awesome-ai-agent-skills/agent-engineering/agent-evaluation ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 엽니다.
- 저장소를 내려받습니다:
git clone https://github.com/seb1n/awesome-ai-agent-skills.git - 스킬 폴더를 만듭니다:
mkdir -p ~/.claude/skills - 이 스킬만 복사합니다:
cp -r awesome-ai-agent-skills/agent-engineering/agent-evaluation ~/.claude/skills/ references/와scripts/폴더가 함께 복사됐는지 확인합니다 (ls ~/.claude/skills/agent-evaluation).- 스크립트를 쓰려면
python3 --version으로 파이썬이 설치돼 있는지 확인합니다. - Claude Code를 재시작하고 "에이전트 평가 계획을 세워줘"처럼 요청하면 스킬이 활성화됩니다.
GitHub에서 원본 보기 ↗라이선스: MIT