클로드스킬마트스킬 둘러보기바로 쓰는 문장영상으로 배우기터미널 사용법스킬이 뭐예요?
목록으로

LLM 평가 하네스

OpenAI/Anthropic 호환 LLM 엔드포인트를 가용성·요청 전달·속도·동시성·프로토콜·품질 6개 축으로 실측 검증하는 스킬.

개발·코딩고급1,323212AI 점수 9/10마지막 업데이트: 2026. 8. 8.

무엇을 해주나

base_url + model + 환경변수에 담긴 API 키만 주면, 벤더가 내세우는 홍보 숫자 대신 실제 측정값을 뽑아냅니다.

  • 가용성: 어떤 모델 ID가 실제로 라우팅되는지 3단계 판정(no-channel / upstream-error / empty-content)으로 구분. 추론 모델이 max_tokens 때문에 '죽은 모델'로 오판되지 않게 기본 8192 유지.
  • 요청 충실도: system 프롬프트·tools·멀티턴 히스토리가 게이트웨이에서 조용히 버려지는지 카나리 코드로 검증. 200 OK로 잘 대답하는데 system 프롬프트만 도달하지 않는, 가장 잡기 힘든 장애를 잡아냅니다.
  • 속도: TTFT + 지속 디코드 tok/s. reasoning_content를 세지 않고 completion_tokens로 나눠서 750 tok/s를 4700 tok/s로 잘못 재는 함정을 회피.
  • 동시성: 10/20/40/60 등으로 램프업해 성공률·p50/p90이 무너지는 지점을 찾음. 주변 프록시와 keep-alive를 차단해 모델 자체 한계를 측정.
  • 프로토콜 준수: Anthropic thinking 블록의 생성 여부와, 이미 히스토리에 있는 thinking 블록을 재전송했을 때 400으로 거부하는지(에이전트 세션이 끊기는 원인)를 별도로 검사.
  • 품질 회귀: 내 유스케이스 라이브러리로 답변을 수집한 뒤, 서로를 모르는 블라인드 심사 에이전트 3개가 독립 채점하고 다수결로 통과 판정.

키는 항상 --key-env 로 환경변수 이름만 넘겨 ps·셸 히스토리·리포트에 노출되지 않습니다.

이런 분께 추천

  • 새 LLM 벤더나 게이트웨이(중계 채널)를 도입 전에 검증해야 하는 개발자·플랫폼 엔지니어
  • 사내 AI 제품의 '지원 모델 목록'이나 배포 게이트를 관리하는 담당자
  • "모델이 system 프롬프트를 무시한다", "쓰다 보면 400이 난다" 같은 원인 불명 증상을 디버깅해야 하는 사람
  • 워크숍·시연 전에 동시 접속을 버티는지 확인하고 싶은 팀

활용 예시

  1. 신규 채널 온보딩: "이 API 붙여도 되는지 먼저 보자" → 가용성 프로브로 유효한 모델 ID를 추리고, 충실도 프로브로 system/tools 전달률을 10회 샘플링해 확인.
  2. tok/s 광고 검증: 벤더가 주장하는 처리량을 speed_probe.py --mode both로 실측해, 실제 태스크 처리량과 지속 디코드 상한을 나눠 보고.
  3. 세션 끊김 디버깅: 확장 사고(thinking) 클라이언트에서 대화가 이어지지 않을 때 protocol_probe.py --check history-replay로 히스토리 재전송 거부를 재현하고, 증거 패키지 프로토콜에 따라 벤더에 버그 리포트 제출.

· · · 설치 가이드 · · ·

설치 없이 지금 한 번 써보기

아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.

이 파일의 지시를 읽고 그대로 따라서 나를 도와줘:
https://raw.githubusercontent.com/daymade/claude-code-skills/HEAD/llm-eval-harness/SKILL.md

내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)

Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.

쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.

Claude 앱에 설치 (터미널 필요 없음)
  1. 아래 버튼으로 ZIP 파일을 받으세요.
  2. Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
  3. Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
ZIP 내려받기
Claude Code에 설치

Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요

클로드스킬마트에서 찾은 스킬을 설치해줘.
GitHub 저장소 daymade/claude-code-skills 의 llm-eval-harness 폴더를 내 ~/.claude/skills/llm-eval-harness/ 에 그대로 복사해줘.
설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.

직접 명령으로 설치하기

git clone https://github.com/daymade/claude-code-skills.git && mkdir -p ~/.claude/skills && cp -r claude-code-skills/llm-eval-harness ~/.claude/skills/

제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.

  1. 터미널을 열고 저장소를 클론합니다: git clone https://github.com/daymade/claude-code-skills.git
  2. 스킬 폴더를 만듭니다: mkdir -p ~/.claude/skills
  3. 이 스킬만 복사합니다: cp -r claude-code-skills/llm-eval-harness ~/.claude/skills/
  4. 스크립트 실행용으로 uv를 설치합니다(미설치 시): curl -LsSf https://astral.sh/uv/install.sh | sh
  5. 테스트할 API 키를 환경변수로 등록합니다: export MY_KEY=sk-... (키 값을 명령줄 인자로 직접 넣지 마세요)
  6. Claude Code를 재시작하고 "이 엔드포인트 속도와 안정성 측정해줘"처럼 base_url과 모델명을 함께 요청하면 스킬이 발동합니다.
  7. (선택) 품질 회귀 테스트용 유스케이스는 ~/.llm-eval/usecases.json에 두세요. assets/example_usecases.json을 복사해 시작하면 됩니다.