벤치마크 검증 체크리스트
성능 수치를 보고하거나 그에 따라 결정하기 전에, 7가지 질문으로 측정 자체가 믿을 만한지 검증해주는 스킬.
개발·코딩중급★ 969⑂ 112AI 점수 9/10마지막 업데이트: 2026. 10. 3.
무엇을 해주나
벤치마크 결과나 "30% 빨라졌다" 같은 주장을 내놓기 직전에, Claude가 측정 자체를 심문하도록 만듭니다.
- 실행 전 준비: 출시 문장 그대로 주장을 먼저 적게 하고, 측정 스크립트가 무엇을 재고 무엇을 무시하는지 읽게 합니다.
uptime,nproc로 머신 상태도 확인합니다. - 7가지 질문: ① 병목(limiter)이 무엇인가 ② 양쪽 모두 프로덕션처럼 튜닝했나 ③ 물리적 한계를 넘지 않았나(디스크·네트워크 대역폭, 코어 수 산술) ④ 에러·실패 응답을 셌나 ⑤ 재현되나(A,B,A,B 교차 5회 이상, 중앙값과 범위) ⑥ 사용자가 체감하는 전체 경로에서 의미가 있나 ⑦ 애초에 그 작업이 타임드 구간 안에서 실제로 실행됐나.
- 보고 형식: 결론(빠름/느림/차이 없음/판단 불가)을 먼저, 그다음 단위·실행 횟수·범위·병목을 함께 적게 합니다. 병목을 못 짚거나 한쪽이 튜닝되지 않았으면 "판단 불가"로 선언하게 합니다.
이런 분께 추천
- PR에 before/after 수치를 첨부하는 백엔드·인프라 개발자
- 성능 회귀 이슈를 조사하거나 라이브러리·설정을 비교 선택하는 팀
- AI가 만든 "최적화했습니다" 주장을 그대로 믿기 어려운 사람
활용 예시
- "JSON 파서를 교체했더니 export가 30% 빨라졌다"는 결과를 검증 → 전체 요청에서 파싱 비중이 1%뿐이라 체감 효과가 없음을 밝혀냄.
- 두 ORM 벤치마크 비교 → 한쪽이 디버그 빌드/행 단위 커밋이라 "구현이 아니라 설정을 비교했다"고 지적하고 재측정 요구.
- 캐시 때문에 디스크 대역폭 한계를 넘는 수치가 나왔을 때, 산술로 즉시 "작업이 실제로 일어나지 않았다"를 탐지.
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/michael-denyer/pstack-claude/HEAD/plugins/pstack/skills/benchmark-checklist/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 michael-denyer/pstack-claude 의 plugins/pstack/skills/benchmark-checklist 폴더를 내 ~/.claude/skills/benchmark-checklist/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/michael-denyer/pstack-claude.git /tmp/pstack-claude && mkdir -p ~/.claude/skills && cp -r /tmp/pstack-claude/plugins/pstack/skills/benchmark-checklist ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 엽니다.
- 저장소를 내려받습니다:
git clone https://github.com/michael-denyer/pstack-claude.git - 스킬 폴더를 만듭니다:
mkdir -p ~/.claude/skills - 스킬을 복사합니다:
cp -r pstack-claude/plugins/pstack/skills/benchmark-checklist ~/.claude/skills/ - (권장) 본문이 참조하는
principle-explain-the-number, Perf issue·Hillclimb 플레이북도 함께 쓰려면cp -r pstack-claude/plugins/pstack/skills/* ~/.claude/skills/로 전체 복사하세요. - Claude Code를 재시작하고 "방금 벤치마크 돌렸는데 결과 검증해줘"처럼 요청하면 스킬이 발동합니다.
- 프로파일링 질문을 제대로 쓰려면
perf,py-spy,strace,pidstat같은 도구를 미리 설치해두세요.
GitHub에서 원본 보기 ↗라이선스: MIT