오토리서치 에이전트 (자율 실험 루프)
측정 가능한 지표를 기준으로 파일 하나를 반복 수정·평가하며 개선분만 남기는 자율 실험 루프 스킬.
자동화·워크플로고급★ 24,151⑂ 3,405AI 점수 8/10마지막 업데이트: 2026. 8. 9.
무엇을 해주나
Karpathy의 autoresearch에서 영감을 받은 자율 최적화 루프입니다. 사용자가 (1) 최적화할 대상 파일, (2) 지표를 출력하는 평가 명령, (3) git 저장소를 준비하면, 에이전트가 다음을 무한 반복합니다.
- 실험 기록(
results.tsv)을 읽고 아직 시도하지 않은 아이디어를 고른다 - 대상 파일에 한 번에 하나의 변경만 적용하고 커밋
- 평가 스크립트를 실행해 지표를 측정
- 개선되면 커밋 유지(KEEP), 나빠지면
git reset --hard로 폐기(DISCARD), 오류는 CRASH로 기록
/ar:setup, /ar:run, /ar:loop, /ar:status, /ar:resume 슬래시 커맨드와 속도·용량·메모리·테스트 통과율용 무료 평가기, 헤드라인·프롬프트·카피용 LLM 심판 평가기가 함께 제공됩니다. 10회마다 결과 패턴을 분석해 전략 문서(program.md)를 스스로 갱신하는 자기개선 루프도 포함됩니다.
이런 분께 추천
- 벤치마크 수치를 붙잡고 며칠씩 튜닝해야 하는 백엔드/성능 엔지니어
- 번들 크기, 빌드 시간, Docker 이미지 용량을 조금씩 깎아야 하는 인프라 담당자
- A/B 테스트처럼 제목·광고 카피·시스템 프롬프트를 수십 개 변형해 점수로 비교하고 싶은 마케터/프롬프트 엔지니어
- 밤새 에이전트를 돌려놓고 아침에 결과 대시보드만 확인하고 싶은 사람
활용 예시
- API 지연 줄이기:
src/api/search.py를 대상으로pytest bench.py의p50_ms를 낮추는 실험을 47회 돌려 185ms까지 단축 - 프런트엔드 번들 다이어트:
benchmark_size평가기로size_bytes를 지표로 삼아 빌드 산출물 용량을 반복 축소 - 블로그 제목 CTR 개선:
content/titles.md를 대상으로llm_judge_content평가기가 매기는 0~10점 CTR 점수를 높이는 방향으로 제목 변형을 자동 탐색
· · · 설치 가이드 · · ·
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 alirezarezvani/claude-skills 의 .gemini/skills/autoresearch-agent 폴더를 내 ~/.claude/skills/autoresearch-agent/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/alirezarezvani/claude-skills.git && mkdir -p ~/.claude/skills && cp -r claude-skills/.gemini/skills/autoresearch-agent ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 열고 저장소를 클론합니다:
git clone https://github.com/alirezarezvani/claude-skills.git - 스킬 폴더를 Claude Code 스킬 경로로 복사합니다:
mkdir -p ~/.claude/skills && cp -r claude-skills/.gemini/skills/autoresearch-agent ~/.claude/skills/ - 최적화하려는 프로젝트 폴더에서 Claude Code를 실행합니다. 해당 폴더는 반드시 git 저장소여야 합니다(
git init후 최초 커밋 완료). - 작업 중인 변경사항은 미리 커밋하거나 stash 하고, 실험용 브랜치를 만들어 둡니다:
git checkout -b autoresearch/engineering/api-speed - Claude에게 "이 파일을 (지표) 기준으로 최적화하는 autoresearch 실험을 세팅해줘"라고 요청하거나
/ar:setup을 실행합니다. - 평가 명령이 실제로
지표명: 값형태를 출력하는지--dry-run으로 먼저 확인합니다. - 확인이 끝나면
/ar:run으로 1회 돌려보고, 문제가 없으면/ar:loop으로 자율 루프를 시작합니다. 진행 상황은/ar:status로 확인하세요.
GitHub에서 원본 보기 ↗라이선스: MIT