ASR 음성·영상 → 화자별 텍스트 변환
녹음·영상 파일을 화자 라벨과 타임스탬프가 붙은 텍스트로 변환하고, ASR용 오디오 전처리까지 처리하는 스킬입니다.
이미지·영상고급★ 1,323⑂ 212AI 점수 9/10마지막 업데이트: 2026. 8. 8.
무엇을 해주나
- 오디오/영상 파일이나 미디어 URL(팟캐스트 페이지 포함)을 받아
[00:12 - 00:30] SPEAKER_01: ...형식의 화자 구분 텍스트와 CSV로 변환합니다. - Apple Silicon 맥에서는 로컬 MLX(Qwen3-ASR + mlx-whisper + pyannote) 로 무료·고속(실시간 대비 15~27배) 처리하고, 그 외 환경에서는 원격 API(vLLM 등)를 사용합니다.
- 오디오를 자르지 않고 전체를 인식한 뒤 단어 타임스탬프·화자 구간과 사후 정렬하는 WhisperX식 분리형 파이프라인이라 문맥 손실이 적습니다.
- 전처리 전용 기능도 강력합니다: 16kHz 모노 16bit 리샘플링, 녹음기 다중 파일 병합(DJI TX01/TX02 등), 음정 유지 1.3배속으로 유료 ASR 과금 시간 절감, 목적지별 포맷(wav/m4a/ogg/flac) 자동 선택.
- 출력 검증(잘림 감지,
anchored_ratio신뢰도), 원격 vLLM의 25MB·600초 제한 등 실전 함정에 대한 해결책이 문서화돼 있습니다.
이런 분께 추천
- 회의·인터뷰 녹음을 "누가 무슨 말을 했는지"까지 정리해야 하는 분
- 팟캐스트·강의·유튜브 영상을 검색 가능한 텍스트로 아카이빙하려는 분
- 맥북(M시리즈)에서 클라우드 업로드 없이 로컬로 처리하고 싶은 분
- 사내 GPU 서버(vLLM)로 ASR을 운영하며 포맷·용량 제한에 부딪혀 본 분
활용 예시
- 2시간 회의 녹음 정리:
meeting.m4a를 전달하면 화자별 발언록.txt와.csv가 생성돼, 이어서 요약·액션아이템 추출까지 연결할 수 있습니다. - 녹음기 분할 파일 합치기:
TX02_MIC024.wav,TX02_MIC025.wav처럼 30분씩 잘린 파일을 파일명 타임스탬프 순으로 병합하고 길이·이음새 볼륨을 자동 검증합니다. - 유료 ASR 비용 절감: 업로드 전에 M4A로 변환하고 음정 유지 1.3배속을 적용해 파일 크기 약 1/5, 과금 분량 약 23% 절감.
· · · 설치 가이드 · · ·
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 daymade/claude-code-skills 의 daymade-audio/asr-transcribe-to-text 폴더를 내 ~/.claude/skills/asr-transcribe-to-text/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/daymade/claude-code-skills.git /tmp/daymade-skills && mkdir -p ~/.claude/skills && cp -r /tmp/daymade-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 열고 사전 도구를 설치합니다. macOS라면
brew install ffmpeg uv(ffmpeg와 uv는 필수입니다). - 저장소를 내려받습니다.
git clone https://github.com/daymade/claude-code-skills.git /tmp/daymade-skills - 스킬 폴더를 Claude Code 스킬 경로로 복사합니다.
mkdir -p ~/.claude/skills cp -r /tmp/daymade-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/ - 화자 분리를 쓰려면 HuggingFace에서 https://hf.co/pyannote/speaker-diarization-3.1 약관에 동의한 뒤
huggingface-cli login으로 토큰을 한 번만 등록합니다. (건너뛰면 일반 텍스트만 출력됩니다.) - Claude Code를 재시작하고 "이 녹음 파일 화자별로 텍스트 변환해줘"처럼 요청하면, 첫 실행 시 플랫폼 감지 후 로컬/원격 모드를 물어봅니다.
- 첫 장시간 변환 전에는
uv run ~/.claude/skills/asr-transcribe-to-text/scripts/transcribe_local_mlx.py --smoke-test로 동작을 미리 확인하세요.
GitHub에서 원본 보기 ↗라이선스: MIT