클로드스킬마트스킬 둘러보기스킬이 뭐예요?
목록으로

ASR 음성·영상 → 화자별 텍스트 변환

녹음·영상 파일을 화자 라벨과 타임스탬프가 붙은 텍스트로 변환하고, ASR용 오디오 전처리까지 처리하는 스킬입니다.

이미지·영상고급1,323212AI 점수 9/10마지막 업데이트: 2026. 8. 8.

무엇을 해주나

  • 오디오/영상 파일이나 미디어 URL(팟캐스트 페이지 포함)을 받아 [00:12 - 00:30] SPEAKER_01: ... 형식의 화자 구분 텍스트와 CSV로 변환합니다.
  • Apple Silicon 맥에서는 로컬 MLX(Qwen3-ASR + mlx-whisper + pyannote) 로 무료·고속(실시간 대비 15~27배) 처리하고, 그 외 환경에서는 원격 API(vLLM 등)를 사용합니다.
  • 오디오를 자르지 않고 전체를 인식한 뒤 단어 타임스탬프·화자 구간과 사후 정렬하는 WhisperX식 분리형 파이프라인이라 문맥 손실이 적습니다.
  • 전처리 전용 기능도 강력합니다: 16kHz 모노 16bit 리샘플링, 녹음기 다중 파일 병합(DJI TX01/TX02 등), 음정 유지 1.3배속으로 유료 ASR 과금 시간 절감, 목적지별 포맷(wav/m4a/ogg/flac) 자동 선택.
  • 출력 검증(잘림 감지, anchored_ratio 신뢰도), 원격 vLLM의 25MB·600초 제한 등 실전 함정에 대한 해결책이 문서화돼 있습니다.

이런 분께 추천

  • 회의·인터뷰 녹음을 "누가 무슨 말을 했는지"까지 정리해야 하는 분
  • 팟캐스트·강의·유튜브 영상을 검색 가능한 텍스트로 아카이빙하려는 분
  • 맥북(M시리즈)에서 클라우드 업로드 없이 로컬로 처리하고 싶은 분
  • 사내 GPU 서버(vLLM)로 ASR을 운영하며 포맷·용량 제한에 부딪혀 본 분

활용 예시

  1. 2시간 회의 녹음 정리: meeting.m4a를 전달하면 화자별 발언록 .txt.csv가 생성돼, 이어서 요약·액션아이템 추출까지 연결할 수 있습니다.
  2. 녹음기 분할 파일 합치기: TX02_MIC024.wav, TX02_MIC025.wav처럼 30분씩 잘린 파일을 파일명 타임스탬프 순으로 병합하고 길이·이음새 볼륨을 자동 검증합니다.
  3. 유료 ASR 비용 절감: 업로드 전에 M4A로 변환하고 음정 유지 1.3배속을 적용해 파일 크기 약 1/5, 과금 분량 약 23% 절감.

· · · 설치 가이드 · · ·

Claude 앱에 설치 (터미널 필요 없음)
  1. 아래 버튼으로 ZIP 파일을 받으세요.
  2. Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
  3. Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
ZIP 내려받기
Claude Code에 설치

Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요

클로드스킬마트에서 찾은 스킬을 설치해줘.
GitHub 저장소 daymade/claude-code-skills 의 daymade-audio/asr-transcribe-to-text 폴더를 내 ~/.claude/skills/asr-transcribe-to-text/ 에 그대로 복사해줘.
설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.

직접 명령으로 설치하기

git clone https://github.com/daymade/claude-code-skills.git /tmp/daymade-skills && mkdir -p ~/.claude/skills && cp -r /tmp/daymade-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/

제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.

  1. 터미널을 열고 사전 도구를 설치합니다. macOS라면 brew install ffmpeg uv (ffmpeg와 uv는 필수입니다).
  2. 저장소를 내려받습니다.
    git clone https://github.com/daymade/claude-code-skills.git /tmp/daymade-skills
    
  3. 스킬 폴더를 Claude Code 스킬 경로로 복사합니다.
    mkdir -p ~/.claude/skills
    cp -r /tmp/daymade-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/
    
  4. 화자 분리를 쓰려면 HuggingFace에서 https://hf.co/pyannote/speaker-diarization-3.1 약관에 동의한 뒤 huggingface-cli login으로 토큰을 한 번만 등록합니다. (건너뛰면 일반 텍스트만 출력됩니다.)
  5. Claude Code를 재시작하고 "이 녹음 파일 화자별로 텍스트 변환해줘"처럼 요청하면, 첫 실행 시 플랫폼 감지 후 로컬/원격 모드를 물어봅니다.
  6. 첫 장시간 변환 전에는 uv run ~/.claude/skills/asr-transcribe-to-text/scripts/transcribe_local_mlx.py --smoke-test로 동작을 미리 확인하세요.