ASR 음성·영상 → 화자 구분 텍스트 변환
오디오·영상을 화자 라벨과 타임스탬프가 붙은 텍스트로 전사하며, Apple Silicon 로컬(MLX/whisper.cpp)과 원격 API 경로를 모두 지원합니다.
이미지·영상고급★ 1,425⑂ 219AI 점수 9/10마지막 업데이트: 2026. 9. 23.
무엇을 해주나
- 오디오/영상 파일, 미디어 URL, 팟캐스트 페이지를 입력받아
[시작-끝] SPEAKER_00: 내용형식의 TXT와 CSV를 생성합니다. - 30분 이상 긴 녹음은 whisper.cpp + Silero VAD로 블록 단위 체크포인트 전사 후 pyannote 화자 분리를 후처리로 결합합니다(중단 시 이어서 실행).
- 짧은/중간 길이는 Qwen3-ASR(MLX) + mlx-whisper 단어 타임스탬프 정렬 경로를 사용하고, 원격 vLLM 엔드포인트의 순수 텍스트 결과에 로컬에서 화자를 붙일 수도 있습니다.
- 전사 전 전처리도 담당합니다: 녹음기 분할 파일 병합, 16kHz 모노 변환, 음정 유지 배속(과금형 ASR 비용 절감), 포맷 선택(wav/m4a/ogg/flac) 및 결과 자체 검증.
- 이미 검증된 전사본이 있으면 재생성하지 않도록 먼저 확인하는 규칙과, 飞书妙记(Feishu Minutes) 업로드 경로도 포함합니다.
이런 분께 추천
- 회의록·인터뷰·현장 녹음을 화자별로 정리해야 하는 실무자
- 개인정보·오프라인 요구로 클라우드 전사를 쓸 수 없는 macOS(Apple Silicon) 사용자
- 자체 호스팅 vLLM/ASR 서버를 운영하며 긴 녹음을 안정적으로 배치 처리하려는 엔지니어
활용 예시
- 2시간 회의 WAV를 넣어 블록 체크포인트로 전사하고 SPEAKER 라벨이 붙은 TXT/CSV를 받기.
- DJI 마이크가 30분 단위로 쪼갠 파일들을 하나로 병합하고 1.3배속 M4A로 줄여 과금형 클라우드 ASR에 업로드하기.
- 팟캐스트 에피소드 URL을 주고 미디어를 내려받아 화자 없이 순수 텍스트로 요약용 전사만 얻기.
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/daymade/claude-code-skills/HEAD/daymade-audio/asr-transcribe-to-text/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 daymade/claude-code-skills 의 daymade-audio/asr-transcribe-to-text 폴더를 내 ~/.claude/skills/asr-transcribe-to-text/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/daymade/claude-code-skills.git && mkdir -p ~/.claude/skills && cp -r claude-code-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 열고 원하는 작업 폴더로 이동합니다.
- 저장소를 내려받습니다:
git clone https://github.com/daymade/claude-code-skills.git - 스킬 폴더를 복사합니다:
mkdir -p ~/.claude/skills && cp -r claude-code-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/ - 필수 도구를 설치합니다:
brew install ffmpeg uv(ffmpeg, ffprobe, uv 필요). - 화자 분리를 쓰려면 https://hf.co/pyannote/speaker-diarization-3.1 에서 약관에 동의한 뒤
huggingface-cli login(또는HF_TOKEN환경변수)을 한 번만 설정합니다. - 긴 녹음(Path L)을 쓸 경우 whisper.cpp 바이너리와 ggml 모델, Silero VAD 모델 파일을 미리 내려받아 경로를 확인해 둡니다.
- Claude Code를 재시작하고 "이 녹음 파일 화자 구분해서 전사해줘"처럼 파일 경로와 함께 요청하면 됩니다. 첫 실행 시 로컬/원격 모드 선택 질문에 답하면 설정이 저장됩니다.
GitHub에서 원본 보기 ↗라이선스: MIT