클로드스킬마트스킬 둘러보기바로 쓰는 문장영상으로 배우기터미널 사용법스킬이 뭐예요?
목록으로

ASR 음성·영상 → 화자 구분 텍스트 변환

오디오·영상을 화자 라벨과 타임스탬프가 붙은 텍스트로 전사하며, Apple Silicon 로컬(MLX/whisper.cpp)과 원격 API 경로를 모두 지원합니다.

이미지·영상고급1,425219AI 점수 9/10마지막 업데이트: 2026. 9. 23.

무엇을 해주나

  • 오디오/영상 파일, 미디어 URL, 팟캐스트 페이지를 입력받아 [시작-끝] SPEAKER_00: 내용 형식의 TXT와 CSV를 생성합니다.
  • 30분 이상 긴 녹음은 whisper.cpp + Silero VAD로 블록 단위 체크포인트 전사 후 pyannote 화자 분리를 후처리로 결합합니다(중단 시 이어서 실행).
  • 짧은/중간 길이는 Qwen3-ASR(MLX) + mlx-whisper 단어 타임스탬프 정렬 경로를 사용하고, 원격 vLLM 엔드포인트의 순수 텍스트 결과에 로컬에서 화자를 붙일 수도 있습니다.
  • 전사 전 전처리도 담당합니다: 녹음기 분할 파일 병합, 16kHz 모노 변환, 음정 유지 배속(과금형 ASR 비용 절감), 포맷 선택(wav/m4a/ogg/flac) 및 결과 자체 검증.
  • 이미 검증된 전사본이 있으면 재생성하지 않도록 먼저 확인하는 규칙과, 飞书妙记(Feishu Minutes) 업로드 경로도 포함합니다.

이런 분께 추천

  • 회의록·인터뷰·현장 녹음을 화자별로 정리해야 하는 실무자
  • 개인정보·오프라인 요구로 클라우드 전사를 쓸 수 없는 macOS(Apple Silicon) 사용자
  • 자체 호스팅 vLLM/ASR 서버를 운영하며 긴 녹음을 안정적으로 배치 처리하려는 엔지니어

활용 예시

  1. 2시간 회의 WAV를 넣어 블록 체크포인트로 전사하고 SPEAKER 라벨이 붙은 TXT/CSV를 받기.
  2. DJI 마이크가 30분 단위로 쪼갠 파일들을 하나로 병합하고 1.3배속 M4A로 줄여 과금형 클라우드 ASR에 업로드하기.
  3. 팟캐스트 에피소드 URL을 주고 미디어를 내려받아 화자 없이 순수 텍스트로 요약용 전사만 얻기.

· · · 설치 가이드 · · ·

설치 없이 지금 한 번 써보기

아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.

이 파일의 지시를 읽고 그대로 따라서 나를 도와줘:
https://raw.githubusercontent.com/daymade/claude-code-skills/HEAD/daymade-audio/asr-transcribe-to-text/SKILL.md

내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)

Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.

쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.

Claude 앱에 설치 (터미널 필요 없음)
  1. 아래 버튼으로 ZIP 파일을 받으세요.
  2. Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
  3. Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
ZIP 내려받기
Claude Code에 설치

Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요

클로드스킬마트에서 찾은 스킬을 설치해줘.
GitHub 저장소 daymade/claude-code-skills 의 daymade-audio/asr-transcribe-to-text 폴더를 내 ~/.claude/skills/asr-transcribe-to-text/ 에 그대로 복사해줘.
설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.

직접 명령으로 설치하기

git clone https://github.com/daymade/claude-code-skills.git && mkdir -p ~/.claude/skills && cp -r claude-code-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/

제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.

  1. 터미널을 열고 원하는 작업 폴더로 이동합니다.
  2. 저장소를 내려받습니다: git clone https://github.com/daymade/claude-code-skills.git
  3. 스킬 폴더를 복사합니다: mkdir -p ~/.claude/skills && cp -r claude-code-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/
  4. 필수 도구를 설치합니다: brew install ffmpeg uv (ffmpeg, ffprobe, uv 필요).
  5. 화자 분리를 쓰려면 https://hf.co/pyannote/speaker-diarization-3.1 에서 약관에 동의한 뒤 huggingface-cli login(또는 HF_TOKEN 환경변수)을 한 번만 설정합니다.
  6. 긴 녹음(Path L)을 쓸 경우 whisper.cpp 바이너리와 ggml 모델, Silero VAD 모델 파일을 미리 내려받아 경로를 확인해 둡니다.
  7. Claude Code를 재시작하고 "이 녹음 파일 화자 구분해서 전사해줘"처럼 파일 경로와 함께 요청하면 됩니다. 첫 실행 시 로컬/원격 모드 선택 질문에 답하면 설정이 저장됩니다.