ASR: Chuyển âm thanh/video thành văn bản có nhãn người nói
Chuyển file ghi âm hoặc video thành bản gỡ băng kèm nhãn người nói và dấu thời gian, đồng thời xử lý tiền kỳ âm thanh cho ASR.
Ảnh · VideoNâng cao★ 1,419⑂ 219Điểm AI 9/10Cập nhật lần cuối: 22 thg 9, 2026
Làm được gì
- Nhận file audio/video hoặc URL media và tạo bản gỡ băng dạng
[bắt đầu-kết thúc] SPEAKER_01: nội dung(xuất TXT + CSV). - Tự chọn tuyến chạy: MLX cục bộ trên Mac Apple Silicon (miễn phí, nhanh 15–27 lần thời gian thực) hoặc API từ xa trên nền tảng khác.
- Ghi âm dài trên 30 phút dùng whisper.cpp + Silero VAD, chia khối theo mốc thời gian gốc, lưu checkpoint rồi ghép nhãn người nói từ pyannote sau; chạy lại không phải làm lại từ đầu.
- Tiền xử lý âm thanh là tính năng độc lập: hạ mẫu 16kHz mono 16-bit, ghép nhiều file ghi âm bị cắt khúc, tăng tốc giữ cao độ 1.3x để giảm phút tính phí, chọn định dạng theo đích đến (.wav/.m4a/.ogg/.flac).
- Mỗi lần chạy đều sinh receipt.json ghi hash nguồn, phiên bản mô hình và tham số để kiểm chứng.
Phù hợp với ai
- Người thường xuyên phải gỡ băng họp, phỏng vấn, bài giảng.
- Người dùng Mac chip M muốn xử lý cục bộ vì lý do riêng tư.
- Nhà sáng tạo nội dung cần bản gỡ băng có dấu thời gian để làm phụ đề.
- Ai hay làm việc với máy ghi âm dã ngoại (DJI MIC…) sinh ra nhiều file rời.
Ví dụ sử dụng
- "Gỡ băng cuộc họp mp4 2 tiếng này theo từng người nói" → tách audio → chạy tuyến dài → xuất
meeting.txtvàmeeting.csv. - "Lấy URL tập podcast này, gỡ băng rồi tóm tắt" → trích link media từ trang → tải về → chạy
--no-diarizationrồi tóm tắt. - "Ghép các file rời của máy ghi âm và chuẩn bị định dạng cho ASR" → ghép theo thứ tự thời gian → xuất M4A 16kHz mono, tăng tốc 1.3x để tiết kiệm dung lượng và phút tính phí.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/daymade/claude-code-skills/HEAD/daymade-audio/asr-transcribe-to-text/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục daymade-audio/asr-transcribe-to-text từ repo GitHub daymade/claude-code-skills vào ~/.claude/skills/asr-transcribe-to-text/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/daymade/claude-code-skills.git /tmp/daymade-skills && mkdir -p ~/.claude/skills && cp -r /tmp/daymade-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở Terminal.
- Tải mã nguồn:
git clone https://github.com/daymade/claude-code-skills.git /tmp/daymade-skills - Tạo thư mục skill và sao chép:
mkdir -p ~/.claude/skills && cp -r /tmp/daymade-skills/daymade-audio/asr-transcribe-to-text ~/.claude/skills/ - Cài công cụ cần thiết:
brew install ffmpeg(macOS) hoặcsudo apt install ffmpeg(Linux), và trình chạy Pythonuv:curl -LsSf https://astral.sh/uv/install.sh | sh. - Nếu cần tách người nói: đồng ý điều khoản tại https://hf.co/pyannote/speaker-diarization-3.1 rồi chạy
huggingface-cli loginmột lần duy nhất. - Khởi động lại Claude Code và yêu cầu ví dụ: "gỡ băng file ghi âm này theo từng người nói". Lần chạy đầu sẽ hỏi chế độ (cục bộ/từ xa) và lưu cấu hình lại.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT