Trình tổng hợp giọng thuyết minh video
Biến file narration.json có mốc thời gian thành từng đoạn audio TTS khớp đúng khung thời gian, kèm metadata tts_meta.json để ghép vào video.
Ảnh · VideoTrung cấp★ 529⑂ 97Điểm AI 7/10Cập nhật lần cuối: 21 thg 9, 2026
Làm được gì
- Đọc
narration.json(mỗi đoạn cóstart,end,narration) và tạo một file WAV riêng cho từng đoạn. - Tự điều chỉnh tốc độ đọc và chuẩn hóa âm lượng để giọng vừa khít khung thời gian đầu ra.
- Xuất
tts_segments/*.wavvàtts_meta.json(engine, đường dẫn audio, thời gian,pause_after_ms, trạng thái partial/failures). - Hỗ trợ MiMo TTS (mặc định), Fish Audio (
s2.1-pro-free) hoặc endpoint IndexTTS tự host (phải chọn tường minh). - Cache thông minh: chỉ tái tạo những đoạn bị ảnh hưởng khi bạn sửa lời hoặc đổi tham số.
- Chế độ
--preserve-approved-textkhông tự cắt bớt bản lời đã duyệt mà báo lỗi kèm bằng chứng thời lượng.
Phù hợp với ai
- Người làm video recap/review cần lồng tiếng tự động theo timeline.
- Người đã có API key MiMo hoặc Fish Audio.
- Nhóm cần cổng kiểm tra chất lượng lồng tiếng (dòng trống, chồng lấn, vượt khung).
Ví dụ sử dụng
python3 scripts/voiceover.py --work-dir work --narration work/narration.jsonđể sinh toàn bộ đoạn giọng.- Đặt
TTS_PROVIDER=fish-audiovàFISH_API_KEYđể chuyển sang Fish Audio khi không có key MiMo. - Dùng
--preserve-approved-textcho kịch bản đã duyệt: nếu giọng dài hơn khung, lệnh báo lỗi chi tiết thay vì tự rút gọn.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/zenstory-ai/video-recap-skills/HEAD/skills/video-voiceover/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/video-voiceover từ repo GitHub zenstory-ai/video-recap-skills vào ~/.claude/skills/video-voiceover/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/zenstory-ai/video-recap-skills.git && mkdir -p ~/.claude/skills && cp -r video-recap-skills/skills/video-voiceover ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và vào thư mục làm việc của bạn.
- Tải mã nguồn:
git clone https://github.com/zenstory-ai/video-recap-skills.git - Tạo thư mục skill:
mkdir -p ~/.claude/skills - Sao chép skill:
cp -r video-recap-skills/skills/video-voiceover ~/.claude/skills/ - Kiểm tra đã có Python 3 và công cụ xử lý audio (ffmpeg).
- Khai báo khóa API:
export MIMO_API_KEY=...hoặcexport TTS_PROVIDER=fish-audio; export FISH_API_KEY=... - Khởi động lại Claude Code rồi yêu cầu "lồng tiếng cho narration.json này" để kích hoạt skill.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT