doc-parse (Phân tích tài liệu đa định dạng)
Chuyển PDF/PPT/Excel/Word thành Markdown có cấu trúc, kèm metadata và điểm tin cậy của quá trình bóc tách.
Tài liệu · Văn phòngTrung cấp★ 6,083⑂ 585Điểm AI 8/10Cập nhật lần cuối: 2 thg 9, 2026
Làm được gì
- Nhận đường dẫn file cục bộ và chuyển PDF/PPT/Excel/Word thành Markdown có cấu trúc.
- Xuất kèm metadata (tiêu đề, số trang, số bảng, tác giả) và điểm tin cậy 0–1.
- Cơ chế fallback ba tầng: MinerU (giữ layout tốt nhất) → PyMuPDF (đọc PDF nhanh) → pdfplumber (trích bảng/text dự phòng), đồng thời báo parser nào được dùng (
fallback_used). - Nếu cả ba tầng thất bại, skill không trả kết quả dở dang mà đánh dấu
cần người can thiệp(BLOCKED). File quá lớn được chia khối để tránh tràn bộ nhớ; khối lỗi chỉ bị gắn độ tin cậy thấp.
Phù hợp với ai
- Người xây pipeline RAG hoặc knowledge base nội bộ cần chuẩn hoá tài liệu nhiều định dạng.
- Người cần bóc tách hợp đồng, báo cáo nhiều bảng biểu mà vẫn giữ cấu trúc.
- Data/AI engineer muốn dùng điểm tin cậy để lọc ra tài liệu cần người kiểm tra lại.
Ví dụ sử dụng
- Đưa vào bản kế hoạch PDF 100 trang → nhận Markdown giữ nguyên bảng + metadata số bảng, dùng ngay cho bước chunking RAG.
- Với file PPT scan chất lượng kém → MinerU thất bại, tự hạ xuống pdfplumber, confidence 0.4 nên được đẩy vào hàng chờ kiểm tra thủ công.
- Chạy
python skills/doc-parse/scripts/run_doc_parse.pyđể sinhexamples/snse_survey/skill_outputs/doc_parse.jsoncho bước xử lý tiếp theo.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/anbeime/skill/HEAD/antinet-agentteams/skills/doc-parse/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục antinet-agentteams/skills/doc-parse từ repo GitHub anbeime/skill vào ~/.claude/skills/doc-parse/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/anbeime/skill.git && mkdir -p ~/.claude/skills && cp -r skill/antinet-agentteams/skills/doc-parse ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và clone repo:
git clone https://github.com/anbeime/skill.git - Tạo thư mục skill:
mkdir -p ~/.claude/skills - Copy riêng skill này:
cp -r skill/antinet-agentteams/skills/doc-parse ~/.claude/skills/ - Cài thư viện phụ thuộc:
pip install pymupdf pdfplumber python-magic(muốn phục hồi layout tốt thì cài thêm MinerU). - Khởi động lại Claude Code, thử yêu cầu "phân tích file PDF này thành Markdown" để kiểm tra skill đã nhận.
- Nếu muốn dùng script kèm theo, hãy chạy
python skills/doc-parse/scripts/run_doc_parse.pytừ gốc repo đã clone để chắc chắn đường dẫn hợp lệ.