AI Data Engineering (Pipeline RAG & Feature Store)
Skill hướng dẫn xây dựng hạ tầng dữ liệu cho AI: pipeline RAG, sinh embedding, feature store và điều phối workflow.
Dữ liệu · Phân tíchNâng cao★ 509⑂ 73Điểm AI 9/10Cập nhật lần cuối: 11 thg 12, 2025
Làm được gì
- Định hình kiến trúc RAG 5 giai đoạn: ingestion → indexing → retrieval → generation → evaluation.
- Đưa ra chiến lược chunking mặc định (512 token, overlap 50–100) kèm code cho chunking theo mã nguồn và theo ngữ nghĩa.
- Gợi ý chọn mô hình embedding (voyage-3 cho production, text-embedding-3-small cho dev) với đoạn code khởi tạo sẵn.
- Cung cấp 4 chỉ số RAGAS kèm ngưỡng đạt và script chạy đánh giá.
- Bao gồm mẫu Feast (feature store), Dagster/Prefect/Airflow/dbt, LakeFS và API streaming bằng FastAPI.
Phù hợp với ai
- Kỹ sư backend/ML cần đưa chatbot tra cứu tài liệu hoặc semantic search lên production.
- Đội đã có RAG nhưng chất lượng truy hồi kém, cần tinh chỉnh chunk, embedding, re-rank.
- Data engineer muốn quản lý pipeline embedding dưới dạng asset có lineage.
- Lập trình viên trung–cao cấp quen hệ sinh thái Python + LangChain.
Ví dụ sử dụng
- "Xây chatbot RAG từ 500 file PDF hướng dẫn" → tạo collection Qdrant, chunk 512 token, embed bằng voyage-3, expose API streaming.
- "RAG hay bịa thông tin, tìm nguyên nhân giúp tôi" → đo Faithfulness và Context Precision bằng RAGAS, chỉnh chunk size và k theo ngưỡng 0.8/0.6.
- "Tự động cập nhật embedding hằng ngày" → viết pipeline Dagster gồm 3 asset: raw_documents → chunked_documents → embedded_documents.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/ancoleman/ai-design-components/HEAD/skills/ai-data-engineering/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/ai-data-engineering từ repo GitHub ancoleman/ai-design-components vào ~/.claude/skills/ai-data-engineering/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/ancoleman/ai-design-components.git /tmp/ai-design-components && mkdir -p ~/.claude/skills && cp -r /tmp/ai-design-components/skills/ai-data-engineering ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal (macOS dùng Terminal, Windows dùng Git Bash hoặc WSL).
- Clone kho mã:
git clone https://github.com/ancoleman/ai-design-components.git - Tạo thư mục skill nếu chưa có:
mkdir -p ~/.claude/skills - Sao chép riêng skill này:
cp -r ai-design-components/skills/ai-data-engineering ~/.claude/skills/ - Cài thư viện Python (nên dùng virtualenv):
pip install langchain langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas - Khai báo API key:
export OPENAI_API_KEY=...vàexport VOYAGE_API_KEY=... - Khởi động lại Claude Code và thử yêu cầu "giúp tôi dựng pipeline RAG" để skill tự kích hoạt.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT