Phương pháp tuyển chọn tập dữ liệu
Skill nghiên cứu giúp phân tích mất cân bằng lớp và thiên lệch của tập dữ liệu, chia tách phân tầng, lập kế hoạch mở rộng và kiểm tra đạo đức.
Dữ liệu · Phân tíchTrung cấp★ 368⑂ 31Điểm AI 7/10Cập nhật lần cuối: 3 thg 7, 2026
Làm được gì
Hướng dẫn quy trình 6 bước để xây dựng và làm sạch tập dữ liệu machine learning.
- Phân tích phân phối: đếm mẫu theo lớp, tính tỷ lệ mất cân bằng (max/min), phát hiện lớp hiếm (<5% lớp lớn nhất), lập ma trận đồng xuất hiện nhãn
- Đánh giá thiên lệch: ba câu hỏi — phản ánh thực tế? có gây hại? có sửa được? — cùng các chỉ số công bằng như demographic parity, equalized odds
- Chia tách phân tầng: phân tầng chính theo nhãn + phân tầng phụ theo nguồn để tránh rò rỉ nguồn, kiểm định chi-squared, tỷ lệ chia gợi ý theo kích thước dữ liệu (lớn 80/10/10, nhỏ dùng k-fold)
- Đánh giá chất lượng: độ đồng thuận giữa người gán nhãn qua Cohen's/Fleiss' kappa, Krippendorff's alpha, ước lượng nhiễu nhãn
- Kế hoạch mở rộng: lớp ưu tiên, chiến lược thu thập (active learning, scraping có mục tiêu, tăng cường tổng hợp), ước tính chi phí
- Checklist đạo đức: độ nhạy nội dung, sự đồng thuận, quyền riêng tư, giấy phép, nguy cơ lạm dụng, data card
Khuyến nghị cho ai
- Nghiên cứu sinh, nhà nghiên cứu đang xây dựng hoặc công bố tập dữ liệu cho bài báo
- Kỹ sư ML gặp vấn đề mô hình hoạt động kém với một số nhóm do dữ liệu thiên lệch
- Đội dữ liệu cần báo cáo định lượng về chất lượng gán nhãn
Ví dụ sử dụng
- "Phân tích mất cân bằng lớp của tập dữ liệu ảnh này" → nhận báo cáo số lượng theo lớp, tỷ lệ mất cân bằng, danh sách lớp hiếm và tương quan giả.
- "Chia train/val/test, không để cùng một bộ phim xuất hiện ở nhiều tập" → nhận chiến lược phân tầng kép theo nhãn + nguồn kèm kiểm định chi-squared.
- "Tôi muốn kiểm tra đạo đức trước khi công bố dữ liệu" → nhận checklist đã điền về đồng thuận, quyền riêng tư, giấy phép và hướng viết data card.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/fcakyon/phd-skills/HEAD/plugin/skills/dataset-curation/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục plugin/skills/dataset-curation từ repo GitHub fcakyon/phd-skills vào ~/.claude/skills/dataset-curation/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/fcakyon/phd-skills.git && mkdir -p ~/.claude/skills && cp -r phd-skills/plugin/skills/dataset-curation ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở Terminal (macOS/Linux) hoặc Git Bash (Windows).
- Tải repo:
git clone https://github.com/fcakyon/phd-skills.git - Tạo thư mục skill:
mkdir -p ~/.claude/skills - Sao chép skill:
cp -r phd-skills/plugin/skills/dataset-curation ~/.claude/skills/ - Kiểm tra bằng
ls ~/.claude/skills/dataset-curationxem có file SKILL.md. - Khởi động lại Claude Code và thử câu như "phân tích dataset bias" để skill tự kích hoạt.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT