Claude Skill MartKhám phá skillSkill là gì?
Về danh sách

Phân tích Dữ liệu Khám phá (EDA)

Skill lập hồ sơ dữ liệu khoa học cục bộ đã được cấp phép, kiểm tra thiếu dữ liệu, rò rỉ và ngoại lai trong một ranh giới an toàn nghiêm ngặt.

Dữ liệu · Phân tíchTrung cấp33,0303,248Điểm AI 9/10Cập nhật lần cuối: 9 thg 8, 2026

Skill này làm gì

Kiểm tra các tệp dữ liệu cục bộ đã được cấp phép trước khi mô hình hóa hay phân tích khẳng định.

  • Hỗ trợ lõi tự động: hồ sơ/lược đồ CSV/TSV, kiểm toán thiếu dữ liệu / nhóm / phân tách, độ nhạy phân phối–ngoại lai–biến đổi, kiểm tra cấu trúc JSON ở chế độ nghiêm ngặt
  • Hỗ trợ tùy chọn: NumPy (.npy/.npz), metadata HDF5, đọc luồng FASTA/FASTQ, metadata container PNG/JPEG/TIFF
  • Quy tắc an toàn: không gọi mạng, không dùng pickle, dữ liệu gốc chỉ đọc, không in hàng thô/chuỗi/định danh (được token hóa), định dạng lạ thì dừng hẳn (fail-closed)
  • Khung báo cáo: sinh mẫu Markdown để điền giả định, phân tích độ nhạy và giới hạn

Skill kèm một danh sách kiểm tra tư duy EDA: từ điển biến, đơn vị quan sát, cấu trúc lô/thiết bị, mã thiếu dữ liệu, ranh giới train/val/test — giúp tránh rò rỉ dữ liệu và kết luận nhân quả vội vàng.

Phù hợp với ai

  • Nhà nghiên cứu xử lý dữ liệu thí nghiệm/lâm sàng cần khả năng tái lập và dấu vết kiểm toán
  • Data scientist muốn phát hiện rò rỉ (trùng đối tượng giữa train/test) trước khi huấn luyện
  • Người phân tích trong môi trường không được để lộ định danh hoặc metadata nhạy cảm
  • Nhóm làm việc với nhiều định dạng khoa học và cần định tuyến công cụ phù hợp

Ví dụ sử dụng

  1. Kiểm tra CSV lâm sàng: chạy missingness_leakage_audit.py với --entity-column subject_id --split-column split để phát hiện một đối tượng xuất hiện ở cả tập huấn luyện lẫn kiểm thử.
  2. Xem xét phân phối biến đo: dùng distribution_sensitivity.py để so sánh trung bình/SD với trung vị/IQR/MAD và xem ảnh hưởng của ngoại lai, mà không sửa dữ liệu.
  3. Đọc metadata ảnh hiển vi: image_inspector.py trên tệp OME-TIFF chỉ lấy page/series/axes/dtype, không giải mã pixel.

· · · Hướng dẫn cài đặt · · ·

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục skills/exploratory-data-analysis từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/exploratory-data-analysis/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/K-Dense-AI/scientific-agent-skills.git /tmp/scientific-agent-skills && mkdir -p ~/.claude/skills && cp -r /tmp/scientific-agent-skills/skills/exploratory-data-analysis ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở terminal.
  2. Tải mã nguồn: git clone https://github.com/K-Dense-AI/scientific-agent-skills.git
  3. Tạo thư mục skill: mkdir -p ~/.claude/skills
  4. Sao chép skill: cp -r scientific-agent-skills/skills/exploratory-data-analysis ~/.claude/skills/
  5. Kiểm tra Python 3.11 trở lên: python3 --version (phần lõi CSV/TSV/JSON chỉ dùng thư viện chuẩn).
  6. Nếu cần kiểm tra NumPy/HDF5/FASTA/ảnh, hãy cài Python 3.12+ và uv, rồi cài đúng thứ cần: uv pip install numpy h5py biopython pillow tifffile (các phiên bản ghim trong SKILL.md chỉ mang tính tham khảo).
  7. Tạo một thư mục dữ liệu được cấp phép riêng (ví dụ ~/approved-project); mọi lệnh đều truyền đường dẫn này qua --root.
  8. Khởi động lại Claude Code và yêu cầu ví dụ: "Hãy chạy EDA cho tệp CSV này".