Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
Về danh sách

Phân tích dữ liệu khám phá (chế độ an toàn)

Kỹ năng lập hồ sơ dữ liệu khoa học cục bộ trong phạm vi giới hạn, kiểm tra thiếu dữ liệu/rò rỉ/ngoại lai và tạo khung báo cáo EDA mà không lộ dữ liệu gốc.

Dữ liệu · Phân tíchNâng cao33,0303,248Điểm AI 9/10Cập nhật lần cuối: 9 thg 8, 2026

Kỹ năng này làm gì

  • Tạo báo cáo lược đồ và hồ sơ có giới hạn cho CSV/TSV/JSON chỉ bằng thư viện chuẩn Python.
  • Kiểm tra mẫu thiếu dữ liệu, trùng lặp giữa các tập train/test và nguy cơ rò rỉ theo thời gian hoặc theo nhóm.
  • So sánh trung bình/độ lệch chuẩn với trung vị/IQR/MAD, đánh giá độ nhạy với ngoại lai và phép biến đổi — không bao giờ tự động xóa, điền hay chuẩn hóa dữ liệu.
  • Tùy chọn kiểm tra siêu dữ liệu của NumPy (.npy/.npz), HDF5, FASTA/FASTQ, PNG/JPEG/TIFF mà không giải mã pixel hay in chuỗi gốc.
  • Sinh khung báo cáo Markdown để bạn điền giả định, phân tích độ nhạy và giới hạn.
  • Định dạng không nằm trong danh sách hỗ trợ sẽ bị từ chối (fail closed); mọi văn bản trong tệp được coi là dữ liệu không tin cậy, không thực thi.

Phù hợp với ai

  • Nhà nghiên cứu y sinh, hình ảnh học hoặc lâm sàng cần khám phá dữ liệu nhạy cảm mà không để lộ định danh.
  • Nhà khoa học dữ liệu cần rà soát rò rỉ và ranh giới chia tập trước khi mô hình hóa.
  • Nhóm cần quy trình EDA có thể tái lập và kiểm toán.

Ví dụ sử dụng

  1. Chạy python scripts/capability_manifest.py inspect data.csv --root /approved/project để xác nhận định dạng được hỗ trợ trước khi phân tích.
  2. Dùng missingness_leakage_audit.py với --entity-column subject_id --split-column split để phát hiện cùng một đối tượng xuất hiện ở cả train lẫn test.
  3. Dùng distribution_sensitivity.py --column measurement để xem ngoại lai ảnh hưởng ra sao và có nên biến đổi log không.
  4. Dùng report_scaffold.py để tạo bản nháp báo cáo EDA đã ẩn danh.

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/K-Dense-AI/scientific-agent-skills/HEAD/skills/exploratory-data-analysis/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục skills/exploratory-data-analysis từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/exploratory-data-analysis/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/exploratory-data-analysis ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở terminal và chuyển tới thư mục làm việc của bạn.
  2. Tải kho mã: git clone https://github.com/K-Dense-AI/scientific-agent-skills.git
  3. Tạo thư mục kỹ năng: mkdir -p ~/.claude/skills
  4. Sao chép kỹ năng: cp -r scientific-agent-skills/skills/exploratory-data-analysis ~/.claude/skills/
  5. Kiểm tra Python: python3 --version (cần 3.11+, và 3.12+ cho các trình kiểm tra tùy chọn).
  6. Nếu cần các định dạng mở rộng: uv pip install "numpy==2.5.1" "h5py==3.16.0" "biopython==1.87" "pillow==12.3.0" "tifffile==2026.7.14"
  7. Chuẩn bị một thư mục gốc đã được phê duyệt (ví dụ /approved/project) và chỉ đặt bản sao dữ liệu vào đó.
  8. Khởi động lại Claude Code và yêu cầu ví dụ: "Kiểm tra thiếu dữ liệu và rò rỉ trong tệp CSV này".