Claude Skill MartKhám phá skillSkill là gì?
Về danh sách

PyTDC – Therapeutics Data Commons

Kỹ năng giúp khám phá và sử dụng an toàn dataset, cách chia tập, metric, benchmark và oracle của Therapeutics Data Commons qua gói PyTDC.

Dữ liệu · Phân tíchNâng cao33,0303,248Điểm AI 7/10Cập nhật lần cuối: 9 thg 8, 2026

Làm được gì

Hướng dẫn toàn bộ quy trình làm việc với Therapeutics Data Commons của Harvard thông qua gói PyTDC (ghim bản 1.1.15).

  • Khám phá metadata mà không tải dữ liệu: discover_metadata.py liệt kê task, dataset, benchmark, evaluator, oracle
  • Chia tập đúng theo task: random, scaffold, cold_split, combination, time kèm cảnh báo rằng scaffold không đảm bảo loại bỏ rò rỉ dữ liệu
  • Dùng tên metric chính xác: PCC, ROC-AUC, micro-f1, kappa… theo registry thật
  • Benchmark group: dùng lớp chuyên biệt như admet_group, và quy tắc cần ít nhất 5 bộ dự đoán cho evaluate_many
  • Oracle phân tử: cho phép chấm điểm cục bộ (QED), chủ động từ chối oracle từ xa/docking/composite
  • Chính sách mạng & lưu trữ: bắt buộc trình tự khám phá → lập kế hoạch → xin phép người dùng → --execute, kiểm tra cache bằng cache_audit.py

Phù hợp với ai

  • Nghiên cứu sinh, nhà nghiên cứu ML dược phẩm (ADMET, DTI, DDI, sinh phân tử)
  • Nhóm cần rà soát trước giấy phép dataset và dung lượng tải về theo quy định nội bộ
  • Người muốn ngăn agent AI tự ý tải dữ liệu lớn hoặc gửi cấu trúc phân tử ra ngoài

Ví dụ sử dụng

  1. "Liệt kê các dataset thuộc task ADME, đừng tải gì cả" → chạy discover_metadata.py --kind datasets --task ADME và tóm tắt tên + số lượng
  2. "Chuẩn bị Caco2_Wang với scaffold split, seed 42" → trình bày kế hoạch (giấy phép, dung lượng, thư mục cache) rồi chỉ tải khi được duyệt bằng --execute
  3. "Đánh giá dự đoán của tôi theo leaderboard ADMET" → kiểm tra định dạng JSON dự đoán, xin phép tải archive admet_group, rồi tổng hợp theo đúng quy tắc evaluate_many

· · · Hướng dẫn cài đặt · · ·

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục skills/pytdc từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/pytdc/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/pytdc ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở terminal và tải repo: git clone https://github.com/K-Dense-AI/scientific-agent-skills.git
  2. Tạo thư mục skill và copy: mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/pytdc ~/.claude/skills/
  3. Cài uv nếu chưa có: curl -LsSf https://astral.sh/uv/install.sh | sh
  4. Tạo môi trường ảo riêng: uv venv --python 3.11 .venv-pytdc
  5. Xem trước quy mô cài đặt: uv pip install --dry-run --python .venv-pytdc/bin/python "setuptools==80.9.0" "PyTDC==1.1.15" (khoảng 120 gói, vài trăm MB)
  6. Kiểm tra dung lượng ổ đĩa rồi cài thật (bỏ --dry-run).
  7. Khởi động lại Claude Code và thử: "dùng skill pytdc liệt kê dataset ADME".
  8. Chỉ tải dữ liệu thật sau khi xem kế hoạch và đồng ý dùng --execute (thêm --download cho checkpoint oracle).