PyTDC – Therapeutics Data Commons
Kỹ năng giúp khám phá và sử dụng an toàn dataset, cách chia tập, metric, benchmark và oracle của Therapeutics Data Commons qua gói PyTDC.
Dữ liệu · Phân tíchNâng cao★ 33,030⑂ 3,248Điểm AI 7/10Cập nhật lần cuối: 9 thg 8, 2026
Làm được gì
Hướng dẫn toàn bộ quy trình làm việc với Therapeutics Data Commons của Harvard thông qua gói PyTDC (ghim bản 1.1.15).
- Khám phá metadata mà không tải dữ liệu:
discover_metadata.pyliệt kê task, dataset, benchmark, evaluator, oracle - Chia tập đúng theo task:
random,scaffold,cold_split,combination,timekèm cảnh báo rằng scaffold không đảm bảo loại bỏ rò rỉ dữ liệu - Dùng tên metric chính xác:
PCC,ROC-AUC,micro-f1,kappa… theo registry thật - Benchmark group: dùng lớp chuyên biệt như
admet_group, và quy tắc cần ít nhất 5 bộ dự đoán choevaluate_many - Oracle phân tử: cho phép chấm điểm cục bộ (QED), chủ động từ chối oracle từ xa/docking/composite
- Chính sách mạng & lưu trữ: bắt buộc trình tự khám phá → lập kế hoạch → xin phép người dùng →
--execute, kiểm tra cache bằngcache_audit.py
Phù hợp với ai
- Nghiên cứu sinh, nhà nghiên cứu ML dược phẩm (ADMET, DTI, DDI, sinh phân tử)
- Nhóm cần rà soát trước giấy phép dataset và dung lượng tải về theo quy định nội bộ
- Người muốn ngăn agent AI tự ý tải dữ liệu lớn hoặc gửi cấu trúc phân tử ra ngoài
Ví dụ sử dụng
- "Liệt kê các dataset thuộc task ADME, đừng tải gì cả" → chạy
discover_metadata.py --kind datasets --task ADMEvà tóm tắt tên + số lượng - "Chuẩn bị Caco2_Wang với scaffold split, seed 42" → trình bày kế hoạch (giấy phép, dung lượng, thư mục cache) rồi chỉ tải khi được duyệt bằng
--execute - "Đánh giá dự đoán của tôi theo leaderboard ADMET" → kiểm tra định dạng JSON dự đoán, xin phép tải archive
admet_group, rồi tổng hợp theo đúng quy tắcevaluate_many
· · · Hướng dẫn cài đặt · · ·
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/pytdc từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/pytdc/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/pytdc ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và tải repo:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Tạo thư mục skill và copy:
mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/pytdc ~/.claude/skills/ - Cài
uvnếu chưa có:curl -LsSf https://astral.sh/uv/install.sh | sh - Tạo môi trường ảo riêng:
uv venv --python 3.11 .venv-pytdc - Xem trước quy mô cài đặt:
uv pip install --dry-run --python .venv-pytdc/bin/python "setuptools==80.9.0" "PyTDC==1.1.15"(khoảng 120 gói, vài trăm MB) - Kiểm tra dung lượng ổ đĩa rồi cài thật (bỏ
--dry-run). - Khởi động lại Claude Code và thử: "dùng skill pytdc liệt kê dataset ADME".
- Chỉ tải dữ liệu thật sau khi xem kế hoạch và đồng ý dùng
--execute(thêm--downloadcho checkpoint oracle).
Xem mã nguồn trên GitHub ↗Giấy phép: MIT