Quy trình PyTDC (Therapeutics Data Commons)
Skill giúp dùng PyTDC 1.1.15 để khám phá dataset, chia tập, tính metric, chạy benchmark group và oracle phân tử một cách có kiểm soát và cần phê duyệt trước khi tải.
Dữ liệu · Phân tíchNâng cao★ 33,030⑂ 3,248Điểm AI 8/10Cập nhật lần cuối: 9 thg 8, 2026
Làm được gì
- Tra cứu registry của Therapeutics Data Commons (task, dataset, benchmark, evaluator, oracle) mà không tải dữ liệu.
- Cung cấp quy trình cài đặt tái lập: môi trường
uv+ CPython 3.11, ghimPyTDC==1.1.15vàsetuptools==80.9.0(do PyTDC còn importpkg_resources). - Mọi lần tải dữ liệu chỉ chạy sau khi người dùng đồng ý, qua cờ
--execute(và thêm--downloadcho checkpoint oracle / corpus MolGen). - Giải thích chính xác hành vi các kiểu split (
random,scaffold,cold_split,time) và cảnh báo không được khẳng định quá mức về chống rò rỉ dữ liệu. - Chuẩn hóa tên metric (
PCC,ROC-AUC,micro-f1...) và quy tắc API benchmark group (evaluate_manycần ít nhất 5 bộ dự đoán). - Kèm script: khám phá metadata, load/split, đánh giá benchmark, tính điểm oracle, kiểm toán cache.
Phù hợp với ai
- Nhà nghiên cứu / data scientist làm ML dược phẩm: ADME, Tox, DTI, DDI, sinh phân tử.
- Nhóm muốn nộp kết quả benchmark TDC một cách tái lập.
- Môi trường cần kiểm soát giấy phép dữ liệu, dung lượng và lưu lượng mạng trước khi tải.
Ví dụ sử dụng
- "Liệt kê dataset thuộc task ADME mà không tải gì" →
discover_metadata.py --kind datasets --task ADME - "Lập kế hoạch chia Caco2_Wang theo scaffold, seed 42, rồi thực thi sau khi tôi đồng ý" →
load_and_split_data.py ... --execute - "Tính điểm QED cho vài SMISLES ngay tại máy" →
molecular_generation.py score --oracle QED --smiles CCO - "Kiểm tra định dạng JSON dự đoán cho admet_group trước khi đánh giá" →
benchmark_evaluation.py
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/K-Dense-AI/scientific-agent-skills/HEAD/skills/pytdc/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/pytdc từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/pytdc/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/pytdc ~/.claude/skills/pytdc⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và clone repo:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Sao chép skill vào thư mục Claude:
mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/pytdc ~/.claude/skills/pytdc - Cài
uvnếu chưa có:curl -LsSf https://astral.sh/uv/install.sh | sh - Tạo môi trường riêng:
uv venv --python 3.11 .venv-pytdc - Xem trước dung lượng:
uv pip install --dry-run --python .venv-pytdc/bin/python "setuptools==80.9.0" "PyTDC==1.1.15"(khoảng 123 gói, vài trăm MB). - Cài thật: chạy lại lệnh trên nhưng bỏ
--dry-run. - Khởi động lại Claude Code và thử: "Dùng skill PyTDC liệt kê dataset ADME".
- Khi Claude xin phép tải dataset, hãy kiểm tra giấy phép, dung lượng và đường dẫn cache trước khi đồng ý.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT