Gtars – Phân tích khoảng gen
Hướng dẫn dùng gtars an toàn trên Python, Rust và CLI cho phép toán tập hợp khoảng BED, coverage, consensus, tokenizer và refget.
Dữ liệu · Phân tíchNâng cao★ 33,030⑂ 3,248Điểm AI 8/10Cập nhật lần cuối: 9 thg 8, 2026
Làm được gì
Skill này giúp Claude sử dụng đúng thư viện gtars cho dữ liệu khoảng gen (genomic intervals).
- Overlap & đại số tập hợp:
count_overlaps,any_overlaps,find_overlaps,intersect_all,jaccard,setdiff,reduce,cluster,gapstheo API Python 0.9.2 thực tế - Consensus & coverage: tạo tập khoảng đồng thuận qua
genomic_distributions.consensus; phân biệt rõ chỉ số coverage với việc sinh track tín hiệu (uniwig) - Tokenizer, fragment, refget: tokenizer từ universe BED cục bộ; quy tắc dùng RefgetStore in-memory/local/remote
- Hợp đồng dữ liệu: tọa độ 0-based nửa mở, giới hạn u32, ghi lại accession assembly và SHA-256, so khớp tên contig chính xác, chính sách sort và strand
- 6 CLI cục bộ kèm theo: validator BED, execution plan, tokenizer manifest, refget digest plan, coverage preflight, artifact inspector — không dùng mạng, không ghi file kết quả
- Rào an toàn: coi wheel PyO3 và build script Cargo là thực thi mã; mọi tải xuống/ghi cache đều cần bạn phê duyệt
Dành cho ai
- Nhà nghiên cứu tin sinh học làm việc thường xuyên với BED (peak ATAC-seq/ChIP-seq, promoter, enhancer)
- Người xây pipeline học máy dựa trên khoảng gen (universe/tokenizer)
- Ai muốn tránh lỗi hệ tọa độ, lệch tên contig và rò rỉ dữ liệu giữa các tập
- Nhóm cần chia dữ liệu theo bệnh nhân/donor và lưu provenance tái lập được
Ví dụ sử dụng
- Tóm tắt overlap: "Tính số vùng promoter trùng với
peaks.bedvà chỉ số Jaccard" → validate tọa độ/sort rồi sinh codecount_overlaps/jaccard - Tạo tập consensus: gộp nhiều mẫu BED thành consensus nhưng chỉ dùng tập train để dựng universe, tránh rò rỉ sang validation/test
- Chuẩn bị tokenizer: không tự tải model từ Hugging Face; dùng
Tokenizer.from_bedvới universe BED cục bộ và ghi manifest + checksum
· · · Hướng dẫn cài đặt · · ·
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/gtars từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/gtars/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/gtars ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và clone repo:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Tạo thư mục skill:
mkdir -p ~/.claude/skills - Copy skill:
cp -r scientific-agent-skills/skills/gtars ~/.claude/skills/ - Kiểm tra
~/.claude/skills/gtars/có SKILL.md cùng các thư mụcreferences/vàscripts/. - Khởi động lại Claude Code, rồi yêu cầu ví dụ: "phân tích overlap giữa hai file BED".
- (Tùy chọn) Nếu cần chạy thật: tạo môi trường Python 3.10+ và cài
uv pip install "gtars==0.9.2". Hãy tự kiểm tra phiên bản và chủ sở hữu package trên PyPI trước khi cài. - (Tùy chọn) Cần CLI thì cài Rust toolchain rồi
cargo install gtars-cli --locked. - Với chức năng cần mạng (tokenizer pretrained, refget remote, cache BEDbase), skill sẽ xin phê duyệt — hãy chuẩn bị trước danh sách host và đường dẫn cache được phép.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT