scikit-bio – Phân tích dữ liệu sinh học
Giúp Claude thực hiện phân tích tin sinh học bằng scikit-bio: chuỗi, gióng hàng, cây phát sinh loài, chỉ số đa dạng, PCoA và PERMANOVA.
Dữ liệu · Phân tíchNâng cao★ 33,030⑂ 3,248Điểm AI 8/10Cập nhật lần cuối: 9 thg 8, 2026
Làm được gì
Hướng dẫn Claude sử dụng đúng API mới nhất của thư viện Python scikit-bio (0.7+) cho các tác vụ tin sinh học:
- Xử lý chuỗi DNA/RNA/protein: bổ sung đảo chiều, phiên mã, dịch mã, tìm motif bằng regex
- Gióng hàng:
pair_align,pair_align_nucl/prot(kiểu BLASTN/BLASTP), chuỗi CIGAR,TabularMSA - Cây phát sinh loài: NJ, UPGMA, GME/BME, tinh chỉnh NNI, khoảng cách Robinson-Foulds, I/O Newick
- Đa dạng: alpha (Shannon, Chao1, Faith's PD) và beta (Bray-Curtis, UniFrac có/không trọng số)
- Giảm chiều & thống kê: PCoA, CCA, RDA; PERMANOVA, ANOSIM, PERMDISP, Mantel; ANCOM/dirmult
- Đọc/ghi hơn 19 định dạng: FASTA, FASTQ, GenBank, Newick, BIOM… dùng generator cho file lớn
- Kết nối embedding từ mô hình ngôn ngữ protein với ma trận khoảng cách và ordination
Tài liệu ghi rõ các API đã đổi tên hoặc bị loại bỏ (otu_ids → taxa, tip_tip_distances → cophenet…), giúp tránh sinh code lỗi thời.
Dành cho ai
- Nhà nghiên cứu, học viên làm về microbiome hoặc quy trình QIIME 2
- Người cần phân tích phát sinh loài, sinh thái quần xã, thống kê dữ liệu omics
- Kỹ sư ML muốn ghép embedding protein vào pipeline tin sinh truyền thống
Ví dụ sử dụng
- "Từ table.biom và tree.nwk hãy tính UniFrac không trọng số, vẽ PCoA rồi chạy PERMANOVA theo cột bodysite"
- "Viết script đọc input.fastq, lọc chất lượng, dịch mã và xuất ra output.fasta"
- "Gióng hàng cục bộ hai chuỗi FASTA theo cấu hình kiểu BLASTN và in điểm cùng chuỗi CIGAR"
· · · Hướng dẫn cài đặt · · ·
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/scikit-bio từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/scikit-bio/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git /tmp/sas && mkdir -p ~/.claude/skills && cp -r /tmp/sas/skills/scikit-bio ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và kiểm tra Python:
python3 --version(cần 3.10 trở lên). - Cài thư viện:
uv pip install scikit-bio(hoặcconda install -c conda-forge scikit-bio). Yêu cầu NumPy 2.0+. - Tùy chọn:
uv pip install matplotlib seaborn biom-formatđể vẽ hình và đọc bảng BIOM. - Tải repo skill:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Copy thư mục skill:
mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/scikit-bio ~/.claude/skills/ - Khởi động lại Claude Code và thử yêu cầu: "dùng scikit-bio tính beta diversity cho bảng của tôi".
Xem mã nguồn trên GitHub ↗Giấy phép: MIT