Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
Về danh sách

Tiền huấn luyện LLM phân tán với TorchTitan

Kỹ năng hướng dẫn cấu hình và chạy tiền huấn luyện LLM quy mô 8 đến 512+ GPU bằng torchtitan với song song 4D (FSDP2, TP, PP, CP), Float8 và checkpoint phân tán.

Lập trìnhNâng cao12,666912Điểm AI 8/10Cập nhật lần cuối: 16 thg 6, 2026

Làm được gì

  • Hướng dẫn cài đặt torchtitan (nền tảng tiền huấn luyện chính thức của PyTorch) và chạy phiên huấn luyện đầu tiên.
  • Cung cấp file TOML mẫu để cấu hình song song 4D: FSDP2 (chia shard dữ liệu), Tensor Parallel, Pipeline Parallel, Context Parallel theo kích cỡ mô hình và số GPU.
  • Bật Float8 + torch.compile để tăng 30–50% tốc độ trên H100, kèm script SLURM cho đa node và cách lưu/khôi phục/chuyển đổi checkpoint phân tán (DCP).
  • Mục xử lý sự cố thực tế: hết VRAM, TP ngốn bộ nhớ với async collectives, Float8 không nhanh hơn, lỗi tải checkpoint sau khi đổi cấu hình song song.

Dành cho ai

  • Kỹ sư/nhà nghiên cứu ML muốn tiền huấn luyện từ đầu Llama 3.1 (8B/70B/405B), DeepSeek V3, Qwen 3...
  • Người phụ trách hạ tầng cần lộ trình mở rộng từ 1 node 8 GPU lên cụm 512 GPU.
  • Nhóm ưu tiên stack PyTorch thuần thay vì Megatron-LM hay DeepSpeed.

Lưu ý: nếu chỉ fine-tune (LoRA/SFT) thì Axolotl hoặc TRL phù hợp hơn.

Ví dụ sử dụng

  1. Tiền huấn luyện Llama 3.1 8B trên 1 node 8×H100: tải tokenizer → viết llama3_8b_custom.toml → chạy run_train.sh → theo dõi bằng TensorBoard.
  2. Huấn luyện 70B trên 32 node/256 GPU: cấu hình FSDP 32 × TP 8, gửi job bằng sbatch, tự động resume từ checkpoint.
  3. Song song 4D cho 405B: tạo seed checkpoint trước, rồi chạy FSDP 8 × TP 8 × PP 8 trên 64 node (512 GPU).

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/HEAD/01-model-architecture/torchtitan/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục 01-model-architecture/torchtitan từ repo GitHub Orchestra-Research/AI-Research-SKILLs vào ~/.claude/skills/distributed-llm-pretraining-torchtitan/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs.git && mkdir -p ~/.claude/skills && cp -r AI-Research-SKILLs/01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở terminal và clone repo kỹ năng: git clone https://github.com/Orchestra-Research/AI-Research-SKILLs.git
  2. Tạo thư mục skills: mkdir -p ~/.claude/skills
  3. Sao chép riêng kỹ năng này: cp -r AI-Research-SKILLs/01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
  4. Khởi động lại Claude Code và kiểm tra kỹ năng đã xuất hiện trong danh sách.
  5. Chuẩn bị môi trường chạy thật: pip install torchtitan (hoặc cài từ source) cùng torch>=2.6torchao>=0.5.
  6. Lấy token Hugging Face rồi tải tokenizer: python scripts/download_hf_assets.py --repo_id meta-llama/Llama-3.1-8B --assets tokenizer --hf_token=...
  7. Yêu cầu Claude ví dụ: "Tạo cấu hình tiền huấn luyện Llama 3.1 8B cho 1 node 8×H100" để kích hoạt kỹ năng.