클로드스킬마트스킬 둘러보기바로 쓰는 문장영상으로 배우기터미널 사용법스킬이 뭐예요?
목록으로

TorchTitan 분산 LLM 사전학습

PyTorch 공식 torchtitan으로 8~512+ GPU 규모의 LLM 사전학습(FSDP2·TP·PP·CP 4D 병렬화, Float8, 분산 체크포인트)을 설정하고 실행하도록 돕는 스킬.

개발·코딩고급12,666912AI 점수 8/10마지막 업데이트: 2026. 6. 16.

무엇을 해주나

  • PyTorch 공식 대규모 사전학습 프레임워크 torchtitan 설치부터 첫 학습 실행까지의 절차를 정리해 줍니다.
  • 4D 병렬화(FSDP2 데이터 샤딩, 텐서 병렬, 파이프라인 병렬, 컨텍스트 병렬) 조합을 모델 크기·GPU 수에 맞게 설정하는 TOML 예시를 제공합니다.
  • H100에서 30~50% 속도 향상을 노리는 Float8 + torch.compile 설정, SLURM 다중 노드 제출 스크립트, 분산 체크포인트(DCP) 저장·재개·변환 방법을 안내합니다.
  • OOM, 텐서 병렬 메모리 급증, Float8이 빨라지지 않는 문제, 병렬화 구성 변경 후 체크포인트 로드 실패 등 실전 트러블슈팅 해법을 담고 있습니다.

이런 분께 추천

  • Llama 3.1(8B/70B/405B), DeepSeek V3, Qwen 3 등을 처음부터 사전학습하려는 ML 엔지니어·연구자
  • 8 GPU 단일 노드에서 512 GPU 클러스터까지 스케일업 경로를 설계해야 하는 인프라 담당자
  • Megatron-LM/DeepSpeed 대신 PyTorch 네이티브 스택을 선호하는 팀

참고: 파인튜닝(LoRA/SFT) 목적이라면 이 스킬보다 Axolotl·TRL 계열이 적합합니다.

활용 예시

  1. 단일 노드 8×H100에서 Llama 3.1 8B 사전학습 시작 — 토크나이저 다운로드 → llama3_8b_custom.toml 작성 → run_train.sh 실행 → TensorBoard 모니터링.
  2. 32노드 256 GPU로 70B 학습 — FSDP 32 × TP 8 구성과 SLURM sbatch 스크립트로 제출하고 체크포인트에서 자동 재개.
  3. 405B 4D 병렬화 — 시드 체크포인트를 먼저 생성한 뒤 FSDP 8 × TP 8 × PP 8 구성으로 64노드 512 GPU에 투입.

· · · 설치 가이드 · · ·

설치 없이 지금 한 번 써보기

아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.

이 파일의 지시를 읽고 그대로 따라서 나를 도와줘:
https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/HEAD/01-model-architecture/torchtitan/SKILL.md

내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)

Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.

쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.

Claude 앱에 설치 (터미널 필요 없음)
  1. 아래 버튼으로 ZIP 파일을 받으세요.
  2. Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
  3. Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
ZIP 내려받기
Claude Code에 설치

Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요

클로드스킬마트에서 찾은 스킬을 설치해줘.
GitHub 저장소 Orchestra-Research/AI-Research-SKILLs 의 01-model-architecture/torchtitan 폴더를 내 ~/.claude/skills/distributed-llm-pretraining-torchtitan/ 에 그대로 복사해줘.
설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.

직접 명령으로 설치하기

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs.git && mkdir -p ~/.claude/skills && cp -r AI-Research-SKILLs/01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.

  1. 터미널을 열고 스킬 저장소를 클론합니다: git clone https://github.com/Orchestra-Research/AI-Research-SKILLs.git
  2. Claude 스킬 폴더를 만듭니다: mkdir -p ~/.claude/skills
  3. 이 스킬 폴더만 복사합니다: cp -r AI-Research-SKILLs/01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
  4. Claude Code를 재시작하고 /skills 등으로 스킬이 목록에 보이는지 확인합니다.
  5. 실제 학습을 위해 런타임을 준비합니다: pip install torchtitan(또는 소스 설치)과 torch>=2.6, torchao>=0.5.
  6. Hugging Face 토큰을 발급받아 토크나이저를 내려받습니다: python scripts/download_hf_assets.py --repo_id meta-llama/Llama-3.1-8B --assets tokenizer --hf_token=...
  7. Claude에게 "8×H100 노드에서 Llama 3.1 8B 사전학습 설정을 만들어줘"처럼 요청하면 스킬이 발동합니다.