Mamba 아키텍처 (선택적 상태공간 모델)
O(n) 선형 복잡도의 Mamba-1/Mamba-2를 설치·실행·벤치마크하는 실전 가이드 스킬.
개발·코딩고급★ 11,926⑂ 867AI 점수 8/10마지막 업데이트: 2026. 6. 16.
무엇을 해주나
Transformer의 O(n²) 어텐션 대신 O(n) 선형 복잡도로 동작하는 상태공간 모델(SSM) Mamba를 실제로 돌려보게 도와줍니다.
mamba-ssm,causal-conv1d설치 절차와 전제조건(Linux, NVIDIA GPU, CUDA 11.6+) 안내- Mamba 블록 및
MambaLMHeadModel로 언어모델 구성·텍스트 생성 코드 - HuggingFace
state-spaces/mamba-130m ~ 2.8b사전학습 모델 로딩법 - Mamba-1(d_state=16) vs Mamba-2(d_state=128, 멀티헤드, RMSNorm, 텐서 병렬) 차이 정리
- Transformer(Pythia) 대비 생성 속도 벤치마크 명령과 모델별 VRAM 요구량 표
- OOM, 설치 실패, HuggingFace 로딩 오류 등 흔한 문제 해결법
이런 분께 추천
- 긴 문맥(10만 토큰 이상)이나 스트리밍 추론이 필요한 ML 엔지니어
- KV 캐시 메모리 부담을 줄이고 싶은 LLM 서빙 담당자
- Transformer 대안 아키텍처(RWKV, RetNet, Hyena 등)를 비교 검토하는 연구자
활용 예시
- "mamba-2.8b를 GPU에 올려 프롬프트 생성 결과를 뽑아줘" → 사전학습 모델 로딩 + generate 코드 제공
- "우리 모델을 Mamba-2 블록으로 바꾸고 싶어" →
Mamba2설정값(headdim, ngroups)과 Mamba-1과의 차이 설명 - "Mamba가 Pythia보다 정말 빠른지 측정해줘" → 동일 조건 벤치마크 스크립트 명령 제시
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/HEAD/01-model-architecture/mamba/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 Orchestra-Research/AI-Research-SKILLs 의 01-model-architecture/mamba 폴더를 내 ~/.claude/skills/mamba-architecture/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs.git /tmp/ai-research-skills && mkdir -p ~/.claude/skills/mamba-architecture && cp -r /tmp/ai-research-skills/01-model-architecture/mamba/* ~/.claude/skills/mamba-architecture/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 엽니다. (Linux + NVIDIA GPU 환경 권장)
- 스킬 저장소를 내려받습니다:
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs.git - 스킬 폴더를 만듭니다:
mkdir -p ~/.claude/skills/mamba-architecture - 파일을 복사합니다:
cp -r AI-Research-SKILLs/01-model-architecture/mamba/* ~/.claude/skills/mamba-architecture/ - Claude Code를 재시작하고 "Mamba로 긴 문맥 모델 만들기"처럼 요청해 스킬이 활성화되는지 확인합니다.
- 실제 실행 전 파이썬 패키지를 설치합니다:
pip install causal-conv1d>=1.4.0 && pip install mamba-ssm --no-build-isolation - CUDA 11.6+ / PyTorch 1.12+ 설치 여부와 모델 크기별 VRAM(2.8B는 약 28GB)을 미리 확인하세요.
GitHub에서 원본 보기 ↗라이선스: MIT