GPU 최적화 (NVIDIA)
CPU에 묶인 파이썬 과학 코드를 NVIDIA GPU용으로 옮기고, 정확성과 속도 향상을 실제로 검증해 주는 스킬입니다.
개발·코딩고급★ 33,030⑂ 3,248AI 점수 9/10마지막 업데이트: 2026. 8. 9.
무엇을 해주나
느린 NumPy·pandas·scikit-learn·NetworkX·scikit-image 코드를 GPU로 옮기는 작업을 "증거 기반 최적화"로 진행합니다.
- 라이브러리 선택 가이드: CuPy(NumPy/SciPy), cuDF(pandas), cuML(scikit-learn), nx-cugraph(NetworkX), cuCIM(이미지), cuVS(벡터 검색), KvikIO(파일 I/O), Warp/Newton(시뮬레이션), Numba-CUDA(커스텀 커널), RAFT(저수준 프리미티브)를 상황에 맞게 매칭합니다.
- 단계적 접근: 먼저
cudf.pandas,cuml.accel,nx-cugraph같은 무침습 가속 모드를 시도하고, 필요할 때만 네이티브 API나 커스텀 커널로 내려갑니다. - 정확성 검증: CPU 결과와 허용 오차 기준으로 비교하고, 근사 ANN은 recall@k로 평가합니다.
- 올바른 벤치마킹: 비동기 실행 특성을 감안해 CUDA 이벤트/
cupyx.profiler.benchmark,nsys,ncu를 사용하고 전송 비용까지 포함한 end-to-end 시간을 보고합니다. - 포팅 철회 판단: 개선이 없으면 원인(문제 크기, 전송, CPU 폴백, 메모리 압박 등)을 설명하고 CPU 경로 유지를 권합니다.
또한 cuxfilter(26.06 최종 릴리스), cuSpatial(25.04 아카이브)처럼 레거시가 된 프로젝트를 새 작업에 쓰지 않도록 안내합니다.
이런 분께 추천
- 대용량 배열·데이터프레임 처리로 밤새 돌아가는 연구·분석 파이프라인을 가진 분
- RAPIDS 생태계에 입문하고 싶지만 어떤 라이브러리를 골라야 할지 모르는 분
- 물리 시뮬레이션, 그래프 분석, 벡터 검색(RAG), 의료·병리 이미지 처리를 하는 분
- "GPU로 바꿨는데 왜 안 빨라지죠?"라는 문제를 제대로 진단하고 싶은 분
활용 예시
- pandas 파이프라인 가속: 5천만 행 CSV 집계 스크립트를 주고 "GPU로 빠르게 해줘"라고 요청 → 먼저
cudf.pandas가속 모드로 CPU 폴백 경고를 확인하고, 병목 구간만 네이티브 cuDF로 재작성한 뒤 전송 비용 포함 전후 벤치마크를 제시. - 벡터 검색 전환: sklearn
NearestNeighbors기반 RAG 검색기를 cuVS로 옮기며, 정확 검색 대비 recall@k를 함께 보고해 품질 저하 여부를 판단. - 커스텀 커널 최적화: 파이썬 루프 기반 입자 시뮬레이션을 Warp 커널로 JIT 컴파일하고,
nsys타임라인으로 호스트-디바이스 왕복을 제거.
· · · 설치 가이드 · · ·
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 K-Dense-AI/scientific-agent-skills 의 skills/optimize-for-gpu 폴더를 내 ~/.claude/skills/optimize-for-gpu/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/optimize-for-gpu ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- NVIDIA GPU가 있는 Linux 또는 WSL2 환경인지 확인합니다. 터미널에서
nvidia-smi를 실행해 드라이버와 CUDA 버전을 확인하세요. - Claude Code가 설치되어 있고
~/.claude/skills폴더가 있는지 확인합니다. 없으면mkdir -p ~/.claude/skills로 만듭니다. - 저장소를 클론합니다:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - 스킬 폴더를 통째로 복사합니다:
cp -r scientific-agent-skills/skills/optimize-for-gpu ~/.claude/skills/references/하위 문서가 함께 복사되어야 정상 동작합니다. 파일 하나만 복사하지 마세요.
- Claude Code를 재시작한 뒤 "이 NumPy 코드를 GPU로 최적화해줘" 같이 요청하면 스킬이 자동으로 활성화됩니다.
- 실제 실행이 필요하면 Python 3.11+ 환경에 CUDA 버전에 맞는 RAPIDS/CuPy 휠을 설치합니다(설치 명령은 스킬의
references/installation.md참고, 네트워크 연결 필요).
GitHub에서 원본 보기 ↗라이선스: MIT