Dask 분산 컴퓨팅
메모리보다 큰 pandas/NumPy 작업을 Dask로 병렬·분산 처리하도록 Claude를 안내하는 스킬입니다.
데이터·분석중급★ 33,030⑂ 3,248AI 점수 8/10마지막 업데이트: 2026. 8. 9.
무엇을 해주나
RAM을 초과하는 데이터를 다룰 때 Claude가 Dask를 올바르게 사용하도록 돕는 참조 스킬입니다.
- DataFrame: 여러 CSV/Parquet를 하나처럼 읽고 groupby·join·집계를 병렬 실행
- Array: NumPy 연산을 청크 단위로 분할해 메모리 초과 배열 처리 (HDF5, Zarr, XArray 연동)
- Bag: 로그·JSON 같은 비정형 데이터를 스트리밍으로 정제 후 DataFrame으로 변환
- Futures:
client.submit/scatter기반의 동적 병렬 워크플로 구성 - Scheduler: threads/processes/synchronous/distributed 중 상황에 맞는 실행 백엔드 선택
또한 청크 크기 100MB 기준, 반복 compute() 금지, 로컬 로딩 후 from_pandas 안티패턴 등 실전 베스트 프랙티스와 디버깅 절차를 담고 있습니다.
이런 분께 추천
- 판다스 코드가 메모리 부족(MemoryError)으로 죽는 데이터 분석가
- 수백 개 파일을 일괄 처리해야 하는 데이터 엔지니어
- 노트북에서 클러스터로 파이프라인을 확장하려는 ML/과학 계산 연구자
- Dask는 들어봤지만 어떤 컴포넌트를 써야 할지 헷갈리는 분
활용 예시
- "data/2024-*.csv 300개 파일을 카테고리별로 집계해줘" →
dd.read_csv글롭 패턴 +groupby().mean().compute()코드 제안 - "이 파이프라인이 계속 메모리 초과로 죽어" → 청크 크기 조정,
persist()사용 시점, 태스크 그래프 축소 방법 진단 - "수천 개 파라미터 조합으로 시뮬레이션을 병렬 실행하고 싶어" →
Client+scatter+submit패턴으로 파라미터 스윕 구성
· · · 설치 가이드 · · ·
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 K-Dense-AI/scientific-agent-skills 의 skills/dask 폴더를 내 ~/.claude/skills/dask/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/dask ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 엽니다.
- 스킬 저장소를 내려받습니다:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - 스킬 폴더를 만듭니다:
mkdir -p ~/.claude/skills - dask 스킬을 통째로 복사합니다(references/ 폴더 포함이 중요합니다):
cp -r scientific-agent-skills/skills/dask ~/.claude/skills/ - 파이썬 환경에 Dask를 설치합니다:
pip install "dask[complete]"(S3 사용 시pip install s3fs추가) - Claude Code를 재시작한 뒤 "메모리보다 큰 CSV를 dask로 처리해줘"처럼 요청하면 스킬이 활성화됩니다.
GitHub에서 원본 보기 ↗라이선스: MIT