데이터셋 큐레이션 방법론
데이터셋의 클래스 불균형·편향을 진단하고 계층 분할·확장 계획·윤리 검토까지 안내하는 연구용 스킬.
데이터·분석중급★ 368⑂ 31AI 점수 7/10마지막 업데이트: 2026. 7. 3.
무엇을 해주나
머신러닝 데이터셋을 만들거나 정리할 때 필요한 절차를 6단계로 안내합니다.
- 분포 분석: 클래스별 개수, 불균형 비율(최대/최소), 5% 미만 희소 클래스 탐지, 라벨 동시출현 행렬 작성
- 편향 평가: 발견된 불균형이 현실 반영인지·유해한지·수정 가능한지 3가지 질문으로 판단하고, 인구통계적 균등성(demographic parity)·균등 기회(equalized odds) 등 공정성 지표 점검
- 계층 분할: 라벨 기준 1차 층화 + 출처 기준 2차 층화로 소스 누출 방지, 카이제곱 검정으로 분할 검증, 데이터 규모별 권장 비율(대형 80/10/10, 소형은 k-fold)
- 품질 평가: Cohen's/Fleiss' kappa, Krippendorff's alpha로 어노테이터 일치도 측정, 라벨 노이즈 추정
- 확장 계획: 우선순위 클래스, 수집 전략(액티브 러닝·타깃 스크래핑·합성 증강), 비용 추정
- 윤리 체크리스트: 민감성, 동의, 프라이버시, 라이선스, 오용 가능성, 데이터 카드 문서화
결과는 분포 리포트 / 편향 발견 / 분할 권고 / 확장 계획 / 윤리 체크리스트 5개 산출물로 정리됩니다.
이런 분께 추천
- 논문용 데이터셋을 새로 구축하거나 공개하려는 대학원생·연구자
- 학습 데이터의 편향 때문에 모델 성능이 특정 그룹에서 떨어지는 문제를 겪는 ML 엔지니어
- 데이터 라벨링 품질과 어노테이터 일치도를 정량적으로 보고해야 하는 데이터 팀
활용 예시
- "이 이미지 분류 데이터셋의 클래스 불균형을 분석해줘" → 클래스별 개수와 불균형 비율, 희소 클래스 목록, 동시출현 상관관계 리포트를 받습니다.
- "train/val/test를 나눠줘. 같은 영화 클립이 여러 분할에 섞이면 안 돼" → 라벨+출처 이중 층화 분할 전략과 카이제곱 검정 기반 검증 결과를 제안받습니다.
- "데이터셋을 공개하기 전에 윤리 검토를 하고 싶어" → 동의·프라이버시·라이선스·오용 위험 항목별로 채워진 체크리스트와 데이터 카드 초안 방향을 얻습니다.
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/fcakyon/phd-skills/HEAD/plugin/skills/dataset-curation/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 fcakyon/phd-skills 의 plugin/skills/dataset-curation 폴더를 내 ~/.claude/skills/dataset-curation/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/fcakyon/phd-skills.git && mkdir -p ~/.claude/skills && cp -r phd-skills/plugin/skills/dataset-curation ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널(맥은 Terminal, 윈도우는 Git Bash)을 엽니다.
- 저장소를 내려받습니다:
git clone https://github.com/fcakyon/phd-skills.git - 스킬 폴더를 만듭니다:
mkdir -p ~/.claude/skills - 스킬을 복사합니다:
cp -r phd-skills/plugin/skills/dataset-curation ~/.claude/skills/ ls ~/.claude/skills/dataset-curation으로 SKILL.md가 있는지 확인합니다.- Claude Code를 다시 실행하고 "데이터셋 클래스 불균형 분석해줘" 같은 문장을 입력하면 스킬이 자동으로 발동합니다.
GitHub에서 원본 보기 ↗라이선스: MIT