Hugging Science 과학 ML 리소스 탐색기
생물·화학·기후·유전체 등 17개 과학 분야의 Hugging Face 데이터셋·모델·데모를 큐레이션 카탈로그에서 찾아 바로 코드로 쓰게 해주는 스킬입니다.
데이터·분석중급★ 33,030⑂ 3,248AI 점수 9/10마지막 업데이트: 2026. 8. 9.
무엇을 해주나
- huggingscience.co의 큐레이션 카탈로그(
llms.txt,llms-full.txt,topics/<슬러그>.md)를 가져와 과학 분야별 데이터셋·모델·블로그·Spaces를 찾아줍니다. - 17개 도메인(astronomy, biology, chemistry, climate, genomics, materials-science, medicine, physics 등)으로 작업을 매핑하고, 동봉된
scripts/fetch_catalog.py로 구조화된 검색·필터링을 수행합니다. - 선택한 리소스를 실제로 사용하는 방법까지 안내합니다:
datasets로 대용량 코퍼스 스트리밍 로딩,transformers/HF Inference API로 모델 실행,gradio_client로 BoltzGen 등 Space 호출. - 규모·라이선스·모달리티·최신성 기준으로 후보 2~3개를 비교해 제시하고, 방법론 블로그 링크를 인용하도록 유도합니다.
- 게이트된 리소스를 위한
HF_TOKEN은.env에서 읽고 토큰을 하드코딩하지 않도록 규칙을 정해 둡니다.
이런 분께 추천
- 단백질·유전체·분자·결정구조·기상 데이터로 ML을 하는 연구자, 대학원생
- 과학 논문의 ML 파이프라인을 재현하거나 과학 벤치마크로 평가해야 하는 엔지니어
- 어떤 과학 모델·데이터셋을 골라야 할지 몰라 HF Hub를 헤매는 분
활용 예시
- "내 단백질 서열 분류에 쓸 만한 모델 추천해줘" →
biology토픽을 받아와 ESM2 35M/650M, Evo-2 등을 규모·비용 기준으로 비교 제시. - "타깃 단백질 바인더를 하나만 설계해보고 싶다" → 로컬 설치 대신
gradio_client로 hugging-science의 BoltzGen Space 호출. - "수십 GB 유전체 코퍼스로 파인튜닝 준비" →
load_dataset(..., streaming=True)로 스키마를 먼저 확인한 뒤 학습 스크립트 구성, 방법론 블로그 링크 첨부.
주의: 카탈로그는 큐레이션이라 모든 리소스를 담지 않으며, 등재되었다는 사실이 코드 검증을 뜻하지는 않습니다.
trust_remote_code=True가 필요한 모델은 실행 전 확인이 필요합니다.
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/K-Dense-AI/scientific-agent-skills/HEAD/skills/hugging-science/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 K-Dense-AI/scientific-agent-skills 의 skills/hugging-science 폴더를 내 ~/.claude/skills/hugging-science/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/hugging-science ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 열고 저장소를 클론합니다.
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Claude Code 스킬 폴더를 준비합니다.
mkdir -p ~/.claude/skills - 이 스킬 폴더만 복사합니다(스크립트와 references 폴더가 함께 복사되어야 합니다).
cp -r scientific-agent-skills/skills/hugging-science ~/.claude/skills/ - 파이썬 의존성을 설치합니다.
pip install datasets transformers gradio_client python-dotenv requests - 게이트된 데이터셋·모델을 쓸 경우, 작업 폴더에
.env파일을 만들고HF_TOKEN=hf_...한 줄을 넣습니다..gitignore에.env를 추가하세요. - Claude Code를 재시작한 뒤 "단백질 언어 모델 찾아줘"처럼 과학 ML 질문을 하면 스킬이 자동으로 발동합니다.
GitHub에서 원본 보기 ↗라이선스: MIT