Stable Baselines3 강화학습 도우미
PPO·SAC·DQN 등 Stable Baselines3 기반 강화학습 학습·평가·커스텀 환경 작업을 표준 패턴으로 안내하는 스킬.
개발·코딩고급★ 33,030⑂ 3,248AI 점수 9/10마지막 업데이트: 2026. 8. 9.
무엇을 해주나
- Stable Baselines3(SB3) 2.8 기준으로 PPO, SAC, DQN, TD3, DDPG, A2C 학습 코드를 바로 쓸 수 있는 형태로 제시합니다.
- Gymnasium 커스텀 환경 작성 규칙(
reset/step시그니처, 이미지 관측 uint8 제약,check_env검증)을 정리해 흔한 오류를 예방합니다. - DummyVecEnv/SubprocVecEnv 벡터화 환경, EvalCallback·CheckpointCallback 등 콜백, 모델 저장/로드,
evaluate_policy와 영상 녹화까지 워크플로 전체를 커버합니다. - 알고리즘 선택, 학습률 스케줄, HER, TensorBoard 연동, 메모리/속도 문제 대응 팁을 포함합니다.
이런 분께 추천
- 강화학습 실험을 빠르게 프로토타이핑해야 하는 연구자·대학원생
- 자체 시뮬레이터를 Gymnasium 환경으로 감싸 에이전트를 학습시키려는 ML 엔지니어
- 대규모 병렬·멀티에이전트가 아닌 단일 에이전트 RL 파이프라인을 정석대로 구축하려는 분
활용 예시
- "CartPole에서 PPO 베이스라인 학습하고 최고 성능 모델을 저장해줘" → 학습 스크립트 + EvalCallback 구성 제안.
- "내 로봇 시뮬레이터를 Gymnasium 환경으로 만들어줘" →
custom_env_template.py기반 환경 작성과check_env검증 절차 안내. - "SAC 학습이 너무 느려요" → SubprocVecEnv 병렬화,
gradient_steps=-1, buffer_size 조정 등 처방.
· · · 설치 가이드 · · ·
설치 없이 지금 한 번 써보기
아래를 Claude에 붙여넣으면 설치하지 않고도 이 스킬을 그대로 씁니다.
이 파일의 지시를 읽고 그대로 따라서 나를 도와줘: https://raw.githubusercontent.com/K-Dense-AI/scientific-agent-skills/HEAD/skills/stable-baselines3/SKILL.md 내가 원하는 것: (여기에 하고 싶은 일을 쓰세요)
Claude가 링크를 열지 못하면, 링크를 직접 열어 내용을 복사해 붙여넣으세요.
↓ 쓸 만하면 아래에서 ZIP을 받아 설치하세요. 그러면 매번 붙여넣지 않아도 알아서 작동합니다.
Claude 앱에 설치 (터미널 필요 없음)
- 아래 버튼으로 ZIP 파일을 받으세요.
- Claude 설정 → Capabilities에서 '코드 실행 및 파일 생성'을 켭니다. (한 번만)
- Claude에서 Customize → Skills → + → '스킬 업로드'를 누르고 받은 ZIP을 올립니다.
Claude Code에 설치
Claude에게 맡기기 — 아래 문장을 Claude Code에 붙여넣으세요
클로드스킬마트에서 찾은 스킬을 설치해줘. GitHub 저장소 K-Dense-AI/scientific-agent-skills 의 skills/stable-baselines3 폴더를 내 ~/.claude/skills/stable-baselines3/ 에 그대로 복사해줘. 설치가 끝나면 이 스킬로 무엇을 할 수 있는지 한 줄로 알려줘.
직접 명령으로 설치하기
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/stable-baselines3 ~/.claude/skills/⚠ 제3자가 만든 스킬입니다. 설치 전 원본 저장소를 한 번 확인하세요.
- 터미널을 열고 홈 디렉터리에 스킬 폴더가 있는지 확인합니다:
mkdir -p ~/.claude/skills - 저장소를 복제합니다:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - 이 스킬만 복사합니다:
cp -r scientific-agent-skills/skills/stable-baselines3 ~/.claude/skills/ - Python 환경을 준비합니다(Python 3.10 이상):
uv pip install 'stable-baselines3[extra]>=2.8' - 설치 확인:
python -c "import stable_baselines3; print(stable_baselines3.__version__)" - Claude Code를 재시작한 뒤 "PPO로 CartPole 학습 스크립트 만들어줘"처럼 요청하면 스킬이 활성화됩니다.
GitHub에서 원본 보기 ↗라이선스: MIT