Trợ lý Stable Baselines3 (Học tăng cường)
Skill hướng dẫn huấn luyện, đánh giá và xây môi trường tùy chỉnh cho RL bằng Stable Baselines3 (PPO, SAC, DQN...).
Lập trìnhNâng cao★ 33,030⑂ 3,248Điểm AI 9/10Cập nhật lần cuối: 9 thg 8, 2026
Skill này làm được gì
- Cung cấp mẫu code chuẩn cho SB3 2.8: huấn luyện PPO, SAC, DQN, TD3, DDPG, A2C với API giống scikit-learn.
- Hướng dẫn viết môi trường Gymnasium tùy chỉnh (
reset,step, ràng buộc observation ảnh uint8, kiểm tra bằngcheck_env). - Bao trùm vectorized env (DummyVecEnv/SubprocVecEnv), callback (EvalCallback, CheckpointCallback, callback tự viết), lưu/tải model,
evaluate_policyvà ghi video. - Kèm mẹo chọn thuật toán, learning rate schedule, HER, TensorBoard và cách xử lý lỗi bộ nhớ hoặc huấn luyện chậm.
Phù hợp với ai
- Nghiên cứu sinh, sinh viên cần chạy thí nghiệm RL nhanh và đúng chuẩn.
- ML engineer muốn bọc mô phỏng riêng thành môi trường Gymnasium để huấn luyện agent.
- Người làm RL đơn agent (không phải multi-agent hay huấn luyện song song cực lớn).
Ví dụ sử dụng
- "Huấn luyện PPO trên CartPole và lưu model tốt nhất" → sinh script huấn luyện kèm EvalCallback.
- "Chuyển mô phỏng của tôi thành môi trường Gymnasium" → dùng
custom_env_template.pyvà quy trình kiểm tracheck_env. - "SAC huấn luyện quá chậm" → gợi ý SubprocVecEnv,
gradient_steps=-1, giảmbuffer_size.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/K-Dense-AI/scientific-agent-skills/HEAD/skills/stable-baselines3/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/stable-baselines3 từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/stable-baselines3/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/stable-baselines3 ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal và tạo thư mục skill:
mkdir -p ~/.claude/skills - Clone repo:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Copy đúng skill này:
cp -r scientific-agent-skills/skills/stable-baselines3 ~/.claude/skills/ - Cài thư viện (cần Python 3.10+):
uv pip install 'stable-baselines3[extra]>=2.8' - Kiểm tra:
python -c "import stable_baselines3; print(stable_baselines3.__version__)" - Khởi động lại Claude Code, rồi thử yêu cầu: "viết script huấn luyện PPO cho CartPole".
Xem mã nguồn trên GitHub ↗Giấy phép: MIT