Khởi tạo bộ Eval (evals-bootstrap)
Biến các lỗi thật của agent thành bộ eval kiểm tra hành vi dựa trên trace, kèm runner chạy bằng một lệnh.
Lập trìnhTrung cấp★ 815⑂ 128Điểm AI 9/10Cập nhật lần cuối: 29 thg 9, 2026
Làm được gì
- Đọc log/transcript của agent để thu thập tối đa 20 lỗi thật, rồi nhóm thành 4–8 hành vi cần kiểm tra.
- Sinh
cases.yaml: mỗi lỗi một case vớiinput,expect(cho người đọc) vàcheck(luật kiểm tra:trace has X,trace has X before Y,trace lacks X). - Nếu chưa có trace, hướng dẫn thiết lập lưu mỗi lần chạy thành
traces/<id>.json. - Tạo runner
check_traces.pygọn nhẹ (chỉ cầnpyyaml), in kết quả pass/fail và exit khác 0 khi có lỗi để gắn vào CI. - Kết thúc bằng vòng lặp vận hành: đọc trace mới hằng tuần, thêm case, sửa nhóm lỗi lớn nhất, chạy lại.
Phù hợp với ai
- Lập trình viên xây agent LLM có gọi tool, lo bị hồi quy khi đổi prompt hoặc model.
- Nhóm chưa có hệ thống đánh giá và cần dựng "golden set" đầu tiên.
- Người muốn kiểm tra xác định (deterministic), nhanh, không tốn lời gọi model.
Ví dụ sử dụng
- "Tôi vừa đổi prompt, làm sao biết không hỏng gì?" → skill đào lỗi từ transcript cũ và dựng bộ hồi quy.
- Agent trả lời đơn hoàn tiền mà chưa tra đơn → thêm case
trace has get_order before send_reply. - Agent hoàn tiền không xin phê duyệt → chốt luật
trace has approval_request before refundvà gắnpython check_traces.pyvào CI.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/undefined-ui/second-brain-os/HEAD/plugins/agents-course/skills/evals-bootstrap/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục plugins/agents-course/skills/evals-bootstrap từ repo GitHub undefined-ui/second-brain-os vào ~/.claude/skills/evals-bootstrap/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/undefined-ui/second-brain-os.git && mkdir -p ~/.claude/skills && cp -r second-brain-os/plugins/agents-course/skills/evals-bootstrap ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal.
- Clone repo:
git clone https://github.com/undefined-ui/second-brain-os.git - Tạo thư mục skill:
mkdir -p ~/.claude/skills - Copy skill:
cp -r second-brain-os/plugins/agents-course/skills/evals-bootstrap ~/.claude/skills/ - Chuẩn bị Python 3 và thư viện:
pip install pyyaml - Khởi động lại Claude Code, rồi yêu cầu ví dụ: "dựng bộ eval cho agent của tôi".
- Cung cấp đường dẫn log/transcript các lần chạy để skill bắt đầu trích xuất case.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT