Thiết kế đánh giá AI Agent
Kỹ năng giúp thiết kế quy trình đánh giá AI agent có thể tái lập: bộ dữ liệu, rubric, cổng chặn hồi quy và quyết định phát hành.
Lập trìnhNâng cao★ 154⑂ 32Điểm AI 9/10Cập nhật lần cuối: 9 thg 8, 2026
Kỹ năng này làm gì
Biến việc "cảm thấy agent tốt hơn" thành bằng chứng có thể kiểm chứng.
- Xác định đơn vị được kiểm thử và tách lỗi mô hình khỏi lỗi tool, truy hồi, chính sách, hạ tầng
- Xây bộ ca kiểm thử đại diện cùng ca biên, đuôi dài, đầu vào lỗi, tool hỏng, prompt injection; giữ tập holdout riêng
- Chọn cách chấm ít chủ quan nhất: kiểm tra tất định, model grader theo rubric, hoặc review người mù thông tin
- Đóng băng prompt, phiên bản mô hình, seed, retry, timeout để so sánh baseline và candidate cùng điều kiện
- Xuất bảng phân loại lỗi, độ bất định, cổng phát hành và memo quyết định ship / hold / rollout giới hạn
- Dùng
scripts/aggregate_results.pyđể kiểm tra biên điểm, nhãn thiếu và mẫu số tỉ lệ pass
Phù hợp với ai
- Kỹ sư triển khai agent/copilot LLM cần căn cứ để quyết định phát hành
- Nhóm muốn xác nhận việc đổi prompt hoặc mô hình thực sự cải thiện chất lượng
- QA, platform engineer muốn biến sự cố production thành ca kiểm thử hồi quy
Ví dụ sử dụng
- "So sánh agent hỗ trợ khách hàng v1 và v2": định nghĩa độ đúng, độ trung thực trích dẫn, tuân thủ chính sách, độ trễ, chi phí; ẩn nhãn phiên bản; chạy 3 lần và trả về quyết định
- "Kiểm tra thay đổi prompt có gây hồi quy không": tính delta so với baseline trên tập holdout và phân tích theo từng nhóm ca
- "Chuyển 20 lỗi thực tế thành fixture hồi quy": loại bỏ dữ liệu riêng tư rồi đưa vào cổng phát hành
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/seb1n/awesome-ai-agent-skills/HEAD/agent-engineering/agent-evaluation/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục agent-engineering/agent-evaluation từ repo GitHub seb1n/awesome-ai-agent-skills vào ~/.claude/skills/agent-evaluation/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/seb1n/awesome-ai-agent-skills.git && mkdir -p ~/.claude/skills && cp -r awesome-ai-agent-skills/agent-engineering/agent-evaluation ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal.
- Tải repo:
git clone https://github.com/seb1n/awesome-ai-agent-skills.git - Tạo thư mục skill:
mkdir -p ~/.claude/skills - Sao chép kỹ năng:
cp -r awesome-ai-agent-skills/agent-engineering/agent-evaluation ~/.claude/skills/ - Kiểm tra đã có thư mục
references/vàscripts/:ls ~/.claude/skills/agent-evaluation - Nếu muốn chạy script tổng hợp, kiểm tra Python:
python3 --version - Khởi động lại Claude Code và yêu cầu "lập kế hoạch đánh giá agent" để kích hoạt kỹ năng.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT