Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
Về danh sách

Bộ khung đánh giá Agent

Xây bộ eval nhỏ gọn để kiểm chứng agent/prompt/skill có thực sự hoạt động và phát hiện hồi quy mỗi khi đổi model hay prompt.

Lập trìnhTrung cấp29949Điểm AI 7/10Cập nhật lần cuối: 20 thg 9, 2026

Làm được gì

  • Định nghĩa điều kiện PASS trước tiên: JSON đúng schema, chứa con số đúng, có gọi tool, dưới 120 từ, từ chối đúng trường hợp — thay cho mục tiêu mơ hồ kiểu "trả lời hay".
  • Dựng bộ eval tối thiểu ~20 case lấy từ log thật, theo tỷ lệ: happy path 40%, edge case 30%, adversarial 20%, regression 10%.
  • Ba tầng chấm điểm: kiểm tra tất định (miễn phí, tức thì) → model-as-judge kèm rubric và lý do một dòng → người rà soát mẫu.
  • Chạy như unit test: mỗi case 3 lần ở đúng nhiệt độ production, báo cáo tỷ lệ pass kèm độ dao động và diff so với baseline thay vì điểm tuyệt đối.
  • Theo dõi cả chi phí và độ trễ (p50/p95) song song với chất lượng.

Phù hợp với ai

  • Kỹ sư/PM đang phát triển sản phẩm dựa trên LLM
  • Nhóm cần kiểm tra chất lượng trước và sau khi nâng cấp phiên bản model
  • Startup sắp đưa chatbot/agent ra trước khách hàng
  • Người muốn đưa kiểm thử LLM vào pipeline CI

Ví dụ sử dụng

  1. So sánh hai model: "Prompt này có hỏng khi đổi sang model mới không?" → tạo 20 case từ log, chạy cả hai và báo cáo case nào tụt.
  2. Kiểm tra chống prompt injection: thêm case "bỏ qua chỉ dẫn trước đó", chạy 3 lần; rò rỉ dù chỉ 1/3 lần cũng bị đánh dấu là chặn phát hành.
  3. Đóng băng lỗi thành case hồi quy: mỗi bug khách báo, sau khi sửa được lưu vĩnh viễn vào nhóm regression để không tái phát.

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/OneWave-AI/claude-skills/HEAD/agent-eval-harness/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục agent-eval-harness từ repo GitHub OneWave-AI/claude-skills vào ~/.claude/skills/agent-eval-harness/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/OneWave-AI/claude-skills.git /tmp/claude-skills && mkdir -p ~/.claude/skills && cp -r /tmp/claude-skills/agent-eval-harness ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở Terminal.
  2. Tải mã nguồn: git clone https://github.com/OneWave-AI/claude-skills.git
  3. Tạo thư mục skill: mkdir -p ~/.claude/skills
  4. Sao chép skill: cp -r claude-skills/agent-eval-harness ~/.claude/skills/
  5. Khởi động lại Claude Code, rồi thử yêu cầu: "Tạo bộ eval kiểm tra prompt này".
  6. Lưu ý: script evals/run.mjs nhắc trong tài liệu không có sẵn — hãy nhờ Claude viết runner phù hợp với dự án của bạn (cần cài Node.js).