Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
Về danh sách

Framework Benchmark cho Agent

Skill thiết kế hệ thống đo điểm chất lượng phản hồi của agent AI và so sánh với baseline để phát hiện suy giảm trước khi lên production.

Lập trìnhNâng cao53044Điểm AI 7/10Cập nhật lần cuối: 8 thg 8, 2026

Skill này làm gì

  • Cung cấp rubric chấm điểm 0–100 cho từng agent: Đầy đủ (30) / Chính xác (30) / Khả thi hành động (20) / Tuân thủ định dạng (20).
  • Định nghĩa cấu trúc thư mục chuẩn: fixtures (input mẫu), ground-truth (kết quả mong đợi dạng JSON), rubrics, baselines, results.
  • Quy tắc phát hiện regression rõ ràng: giảm >10 điểm ở một fixture, giảm >5 điểm trung bình, fixture từ PASS thành FAIL, format compliance dưới 80.
  • Bảng chỉ số theo dõi: accuracy, completeness, tỷ lệ false positive, thời gian phản hồi p50/p95, token trung bình, pass rate.
  • Ví dụ GitHub Actions để chặn merge khi phát hiện regression.

Phù hợp với ai

  • Người đang vận hành nhiều sub-agent/skill tùy chỉnh và thường xuyên chỉnh prompt.
  • Người muốn biết bằng con số liệu việc sửa prompt có thật sự tốt hơn hay không.
  • Team muốn có cổng kiểm soát chất lượng agent ngay trong CI.

Ví dụ sử dụng

  1. Trước khi sửa định nghĩa agent code-reviewer, chạy --save-as before, sau khi sửa chạy --compare before để xem điểm từng fixture thay đổi thế nào.
  2. Viết fixture missing-error-handling.ts cùng file ground truth, kiểm tra tự động xem agent có phát hiện thiếu try/catch ở mức HIGH không.
  3. Chạy bộ regression hàng tuần cho security-reviewer; nếu điểm tụt từ 88 xuống 61 vì bỏ sót SQL injection, dùng báo cáo đó làm căn cứ revert thay đổi.

Lưu ý: script node ~/.claude/benchmarks/run.mjs không được đóng kèm trong skill — bạn phải tự viết theo đặc tả hoặc nhờ Claude tạo.

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/vibeeval/vibecosystem/HEAD/skills/agent-benchmark/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục skills/agent-benchmark từ repo GitHub vibeeval/vibecosystem vào ~/.claude/skills/agent-benchmark/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/vibeeval/vibecosystem.git /tmp/vibecosystem && mkdir -p ~/.claude/skills && cp -r /tmp/vibecosystem/skills/agent-benchmark ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở terminal (macOS dùng Terminal, Windows dùng WSL hoặc Git Bash).
  2. Clone repo: git clone https://github.com/vibeeval/vibecosystem.git
  3. Tạo thư mục skill: mkdir -p ~/.claude/skills
  4. Copy skill: cp -r vibecosystem/skills/agent-benchmark ~/.claude/skills/
  5. Khởi động lại Claude Code và kiểm tra skill agent-benchmark đã xuất hiện trong danh sách.
  6. Kiểm tra Node.js phiên bản 18+: node -v
  7. Yêu cầu Claude Code: "Hãy tạo thư mục ~/.claude/benchmarks và script run.mjs theo đúng đặc tả của skill agent-benchmark".
  8. Tạo 1 fixture và 1 file ground-truth đầu tiên, chạy benchmark rồi lưu lại baseline.