Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
Về danh sách

Bộ khung đánh giá LLM

Đo lường thực tế endpoint LLM tương thích OpenAI/Anthropic trên 6 trục: khả dụng, độ trung thực request, tốc độ, đồng thời, tuân thủ protocol và chất lượng.

Lập trìnhNâng cao1,323212Điểm AI 9/10Cập nhật lần cuối: 8 thg 8, 2026

Làm được gì

Chỉ cần base_url + tên model + API key nằm trong biến môi trường, skill sẽ đo số thật thay vì tin số quảng cáo của nhà cung cấp.

  • Khả dụng: model ID nào thực sự có route, phân loại lỗi 3 trạng thái (no-channel / upstream-error / empty-content), giữ max_tokens 8192 để model reasoning không bị coi là "chết".
  • Độ trung thực request: cắm mã canary để kiểm tra system prompt / tools / history có thật sự tới model hay bị gateway âm thầm bỏ. Đây là lỗi khó bắt nhất: vẫn trả 200 và chat trôi chảy nhưng system prompt không bao giờ đến.
  • Tốc độ: TTFT + tok/s giải mã bền vững, có tính cả reasoning_content để tránh bẫy đo 750 tok/s thành 4700 tok/s.
  • Đồng thời: tăng dần 10/20/40/60 để tìm điểm sụp (tỉ lệ thành công, p50/p90), tắt proxy môi trường và keep-alive để đo đúng model.
  • Tuân thủ protocol: kiểm tra riêng hai đường code của Anthropic thinking — sinh block khi được yêu cầu, và có chấp nhận block thinking cũ khi replay history (nguyên nhân lỗi 400 làm đứt session của client agentic).
  • Hồi quy chất lượng: chạy bộ use-case của bạn rồi cho 3 agent chấm mù độc lập, chỉ tính đạt khi đa số đồng thuận, đồng thời tính precision theo từng nhóm tag.

Key luôn truyền qua --key-env (tên biến môi trường), không bao giờ lộ trong ps, history shell hay báo cáo.

Dành cho ai

  • Dev / platform engineer cần thẩm định nhà cung cấp hoặc gateway LLM trước khi tích hợp
  • Người phụ trách danh sách "model được hỗ trợ", cổng kiểm tra khi triển khai, hoặc canary thường trú
  • Ai đang debug các triệu chứng mơ hồ: "model phớt lờ system prompt", "dùng một lúc thì báo 400"
  • Nhóm cần biết endpoint chịu được bao nhiêu request song song trước buổi workshop/demo

Ví dụ sử dụng

  1. Tích hợp kênh mới: chạy availability probe để lọc model ID hợp lệ, rồi fidelity probe với --repeat 10 xem tỉ lệ system prompt được chuyển tới model.
  2. Kiểm chứng tok/s quảng cáo: speed_probe.py --mode both để báo cáo riêng throughput tác vụ thật và trần giải mã bền vững.
  3. Truy vết đứt session: dùng protocol_probe.py --check history-replay để tái hiện lỗi 400 "invalid part type: thinking", sau đó lập gói bằng chứng gửi nhà cung cấp theo tài liệu kèm theo.

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/daymade/claude-code-skills/HEAD/llm-eval-harness/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục llm-eval-harness từ repo GitHub daymade/claude-code-skills vào ~/.claude/skills/llm-eval-harness/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/daymade/claude-code-skills.git && mkdir -p ~/.claude/skills && cp -r claude-code-skills/llm-eval-harness ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Mở terminal và clone repo: git clone https://github.com/daymade/claude-code-skills.git
  2. Tạo thư mục skill: mkdir -p ~/.claude/skills
  3. Copy đúng skill này: cp -r claude-code-skills/llm-eval-harness ~/.claude/skills/
  4. Cài uv để chạy các script Python (nếu chưa có): curl -LsSf https://astral.sh/uv/install.sh | sh
  5. Khai báo API key qua biến môi trường: export MY_KEY=sk-... (đừng đặt giá trị key trực tiếp trên dòng lệnh)
  6. Khởi động lại Claude Code và yêu cầu kiểu "đo tốc độ và độ ổn định của endpoint này", kèm base_url và tên model.
  7. (Tuỳ chọn) Đặt bộ use-case riêng ở ~/.llm-eval/usecases.json; có thể copy từ assets/example_usecases.json để bắt đầu.