Đánh giá bảo mật AI (ai-security)
Kỹ năng rà soát rủi ro prompt injection, jailbreak, model inversion, đầu độc dữ liệu và lạm dụng công cụ của agent theo khung MITRE ATLAS.
Bảo mật · ReviewNâng cao★ 24,151⑂ 3,405Điểm AI 8/10Cập nhật lần cuối: 9 thg 8, 2026
Kỹ năng này làm gì
Đây không phải kiểm thử bảo mật ứng dụng thông thường, mà chuyên cho hệ thống AI/ML và agent LLM.
- Phát hiện chữ ký prompt injection: ghi đè vai trò, injection gián tiếp, rò rỉ system prompt, lạm dụng tool
- Phân loại kỹ thuật jailbreak và quy trình kiểm thử khả năng kháng cự
- Chấm điểm rủi ro model inversion theo mức truy cập (black/gray/white-box)
- Chấm điểm rủi ro đầu độc dữ liệu theo phạm vi fine-tuning/RLHF/RAG
- Ánh xạ phát hiện sang kỹ thuật MITRE ATLAS (AML.T0051, T0056, T0020...)
- Mẫu thiết kế guardrail cho đầu vào, đầu ra và agent, kèm 7 anti-pattern
- Công cụ CLI
scripts/ai_threat_scanner.pyvới mã thoát dùng để chặn triển khai
Phù hợp với ai
- Đội phát triển sắp mở tính năng LLM cho người dùng cuối
- Kỹ sư vận hành hệ thống RAG hoặc agent có quyền gọi tool
- Chuyên viên AI red team, AppSec, tuân thủ bảo mật
- Nhóm nền tảng muốn thêm cổng kiểm thử prompt đối kháng vào CI/CD
Ví dụ sử dụng
- Quét nhanh 20 phút trước khi phát hành: chạy bộ prompt mẫu ở chế độ black-box, xem
overall_risk; nếu critical thì dừng triển khai. - Rà soát hệ RAG: kiểm tra mẫu injection gián tiếp trong tài liệu được truy xuất và thiết lập bước xác thực nội dung trước khi lập chỉ mục.
- Cổng CI/CD: quét
tests/adversarial_prompts.json, xuất báo cáo JSON và cho pipeline fail khi mức rủi ro là critical.
· · · Hướng dẫn cài đặt · · ·
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục .gemini/skills/ai-security từ repo GitHub alirezarezvani/claude-skills vào ~/.claude/skills/ai-security/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/alirezarezvani/claude-skills.git /tmp/claude-skills && mkdir -p ~/.claude/skills && cp -r /tmp/claude-skills/.gemini/skills/ai-security ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Mở terminal.
- Tải mã nguồn:
git clone https://github.com/alirezarezvani/claude-skills.git - Tạo thư mục kỹ năng:
mkdir -p ~/.claude/skills - Sao chép kỹ năng:
cp -r claude-skills/.gemini/skills/ai-security ~/.claude/skills/ - Kiểm tra bằng
ls ~/.claude/skills/ai-security; xác nhận cóscripts/ai_threat_scanner.pyvàreferences/atlas-coverage.md(nếu thiếu, hãy tìm ở đường dẫn khác trong repo). - Khởi động lại Claude Code và thử yêu cầu: "Kiểm tra rủi ro prompt injection cho tính năng LLM của tôi".
- Chỉ chạy chế độ gray-box/white-box với cờ
--authorizedsau khi có văn bản cho phép kiểm thử.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT