Vision — Phân tích ảnh bằng model vision bên ngoài
Gửi ảnh chụp màn hình, mockup UI hay sơ đồ tới các model vision bên ngoài (Doubao, Qwen, DeepSeek, OpenAI, Claude) để nhận mô tả dạng văn bản.
Tiện íchTrung cấp★ 171⑂ 8Điểm AI 9/10Cập nhật lần cuối: 25 thg 8, 2026
Làm được gì
- Dùng script
vision.pyđể truyền đường dẫn ảnh + prompt tới model vision bên ngoài và nhận lại phần mô tả nội dung ảnh. - Hỗ trợ png/jpg/webp/gif; nhà cung cấp được chọn theo thứ tự: cờ
--provider→ biếnVISION_PROVIDER→ API key đầu tiên tìm thấy. - Ngoài các provider tích hợp (doubao, qwen, deepseek, openai, anthropic), bạn có thể gắn bất kỳ endpoint tương thích OpenAI (vLLM, Ollama, LiteLLM, OpenRouter, Azure...) chỉ bằng
{NAME}_API_KEY,{NAME}_BASE_URL,{NAME}_MODEL. - Tinh chỉnh model, độ sáng tạo và số token qua
VISION_MODEL,VISION_TEMPERATURE,VISION_MAX_TOKENS. - Có quy tắc kiểm tra
--check-routing: nếu phiên hiện tại đã hiểu ảnh gốc (native) thì bỏ qua công cụ, tránh tốn phí vô ích.
Phù hợp với ai
- Lập trình viên cần debug hoặc review UI từ ảnh chụp trong môi trường không đọc được ảnh trực tiếp.
- Người muốn kết nối model Trung Quốc (Doubao, Qwen) hoặc model vision self-hosted vào luồng làm việc Claude Code.
- Người muốn so sánh chi phí/chất lượng giữa nhiều API vision khác nhau.
Ví dụ sử dụng
python vision.py "screenshot.png" "Mô tả layout trang và các lỗi UI thấy được."— kiểm tra nhanh giao diện.python vision.py --provider qwen "mockup.png" "Liệt kê tất cả component, màu sắc và khoảng cách."— phân tích mockup thiết kế.python vision.py -p openai "after.png" "So sánh với spec thiết kế và chỉ ra điểm khác biệt."— kiểm thử hồi quy hình ảnh.
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/xiincs/claude-code-vision-skill/HEAD/vision/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục vision từ repo GitHub xiincs/claude-code-vision-skill vào ~/.claude/skills/vision/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/xiincs/claude-code-vision-skill.git /tmp/claude-code-vision-skill && cp -r /tmp/claude-code-vision-skill/vision ~/.claude/skills/vision⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Kiểm tra đã có Python 3 và pip:
python --version. - Clone repo:
git clone https://github.com/xiincs/claude-code-vision-skill.git - Sao chép thư mục skill:
mkdir -p ~/.claude/skills && cp -r claude-code-vision-skill/vision ~/.claude/skills/vision - Đặt API key của provider bạn dùng, ví dụ
export DASHSCOPE_API_KEY="sk-..."(hoặcDOUBAO_API_KEY,OPENAI_API_KEY,DEEPSEEK_API_KEY,ANTHROPIC_API_KEY). - Muốn cố định provider mặc định thì thêm
export VISION_PROVIDER=qwen. Nếu dùng provider anthropic, chạy thêmpip install anthropic. - Mở lại terminal hoặc
source ~/.zshrc, rồi thử:python ~/.claude/skills/vision/vision.py "test.png" "Mô tả ảnh này". - Khởi động lại Claude Code và yêu cầu kiểu "phân tích ảnh chụp màn hình này" — skill sẽ tự được gọi.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT