Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
← Về danh sách

Vision — Phân tích ảnh bằng model vision bên ngoài

Gửi ảnh chụp màn hình, mockup UI hay sơ đồ tới các model vision bên ngoài (Doubao, Qwen, DeepSeek, OpenAI, Claude) để nhận mô tả dạng văn bản.

Tiện íchTrung cấp★ 171⑂ 8Điểm AI 9/10Cập nhật lần cuối: 25 thg 8, 2026

Làm được gì

  • Dùng script vision.py để truyền đường dẫn ảnh + prompt tới model vision bên ngoài và nhận lại phần mô tả nội dung ảnh.
  • Hỗ trợ png/jpg/webp/gif; nhà cung cấp được chọn theo thứ tự: cờ --provider → biến VISION_PROVIDER → API key đầu tiên tìm thấy.
  • Ngoài các provider tích hợp (doubao, qwen, deepseek, openai, anthropic), bạn có thể gắn bất kỳ endpoint tương thích OpenAI (vLLM, Ollama, LiteLLM, OpenRouter, Azure...) chỉ bằng {NAME}_API_KEY, {NAME}_BASE_URL, {NAME}_MODEL.
  • Tinh chỉnh model, độ sáng tạo và số token qua VISION_MODEL, VISION_TEMPERATURE, VISION_MAX_TOKENS.
  • Có quy tắc kiểm tra --check-routing: nếu phiên hiện tại đã hiểu ảnh gốc (native) thì bỏ qua công cụ, tránh tốn phí vô ích.

Phù hợp với ai

  • Lập trình viên cần debug hoặc review UI từ ảnh chụp trong môi trường không đọc được ảnh trực tiếp.
  • Người muốn kết nối model Trung Quốc (Doubao, Qwen) hoặc model vision self-hosted vào luồng làm việc Claude Code.
  • Người muốn so sánh chi phí/chất lượng giữa nhiều API vision khác nhau.

Ví dụ sử dụng

  1. python vision.py "screenshot.png" "Mô tả layout trang và các lỗi UI thấy được." — kiểm tra nhanh giao diện.
  2. python vision.py --provider qwen "mockup.png" "Liệt kê tất cả component, màu sắc và khoảng cách." — phân tích mockup thiết kế.
  3. python vision.py -p openai "after.png" "So sánh với spec thiết kế và chỉ ra điểm khác biệt." — kiểm thử hồi quy hình ảnh.

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/xiincs/claude-code-vision-skill/HEAD/vision/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
↓ Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục vision từ repo GitHub xiincs/claude-code-vision-skill vào ~/.claude/skills/vision/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/xiincs/claude-code-vision-skill.git /tmp/claude-code-vision-skill && cp -r /tmp/claude-code-vision-skill/vision ~/.claude/skills/vision

⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Kiểm tra đã có Python 3 và pip: python --version.
  2. Clone repo: git clone https://github.com/xiincs/claude-code-vision-skill.git
  3. Sao chép thư mục skill: mkdir -p ~/.claude/skills && cp -r claude-code-vision-skill/vision ~/.claude/skills/vision
  4. Đặt API key của provider bạn dùng, ví dụ export DASHSCOPE_API_KEY="sk-..." (hoặc DOUBAO_API_KEY, OPENAI_API_KEY, DEEPSEEK_API_KEY, ANTHROPIC_API_KEY).
  5. Muốn cố định provider mặc định thì thêm export VISION_PROVIDER=qwen. Nếu dùng provider anthropic, chạy thêm pip install anthropic.
  6. Mở lại terminal hoặc source ~/.zshrc, rồi thử: python ~/.claude/skills/vision/vision.py "test.png" "Mô tả ảnh này".
  7. Khởi động lại Claude Code và yêu cầu kiểu "phân tích ảnh chụp màn hình này" — skill sẽ tự được gọi.