Claude Skill MartKhám phá skillCâu dùng ngayHọc qua videoDùng terminalSkill là gì?
Về danh sách

Vision — Phân tích ảnh đa nhà cung cấp

Skill gọi các mô hình thị giác (Doubao, Qwen, OpenAI, Anthropic) để mô tả ảnh chụp màn hình, giao diện UI và sơ đồ bằng văn bản.

Tiện íchTrung cấp1715Điểm AI 9/10Cập nhật lần cuối: 3 thg 8, 2026

Làm được gì

  • Chạy script vision.py với đường dẫn ảnh và câu hỏi, nhận lại phần mô tả bằng văn bản từ mô hình thị giác.
  • Hỗ trợ sẵn 4 nhà cung cấp: Doubao (Volcengine Ark), Qwen (DashScope), OpenAI GPT-4o và Anthropic Claude; thứ tự chọn là cờ --provider → biến VISION_PROVIDER → API key đầu tiên tìm thấy.
  • Có thể thêm nhà cung cấp tùy ý chỉ bằng biến môi trường {TÊN}_API_KEY, {TÊN}_BASE_URL, {TÊN}_MODEL — hợp với vLLM, Ollama, LiteLLM, OpenRouter, Azure OpenAI hay proxy tự dựng.
  • Tùy chỉnh VISION_TEMPERATURE, VISION_MAX_TOKENS và model theo từng provider.
  • Hỗ trợ png/jpg/webp/gif; khuyến nghị kiểm tra --check-routing trước để tránh gọi thừa khi phiên đã tự xem được ảnh.

Phù hợp với ai

  • Lập trình viên làm việc trong môi trường CLI không nhìn thấy ảnh trực tiếp.
  • Kỹ sư frontend/thiết kế cần kiểm tra hồi quy giao diện hoặc đối chiếu bản mockup.
  • Nhóm dùng mô hình thị giác tự host hoặc nhà cung cấp khu vực như Doubao, Qwen.

Ví dụ sử dụng

  1. python vision.py "screenshot.png" "Mô tả bố cục trang và các lỗi UI thấy được."
  2. python vision.py --provider qwen "mockup.png" "Liệt kê toàn bộ component, màu sắc và khoảng cách."
  3. python vision.py -p openai "after.png" "So sánh với design spec và chỉ ra điểm khác biệt."

· · · Hướng dẫn cài đặt · · ·

Dùng thử ngay, không cần cài

Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.

Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình:
https://raw.githubusercontent.com/xiincs/claude-code-vision-skill/HEAD/vision/SKILL.md

Mình muốn: (viết việc bạn cần ở đây)

Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.

Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.

Cài vào ứng dụng Claude (không cần terminal)
  1. Tải tệp ZIP bằng nút bên dưới.
  2. Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
  3. Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Tải ZIP
Cài vào Claude Code

Để Claude làm — dán câu dưới đây vào Claude Code

Hãy cài skill mình tìm thấy trên Claude Skill Mart.
Copy thư mục vision từ repo GitHub xiincs/claude-code-vision-skill vào ~/.claude/skills/vision/ của mình.
Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.

Cài bằng lệnh thủ công

git clone https://github.com/xiincs/claude-code-vision-skill.git /tmp/vision-skill && mkdir -p ~/.claude/skills && cp -r /tmp/vision-skill/vision ~/.claude/skills/

Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.

  1. Tải mã nguồn: git clone https://github.com/xiincs/claude-code-vision-skill.git
  2. Sao chép thư mục skill: mkdir -p ~/.claude/skills && cp -r claude-code-vision-skill/vision ~/.claude/skills/
  3. Đảm bảo máy có Python 3. Nếu định dùng provider Anthropic, chạy thêm pip install anthropic.
  4. Khai báo API key của nhà cung cấp bạn chọn, ví dụ: export OPENAI_API_KEY="sk-..." (hoặc DOUBAO_API_KEY, DASHSCOPE_API_KEY, ANTHROPIC_API_KEY).
  5. Muốn cố định nhà cung cấp mặc định thì thêm export VISION_PROVIDER=openai vào file cấu hình shell (~/.zshrc, ~/.bashrc).
  6. Khởi động lại Claude Code và thử yêu cầu "phân tích ảnh chụp màn hình này".
  7. Nếu lỗi, chạy python vision.py --check-routing trong thư mục skill để kiểm tra trạng thái định tuyến và biến môi trường.