Vision — Phân tích ảnh đa nhà cung cấp
Skill gọi các mô hình thị giác (Doubao, Qwen, OpenAI, Anthropic) để mô tả ảnh chụp màn hình, giao diện UI và sơ đồ bằng văn bản.
Tiện íchTrung cấp★ 171⑂ 5Điểm AI 9/10Cập nhật lần cuối: 3 thg 8, 2026
Làm được gì
- Chạy script
vision.pyvới đường dẫn ảnh và câu hỏi, nhận lại phần mô tả bằng văn bản từ mô hình thị giác. - Hỗ trợ sẵn 4 nhà cung cấp: Doubao (Volcengine Ark), Qwen (DashScope), OpenAI GPT-4o và Anthropic Claude; thứ tự chọn là cờ
--provider→ biếnVISION_PROVIDER→ API key đầu tiên tìm thấy. - Có thể thêm nhà cung cấp tùy ý chỉ bằng biến môi trường
{TÊN}_API_KEY,{TÊN}_BASE_URL,{TÊN}_MODEL— hợp với vLLM, Ollama, LiteLLM, OpenRouter, Azure OpenAI hay proxy tự dựng. - Tùy chỉnh
VISION_TEMPERATURE,VISION_MAX_TOKENSvà model theo từng provider. - Hỗ trợ png/jpg/webp/gif; khuyến nghị kiểm tra
--check-routingtrước để tránh gọi thừa khi phiên đã tự xem được ảnh.
Phù hợp với ai
- Lập trình viên làm việc trong môi trường CLI không nhìn thấy ảnh trực tiếp.
- Kỹ sư frontend/thiết kế cần kiểm tra hồi quy giao diện hoặc đối chiếu bản mockup.
- Nhóm dùng mô hình thị giác tự host hoặc nhà cung cấp khu vực như Doubao, Qwen.
Ví dụ sử dụng
python vision.py "screenshot.png" "Mô tả bố cục trang và các lỗi UI thấy được."python vision.py --provider qwen "mockup.png" "Liệt kê toàn bộ component, màu sắc và khoảng cách."python vision.py -p openai "after.png" "So sánh với design spec và chỉ ra điểm khác biệt."
· · · Hướng dẫn cài đặt · · ·
Dùng thử ngay, không cần cài
Dán đoạn dưới vào Claude là dùng được skill này mà không cần cài đặt.
Hãy đọc hướng dẫn trong tệp này và làm theo để giúp mình: https://raw.githubusercontent.com/xiincs/claude-code-vision-skill/HEAD/vision/SKILL.md Mình muốn: (viết việc bạn cần ở đây)
Nếu Claude không mở được liên kết, hãy mở liên kết và copy nội dung vào rồi dán.
↓ Thấy hữu ích thì tải ZIP bên dưới và cài. Sau đó skill tự chạy, không phải dán lại mỗi lần.
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục vision từ repo GitHub xiincs/claude-code-vision-skill vào ~/.claude/skills/vision/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/xiincs/claude-code-vision-skill.git /tmp/vision-skill && mkdir -p ~/.claude/skills && cp -r /tmp/vision-skill/vision ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Tải mã nguồn:
git clone https://github.com/xiincs/claude-code-vision-skill.git - Sao chép thư mục skill:
mkdir -p ~/.claude/skills && cp -r claude-code-vision-skill/vision ~/.claude/skills/ - Đảm bảo máy có Python 3. Nếu định dùng provider Anthropic, chạy thêm
pip install anthropic. - Khai báo API key của nhà cung cấp bạn chọn, ví dụ:
export OPENAI_API_KEY="sk-..."(hoặcDOUBAO_API_KEY,DASHSCOPE_API_KEY,ANTHROPIC_API_KEY). - Muốn cố định nhà cung cấp mặc định thì thêm
export VISION_PROVIDER=openaivào file cấu hình shell (~/.zshrc, ~/.bashrc). - Khởi động lại Claude Code và thử yêu cầu "phân tích ảnh chụp màn hình này".
- Nếu lỗi, chạy
python vision.py --check-routingtrong thư mục skill để kiểm tra trạng thái định tuyến và biến môi trường.
Xem mã nguồn trên GitHub ↗Giấy phép: MIT