
四大 AI 編程工具全通用image-vision 開源發(fā)布附保姆級安裝教程現(xiàn)在很多人搭 AI 編程環(huán)境都是同一個思路強 Harness 高性價比純文本模型。比如 Codex / opencode / Claude Code 配上 DeepSeek、GLM、Kimi 這類模型——編碼能力扎實、成本又低作為日常開發(fā)底座非常香。但這套組合有一個明顯短板這些模型沒有多模態(tài)能力看不了圖片。貼張報錯截圖、設(shè)計稿過去模型只會回你抱歉我無法查看圖片。解決方式很簡單不用換模型裝一個 Skill 就行。今天開源的image-vision在主模型之外掛一個視覺模型做眼睛圖片先交給視覺模型理解轉(zhuǎn)成文字描述回灌給主模型繼續(xù)推理——既保住編碼能力和性價比又補齊看圖短板。而且它不是只服務(wù)某一個工具一份 Skillopencode / Claude Code / Z.ai zcode / Codex 四大平臺全通用。 兩大買點1?? 四大平臺一次安裝全搞定opencode / Claude Code / Z.ai zcode / Codex 通吃混用多個工具也不用重復折騰。2?? 視覺模型提供商隨便換OpenAI gpt-4o、通義千問 Qwen-VL、智譜 GLM-4V、SiliconFlow、本地 vLLM / Ollama……只要接口兼容 OpenAI 就能接。換廠商只改配置三行代碼一行不動。 工作原理一張圖看懂用戶上傳圖片 ↓ 主模型純文本看不到圖 ↓ 自動運行 vision.py零依賴 Python 腳本 圖片 base64 編碼 → OpenAI 兼容接口 → 視覺模型 ↓ 返回文字描述 → 回灌給主模型 → 整合后回答用戶全程對用戶透明——就像模型本來就能看圖。 安裝教程重點來了 最懶人的方式一句話讓 AI 自己裝不用看文檔、不用敲命令打開對話把這句話扔給 AI 就行按 https://github.com/wangxintai929/image-vision-skill 的 README 幫我配置識圖能力全局安裝AI 會自動完成下載、安裝、寫配置并根據(jù)你的回答填入視覺模型參數(shù)看到配置檢查通過即完成。網(wǎng)絡(luò)不好訪問 GitHub也可以下載 ZIP 解壓到本地再裝在倉庫頁面點Code→Download ZIP解壓后對 AI 說一句安裝 D:\Job\code\image-vision-skill-main把路徑換成你的實際解壓目錄即可后續(xù)步驟完全一樣。、 加不加全局安裝有區(qū)別不加只在當前項目/會話生效加了之后所有會話都能用推薦全局。方式一opencode 遠程加載一行配置在opencode.json全局~/.config/opencode/opencode.json或項目內(nèi)加入{ skills: { urls: [https://cdn.jsdelivr.net/gh/wangxintai929/image-vision-skillmain/] } }重啟 opencode自動從 GitHub 拉取 Skill 和腳本連文件都不用復制。倉庫版本更新后重啟自動拉取新版。方式二一鍵安裝腳本所有平臺通用git clone https://github.com/wangxintai929/image-vision-skill.git cd image-vision-skill ./install.sh # macOS / Linux # Windows: powershell -ExecutionPolicy Bypass -File install.ps1腳本自動完成四件事復制腳本到統(tǒng)一目錄~/.config/image-vision/各平臺共用一份→ 生成config.json→ 把 Skill 裝到 opencode 和 Claude Code 的 skills 目錄 → 執(zhí)行配置檢查。方式三手動安裝下載 ZIP 解壓后把SKILL.md復制到對應平臺的 skills 目錄平臺安裝位置opencode~/.config/opencode/skills/image-vision/Claude Code~/.claude/skills/image-vision/SKILL.mdZ.ai zcode~/.zcode/skills/image-vision/SKILL.md注意zcode 不掃~/.claude/skills/Codex無 Skill 機制在~/.codex/AGENTS.md追加一段指令兜底照樣能用 配置視覺模型從哪來配置只需三項API 地址、API Key、模型名稱。不用打開任何配置文件直接在對話里告訴 AI它會自動寫入并驗證。還沒想好用哪家國內(nèi)用戶可以優(yōu)先考慮阿里云百煉——新用戶開通即送免費調(diào)用額度視覺模型基本可以零成本先跑起來拿來體驗整個識圖流程再合適不過打開百煉平臺大模型服務(wù)平臺百煉控制臺開通服務(wù)后在控制臺創(chuàng)建 API Keysk-...然后對 AI 說一句視覺后端用百煉地址 https://dashscope.aliyuncs.com/compatible-mode/v1key 是 sk-xxxx模型 qwen-vl-max看到配置檢查通過接入完成用其他廠商同理把三項參數(shù)發(fā)給 AI 即可。已登錄 opencode-go 的用戶更省事key 現(xiàn)成可用mimo-v2.5等視覺模型按量計費、開箱即用。? 實測驗證裝好后發(fā)一張測試圖確認鏈路打通python ~/.config/image-vision/vision.py test.png -q 圖片里有什么識別速度很快幾秒到十幾秒即可返回報錯截圖、設(shè)計稿、多圖對比都能準確識別。 進階命令免確認可選默認模型執(zhí)行識別命令會彈一次確認加一行配置放行其余命令仍保持確認opencode / zcodeopencode.json中*vision.py*: allowClaude Codesettings.json中Bash(python:*vision.py*) 純 Python 標準庫實現(xiàn)零第三方依賴Python 3.7 就能跑。一套 Skill 打通四大平臺 所有 OpenAI 兼容視覺模型給你的高性價比編程組合補上最后一塊拼圖。歡迎試用、提 Issue、點 Star ? GitHubhttps://github.com/wangxintai929/image-vision-skill