GoForum › 🌐 V2EX
使用 deepseek,外接视觉模型有什么好的便宜的方案推荐
foryou2023 ·
2026-08-07 16:22 ·
0 次点赞 · 5 条回复
deepseek 不是多模态,在实际的使用中写 UI 确实差点意思,感觉好麻烦,特别是调 UI 的时候,感觉不好沟通。
目前实践制作 UI 的流程是让 deepseek 绘制 ascii UI 布局,确定布局之后,就整理提示词使用 gemini 的
stitch 制作原型图,原型图确定了再回到 deepseek 里面制作界面。
实际的过程中就会遇到一些小问题,比如网站 一下 UI 细节或者按钮的大小不一致,deepseek 无法看到,文字
描述的话,deepseek 没有办法一次性搞定。
所以想求一个比较好的使用方案能解决 deepseek 做 UI 视觉上面碰到的问题。
5 条回复
foryou2023 · 2026-08-07 16:32
@smy14520 感谢,我去试试
我自己做了个 OCR 的脚本其实就是调用视觉模型,我可以分享下经验,我试过百炼的 qwen3.6-flash 但是不够 flash ,中大的一张图就得花十秒左右。我让 codex 写脚本测试了 groq/cerabras/google 提供的视觉模型,最终发现同样的图,最快并且准确的最高(因为我是识别理财平台的持仓之类的一些信息,准确度很重要)的是 ~/.hammerspoon master* ❯ cat remote_ocr.lua|grep gemini M.model = “gemini-3.5-flash-lite” ~/.hammerspoon master* ❯
如果你对数字不敏感,其实 groq 和 cerebras 的视觉模型能够更快,描述一个布局什么的,小意思。
但是其实。你也可以让 Agent 通过 MCP 直接链接浏览器,这样就可以更具体的知道真实效果。
添加回复
你还需要 登录
后发表回复
claude code 中使用 智谱的视觉 mcp 多模模型可以自己选一个也可以用 智谱自己的 4.6v