GoForum🌐 V2EX

使用 deepseek,外接视觉模型有什么好的便宜的方案推荐

foryou2023 · 2026-08-07 16:22 · 0 次点赞 · 5 条回复

deepseek 不是多模态,在实际的使用中写 UI 确实差点意思,感觉好麻烦,特别是调 UI 的时候,感觉不好沟通。

目前实践制作 UI 的流程是让 deepseek 绘制 ascii UI 布局,确定布局之后,就整理提示词使用 gemini 的

stitch 制作原型图,原型图确定了再回到 deepseek 里面制作界面。

实际的过程中就会遇到一些小问题,比如网站 一下 UI 细节或者按钮的大小不一致,deepseek 无法看到,文字

描述的话,deepseek 没有办法一次性搞定。

所以想求一个比较好的使用方案能解决 deepseek 做 UI 视觉上面碰到的问题。

5 条回复
smy14520 · 2026-08-07 16:32
#1

claude code 中使用 智谱的视觉 mcp 多模模型可以自己选一个也可以用 智谱自己的 4.6v

foryou2023 · 2026-08-07 16:32
#2

@smy14520 感谢,我去试试

yinyu · 2026-08-07 16:32
#3

我自己做了个 OCR 的脚本其实就是调用视觉模型,我可以分享下经验,我试过百炼的 qwen3.6-flash 但是不够 flash ,中大的一张图就得花十秒左右。我让 codex 写脚本测试了 groq/cerabras/google 提供的视觉模型,最终发现同样的图,最快并且准确的最高(因为我是识别理财平台的持仓之类的一些信息,准确度很重要)的是 ~/.hammerspoon master* ❯ cat remote_ocr.lua|grep gemini M.model = “gemini-3.5-flash-lite” ~/.hammerspoon master* ❯

如果你对数字不敏感,其实 groq 和 cerebras 的视觉模型能够更快,描述一个布局什么的,小意思。

但是其实。你也可以让 Agent 通过 MCP 直接链接浏览器,这样就可以更具体的知道真实效果。

l84 · 2026-08-07 16:47
#4

sensenova

CykaBlyat · 2026-08-07 16:47
#5

我是调用了火山的豆包识图

添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: foryou2023
发布: 2026-08-07
点赞: 0
回复: 0