GoForum🌐 V2EX

[开源推荐] Ante,一个以单个二进制文件形式运行的离线编码代理

Koimiao · 2026-08-11 01:47 · 0 次点赞 · 0 条回复

开源: https://github.com/AntigmaLabs/ante (欢迎感兴趣的朋友点颗 star⭐️)

Ante 是一款编码代理,它以一个独立的 15MB 二进制文件的形式发布:TUI 、嵌入式 ripgrep 、本地 PDF/OCR 以及原生管理的 llama.cpp 引擎都包含在内。没有运行时依赖项,没有 node_modules ,也不需要帐户。

Ante 会安装一个经过校验和验证的、与您的机器匹配的官方 llama.cpp 构建版本( Apple Silicon 上为 Metal ; Linux 上为 CUDA 、Vulkan 或 CPU ),并在版本更新时自动进行升级。- 它会发现磁盘上已有的 GGUF 文件(~/.ante/models 、llama.cpp 和 Hugging Face 缓存),连接到本地端口上已运行的 llama 服务器,并在加载任何内容之前,根据模型大小和上下文窗口估算 RAM/VRAM 。- ante --offline-model /path/to/model.gguf "prompt" 命令会启动服务器、运行会话并关闭服务器。/offline-mode 命令以交互方式执行相同的操作;ante serve --offline-model 命令会为多个客户端加载一次模型。- 无需 API 密钥,也无需帐户。模型加载到磁盘后,推理完全不需要网络;设置 ANTE_TELEMETRY=off 也不会导出任何遥测数据。

关于性能方面,我们更愿意公布实际数据,而不是夸大其词:我们使用与前沿模型相同的测试框架和可审计运行来对本地模型进行基准测试,Qwen3.6 27B (下载量 17 GB )在 Terminal-Bench 2.1 的 445 次测试中得分 56.2%(实时结果: https ://antigma.ai/eval )。这与前沿模型之间存在显著差距。我们的设计理念是混合使用:托管提供商和本地实时模型位于同一目录中,/providers 目录会在会话期间切换,因此敏感代码库或高容量工作会部署在本地,而难题则会部署在前沿模型上。

托管模型可以使用您自己的密钥或订阅。但试用 Ante 无需注册任何内容:下载二进制文件,将其指向 GGUF 服务器即可。

离线模式目前仍在积极开发中,尚不完善,详情请见 https://ante.run/local/overview

0 条回复
添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: Koimiao
发布: 2026-08-11
点赞: 0
回复: 0