GoForum🌐 V2EX

ANTE:原生支持本地 GGUF 的 Coding Agent, Qwen3.6 27B 在 TB 2.1 跑到 56.2%

Koimiao · 2026-08-23 00:22 · 0 次点赞 · 0 条回复

ANTE 一个运行在终端里的 Coding Agent 。使用方式类似 Claude Code / Codex ,但它从头用 Rust 编写,下载包约 15 MB ,解压后是一个没有 Node.js 、Python 等运行时依赖的单文件程序。

ANTE 可以管理 llama.cpp 的安装、GGUF 模型发现、内存预估、加载进度和服务生命周期。模型下载完成后,不需要账号、API Key 或网络,模型请求和输出都留在本机。已经在使用 Ollama 、LM Studio 、vLLM 或其他 OpenAI-compatible 服务的话,也可以直接接入。

当然,它也支持 OpenAI 、Anthropic 、Gemini 、DeepSeek 、OpenRouter 等在线模型,可以在同一个客户端里切换本地和云端模型。

一些跑 使用 Terminal-Bench 2.1 评测 ANTE 的 agent harness 。测试采用 89 个任务、每个任务 5 次,共 445 次 trial ;每次评测固定公开发布的 ANTE 版本,并提供原始 Harbor run 。 目前公开结果包括:

  • ANTE + DeepSeek V4 Flash 0731 max:82.7% ± 1.79 SE ,通过 368445 次 trial ,完整评测推理成本约 68.41 美元。
  • ANTE + 本地 Qwen3.6 27B Q4_K_M:56.2% ± 2.36 SE 。模型下载约 17 GB ,完全在本地运行。
  • ANTE + GLM 5.2:74.6% ± 2.06 SE 。
  • ANTE + MiniMax M3:62.1% ± 2.33 SE 。 完整结果、具体版本和原始运行记录都在这里: https://antigma.ai/eval

我们还测过 20 个相同任务在 Docker 中并发运行时的资源占用。相同 workload 下,与 Claude Code 相比,ANTE 测得约:

怎么试 目前支持 macOS 和 Linux ,Windows 建议使用 WSL: curl -fsSL https://ante.run/install.sh | bash ante 进入后使用 /offline-mode ,可以安装本地推理引擎、选择已经下载的 GGUF ,或者从推荐列表下载模型。 不喜欢 curl | bash 的话,也可以直接从 GitHub Releases 下载: https://github.com/AntigmaLabs/ante/releases

GitHub 仓库已经开放文档、协议、Rust SDK 、部分基础组件和完整 eval pipeline ;核心 harness 目前仍以预编译 binary 发布,完整开源进展记录在仓库的 issue #21 。

相关链接:

0 条回复
添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: Koimiao
发布: 2026-08-23
点赞: 0
回复: 0