GoForum🌐 V2EX

做了一个极简的纯 Java 实现的 LLM 推理引擎,支持 PagedAttention,前缀缓存,连续批处理和分块预填充

jingzhou · 2026-07-15 21:23 · 0 次点赞 · 0 条回复

做了一个极简的纯 Java 实现的 LLM 推理引擎,实现了现代推理服务系统的核心技术:分页 KV cache ( PagedAttention )+ 前缀缓存( Prefix Caching )+ 连续批处理( Continuous Batching )+ 分块预填充( Chunked Prefill )+ 抢占恢复。全部代码约 1.5K 行,依赖极少,适合入门学习;纯 CPU 推理,用 Java Vector API 做 SIMD 加速。灵感来源于 nano-vllm 。

目前支持 Qwen3 dense 系列模型——已用 Qwen3-0.6B 和 HuggingFace transformers 的 greedy 输出做过逐 token 完全一致的对齐验证。

欢迎对大模型推理感兴趣的朋友试用: https://github.com/oujingzhou/vllm4j 欢迎 star

0 条回复
添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: jingzhou
发布: 2026-07-15
点赞: 0
回复: 0