开发工具·EASYHUB 选读
llama.cpp 0.6.0 发布:加入扩展 batch API、决策模型 /v1/systemone、GLM-5.3-Flash 与新模型下载 UI

这次有什么变化
llama.cpp 10 月 5 日发布 0.6.0。版本引入 llama_batch_ext / llama_process(),支持 token 与 embedding 混合 batch 及 MTP/deepstack state embedding;server 新增 /v1/systemone 决策模型 API,并加入 GLM-5.3-Flash、Clef、Ling 3.0 VL 等模型支持。Qwen4Exp 获得 MTP speculative decoding,项目在 DGX Spark 上报告约 1.5× decode 加速;Apple Metal 新增 F16 KV flash attention 与少行 MMA matmul,项目称部分场景最高约 3×。Web UI 也重做 Hugging Face Hub 数据层、模型下载和内存适配估算。
- 原文标题
- v0.6.0
- 来源
- GitHub · github.com
- 主题
- 开发工具
- 原文月份
- 2026-10
本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。
本站摘要页面发布 · 内容说明