EasyHub工具与知识
站点导航
中文

网站外观

主色与风格,自由搭配

主色调玫瑰粉
视觉风格不改变内容与功能

柔和渐变 · 立体图标

已应用:玫瑰粉 · 灵感,自动保存到此浏览器。

开发工具·EASYHUB 选读

llama.cpp 0.6.0 发布:加入扩展 batch API、决策模型 /v1/systemone、GLM-5.3-Flash 与新模型下载 UI

GitHub原文发表
资讯编辑示意图:llama.cpp 0.6.0 发布:加入扩展 batch API、决策模型 /v1/systemone、GLM-5.3-Flash 与新模型下载 UI
EasyHub 编辑示意图 · 非报道原图

这次有什么变化

llama.cpp 10 月 5 日发布 0.6.0。版本引入 llama_batch_ext / llama_process(),支持 token 与 embedding 混合 batch 及 MTP/deepstack state embedding;server 新增 /v1/systemone 决策模型 API,并加入 GLM-5.3-Flash、Clef、Ling 3.0 VL 等模型支持。Qwen4Exp 获得 MTP speculative decoding,项目在 DGX Spark 上报告约 1.5× decode 加速;Apple Metal 新增 F16 KV flash attention 与少行 MMA matmul,项目称部分场景最高约 3×。Web UI 也重做 Hugging Face Hub 数据层、模型下载和内存适配估算。

阅读原文
原文标题
v0.6.0
来源
GitHub · github.com
主题
开发工具
原文月份
2026-10

本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。

本站摘要页面发布 · 内容说明

返回资讯时间轴