EasyHub工具与知识
站点导航
中文

网站外观

主色与风格,自由搭配

主色调玫瑰粉
视觉风格不改变内容与功能

柔和渐变 · 立体图标

已应用:玫瑰粉 · 灵感,自动保存到此浏览器。

开发工具·EASYHUB 选读

vLLM 0.31.0 发布:GPU 权重缓存支持快速重启,并加入初始化引擎快照与新一轮大规模推理优化

vLLM原文发表
资讯编辑示意图:vLLM 0.31.0 发布:GPU 权重缓存支持快速重启,并加入初始化引擎快照与新一轮大规模推理优化
EasyHub 编辑示意图 · 非报道原图

这次有什么变化

vLLM 10 月 5 日发布 0.31.0,包含 717 个提交、307 位贡献者。新 vllm preload CLI 可启动 weight-cache daemon,让量化后的权重在 engine 重启间继续驻留 GPU;实验性的 vllm snapshot create/restore 使用 CRIU 恢复已初始化 TP1 engine。版本还扩展 Model Runner V2 speculative decoding、MoonEP/DeepEPv2 等大规模 serving、调度和 KV offload 控制,并重点优化 DeepSeek-V4.1-Flash、GLM-5.3-Flash、Kimi K3 等模型。官方同时列出多项 breaking changes,升级前需要核对量化和多模态参数。

阅读原文
原文标题
v0.31.0
来源
vLLM · github.com
主题
开发工具
原文月份
2026-10

本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。

本站摘要页面发布 · 内容说明

返回资讯时间轴