开发工具·EASYHUB 选读
vLLM 0.31.0 发布:GPU 权重缓存支持快速重启,并加入初始化引擎快照与新一轮大规模推理优化

这次有什么变化
vLLM 10 月 5 日发布 0.31.0,包含 717 个提交、307 位贡献者。新 vllm preload CLI 可启动 weight-cache daemon,让量化后的权重在 engine 重启间继续驻留 GPU;实验性的 vllm snapshot create/restore 使用 CRIU 恢复已初始化 TP1 engine。版本还扩展 Model Runner V2 speculative decoding、MoonEP/DeepEPv2 等大规模 serving、调度和 KV offload 控制,并重点优化 DeepSeek-V4.1-Flash、GLM-5.3-Flash、Kimi K3 等模型。官方同时列出多项 breaking changes,升级前需要核对量化和多模态参数。
- 原文标题
- v0.31.0
- 来源
- vLLM · github.com
- 主题
- 开发工具
- 原文月份
- 2026-10
本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。
本站摘要页面发布 · 内容说明