Ollama v0.31.1 重磅发布:Apple Silicon 上 Gemma 4 推理速度提升近 90%

2026年7月2日

44

919

Ollama v0.31.1 重磅发布:Apple Silicon 上 Gemma 4 推理速度提升近 90%

本地大模型运行工具 Ollama 于 2026 年 7 月 1 日发布了 v0.31.1 版本。尽管这次更新在版本号上只是一个“小版本”,但其带来的实际价值却相当可观——尤其是对使用 Apple Silicon 设备运行 Gemma 4 的用户而言,这次升级意味着更快、更稳、更省心的使用体验。

速度提升背后的技术原理

本次更新的核心亮点可以用一句话概括:Gemma 4 在 Apple Silicon 上的 token 生成速度平均提升接近 90%。这一数据来源于 coding-agent benchmark 的实测结果,意味着用户在使用本地大模型进行代码生成、问答、总结等任务时,等待时间将大幅缩短,交互流畅度将显著提升。

零门槛升级体验

这次推理速度大幅提升的关键在于 multi-token prediction(MTP)机制,即多 token 预测。不同于传统的逐 token 生成方式,MTP 允许模型在一次推理过程中同时预测多个后续 token,从而大幅提高生成效率。 更值得关注的是,Ollama 在实现这一优化时采用了自动调优策略。系统会在运行过程中根据实际负载自动调整 draft token 数量,用户无需手动配置任何参数。这种设计将复杂性留在系统内部,将性能收益直接交给用户,对技术背景不同的用户都非常友好。

真正的优化不是让用户在性能和稳定之间做选择,而是让两者兼得。

“技术观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

自动调优的三大优势

除了“开箱即得”的性能提升,这次更新还实现了三个关键特性。首先是默认开启——用户升级到 v0.31.1 后,加速功能自动生效,无需任何额外操作。其次是零配置——用户不需要理解复杂的参数,也不需要为不同场景调试不同设置。第三点尤为重要:这次优化不会改变模型输出结果。对于生产环境而言,输出的一致性和可重复性至关重要,Ollama 在追求速度的同时守住了这条底线。

适合升级的用户群体

v0.31.1 的核心受益群体非常明确:在 Apple Silicon 设备上使用 Ollama 运行 Gemma 4 的用户。对于这部分用户来说,这次更新的收益是直接可感知的——速度提升明显、升级成本极低、输出保持不变。此外,关注本地模型生成效率、重视升级后无需重新配置、对输出一致性有要求的用户,同样能从这次更新中获得显著价值。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI