Ornith-1.0 发布:新一代 Agentic Coding 之王的开源革命

2026年7月3日

33

982

Ornith-1.0 发布:新一代 Agentic Coding 之王的开源革命

开源模型正在重新定义 AI 编程的天花板。Ornith-1.0 的发布引发了行业震动——这个新兴的 Agentic Coding 模型家族以 MIT 开源协议亮相,在最硬核的编程基准测试中创下开源最高分纪录。82.4、77.5、62.2……这些数字不再是「接近闭源水平」,而是「已经超越闭源尚未公开的成绩」。从 9B 到 397B 的完整参数范围,配合 GGUF 量化版本和本地部署支持,开发者终于可以真正将一个工业级 AI 编程助手部署到任何环境。

概述

Ornith-1.0 并非单一模型,而是一个精心设计的模型家族,涵盖四种规格以适应不同场景需求。9B Dense 版本面向个人开发者,可在消费级 GPU 上本地运行,实现近乎零成本的 AI 辅助编程;31B Dense 版本适合小团队,单台服务器即可支撑日常开发工作;35B MoE 版本以稀疏架构平衡性能与效率,适合中型项目的复杂任务处理;而 397B MoE 则定位于企业级私有部署,满足对数据安全和模型控制有严格要求的组织。整个模型家族基于 Gemma 4 和 Qwen 3.5 进行后训练,站在开源强者的肩膀上实现了又一次跨越。

从追赶者到领先者:benchmark 数据背后的意义

理解 Ornith-1.0 的成绩,需要先理解 SWE-Bench 的含金量。这个基准测试不是选择题或填空题,而是一个 GitHub issue 输入、代码修改与单元测试通过的完整闭环。一个熟练的人类程序员在此类任务上的正确率通常被认为在 70% 至 75% 之间。Ornith-1.0 的 82.4 分意味着它已经超越了这一水平。更值得关注的是,SWE-Bench Pro 的 62.2 分证明它具备处理多文件修改、跨模块重构等中等规模工程任务的能力;Terminal-Bench 2.1 的 77.5 分则表明它能在真实终端环境中执行 cd、grep、调试服务、部署应用等操作——这不是模拟,而是一个真正能坐在工位前使用命令行的 AI 工程师。NL2Repo 的 48.2 分虽然看似不高,但考虑到「用自然语言描述需求 → 从零生成完整 GitHub 仓库」的难度,这个成绩已是开源模型中的最高水平。

当一个完全开源、覆盖全参数范围、支持本地部署的 Agentic Coding 模型家族以 MIT 协议出现在所有人面前时,AI 写代码的商业模式会发生什么?Ornith 团队已经用行动给出了答案:别想太多,先开源再说。

“行业观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

技术突破:让模型改进自己的工具

Ornith-1.0 真正的技术突破在于其训练方法论。传统 AI 编程工具通常将系统分为两层:scaffold 负责任务规划、工具调用和上下文管理,通常由人类工程师手写固定规则;solution 层则专注于代码生成和修复。Ornith 的创新在于将两层同时纳入强化学习优化循环,让模型自主发现更高效的执行框架,而非被动适配人类预设的流程。这相当于从「给工人一把锤子让他干活」升级为「让工人自己设计最顺手的锤子」。当 AI 开始优化「写代码的方式」本身而非仅仅是代码内容,迭代速度将呈指数级增长,因为模型可以探索人类从未设想过的工具组合和执行策略。

开源生态的降维打击

长期以来,coding agent 被视为闭源模型最后的堡垒。Claude Code 年化收入据说已超 25 亿美元,GitHub Copilot 拥有数千万用户,这些数字支撑着闭源阵营的护城河逻辑:基础模型可以开源,但真正好用的 coding agent 必须付费。然而 Ornith-1.0 的出现正在改写这个叙事。MIT 协议、GGUF 版本、本地部署、六项 benchmark 开源最高分——一个研究团队基于已有开源模型做后训练,就拿到了多项公开基准的最佳成绩,然后免费开放给社区。当「做模型的不如卖 agent 的」这一现状被开源直接颠覆,行业格局必将重新洗牌。开源社区的一万个开发者基于 Ornith 做二次开发,就会产生一万个不同的 agent 框架和垂直场景方案,这种工程能力的分布式爆发是任何单一闭源团队无法企及的。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI