GPT-5.6深夜上线,首发实测,Claude Fable5慌了!

2026年7月10日

41

895

GPT-5.6深夜上线,首发实测,Claude Fable5慌了!

大模型军备竞赛再掀高潮。就在昨夜,OpenAI正式发布全新旗舰模型GPT-5.6,以全面提升的性能和极具竞争力的定价,再次搅动了AI行业的格局。这款新模型不仅在Agent任务、代码生成、电脑和浏览器操作等高难度工具任务上实现显著突破,还带来了全新的产品矩阵。对于整个行业而言,GPT-5.6的登场意味着什么?我们不妨先看看它的真实表现。

性能全面跃升,多项基准测试亮眼

根据官方公布的跑分数据,GPT-5.6在多个关键维度实现了明显提升。在Agent长任务方面,Agents' Last Exam成绩从46.9%提升至52.7%,展现出更强的任务规划与执行能力。代码领域同样传来捷报,Coding Agent Index、DeepSWE、Terminal-Bench等测试均有进步,不过值得注意的是,SWE-Bench Pro仅从59.4%提升至64.6%,表明在最硬核的软件工程修复任务上仍有提升空间。

操作系统与浏览器操作能力大幅增强

本次升级最引人注目的是电脑和浏览器操作能力的飞跃。OSWorld测试从47.5%飙升至62.6%,BrowseComp更是达到90.4%。这一升级方向与OpenAI重点推广ChatGPT Work的战略高度契合——为真实办公场景下的AI助手铺路。网络安全和复杂工具任务同样表现亮眼,SEC-Bench Pro从45.8%跃升至71.2%,ExploitBench从47.9%升至73.5%,ExploitGym从15.1%增至33.7%。这意味着GPT-5.6在安全审计等高难度工具任务上的能力已今非昔比。

竞争越激烈,用户就能越快用上更强、更便宜的模型。

“行业观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

定价策略极具杀伤力

GPT-5.6采用三档定价策略:Sol版本作为最强旗舰,输入5美元/百万token,输出30美元/百万token;Terra定位中档,2.5美元输入、15美元输出;Luna主打性价比,1美元输入、6美元输出。这一价格体系确实具有相当的杀伤力——GPT-5.6 Sol的价格约为Claude Fable5的一半。根据Artificial Analysis的统计数据,其综合消耗成本甚至比GPT-5.5 High还要低。Sam Altman本人也在社交媒体上发文,强调这是为了进一步降低AI使用门槛的举措。

实测效果令人惊艳

从第三方跑分对比来看,两款旗舰模型各有所长:GPT-5.6在Agent长任务、Coding Agent和成本效率上更具优势,而Claude Fable5在硬核代码修复及部分高难度数学任务上依然保持领先。整体而言,双方打得难分伯仲,最终选择还需根据具体使用场景来定。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI