GPT-6 Astra重新定义人机边界:AI正在学会"拆掉"软件接口的墙
三天三款前沿模型密集发布,AI竞赛进入新维度
2026年9月的头三天,全球AI产业经历了罕见的密集发布期。9月1日,Anthropic推出Claude Fable 5.1;9月2日,Google上线Gemini 3.8 Flash;9月3日,OpenAI发布GPT-6 Astra。三家头部厂商不约而同地将焦点对准了同一方向——更强的Coding能力、更复杂的推理能力、以及更长时间跨度的Agent任务执行。
但在这些常规性能提升之外,一个更具深远影响的趋势正在浮现:Computer Use、Browser Use和Tool Use正在演变成一套统一的环境交互能力体系。这意味着AI与软件交互的方式正在发生根本性转变。
Computer Use:从不得已到流畅操作
长期以来,AI想要操控软件大致有三条路径:调用软件提供的API、操作运行在浏览器中的网页界面,或者像人类一样看屏幕、点鼠标、敲键盘。在过去相当长的时间里,最后一种方式始终是不得已的备选方案。
原因很现实:API调用速度快、稳定性高、权限可控;而让AI直接操作图形界面,不仅缓慢而且容易出错——一旦任务步骤超过几十步,或者遇到复杂界面、弹窗干扰,整个任务就可能前功尽弃。
GPT-6 Astra的发布标志着这一局面的根本性改变。OpenAI将其定位为“全球最强计算机使用模型”,Computer Use不再仅仅是备选方案,而是开始展现出能够流畅操控专业软件的能力。
在OSWorld 2.0跨应用操作任务测试中,Astra达到72.6%的成功率,而此前的GPT-5.6 Sol仅为65.7%。在更侧重屏幕视觉定位和精准点击的ScreenSpot-Pro测试中,Astra更是从76.9%跃升至92.7%。执行效率同样显著提升:完成OSWorld任务的平均耗时从约75分钟缩短至约40分钟。
这意味着Computer Use第一次实现了成功率和执行效率的同步提升。
游戏公司Playco的实践案例具有代表性。他们将Astra接入AI开发工具Playbot后,模型可以直接进入Unity、Godot等游戏引擎,修改场景、运行测试、发现问题后继续修改。据Playco反馈,相比此前使用的模型,人工修复次数减少了50%。该公司联合创始人特别指出,Astra“对空间关系的理解以及对界面元素位置的判断明显更加准确”。
同样的进化也发生在Anthropic阵营。Claude Fable 5.1在OSWorld 2.0上的得分从72.9%提升至77.9%,AutomationBench更是从17.1%跃升至31.4%。与此同时,Anthropic将缓存读取价格降低了75%,估算在高度Agent化的工作负载中,整体成本最多可下降约45%。
Computer Use的价值临界点已经到来:经济性和可靠性同时越过了可行门槛。
AI获得工具自主选择权
如果仅仅是Computer Use变强,这仍然只是一个模型能力的迭代。但真正值得关注的变革,发生在AI与其他工具之间的关系层面。
传统Agent开发模式中,工作流程往往需要人工预先设计:第一步搜索网页,第二步调用CRM接口,第三步执行Python脚本,第四步进入某个特定软件。这种刚性编排的局限性在于,当任务场景发生变化时,Agent缺乏灵活应变的能力。
GPT-6 Astra展现出一种截然不同的工作方式:Agent可以在执行循环中自主决定工具的使用方式和使用顺序。OpenAI为Astra配置了Web Search、File Search、Code Interpreter、Hosted Shell、Computer Use、MCP、Skills和Tool Search等八类工具能力。其定位是能够跨“代码、浏览器和专业软件”连续执行任务的模型。
更值得关注的是,这次引入的异步工具调用能力打破了传统的串行模式。过去,工具调用是典型的串行过程:模型发起调用、等待返回结果、然后继续推理。Astra现在可以在一个工具仍在运行时继续思考、调用其他工具,或者先处理任务中的其他部分。这越来越接近真实人类的工作方式。
试想一个具体的Agent任务场景:“分析本季度销售下滑的十个最大客户,探究原因,更新CRM数据,并生成用于明天会议的Power BI报表。“在传统模式下,这个任务需要人类按步骤拆解、分别在多个系统中操作。而在Astra的框架下,Agent可能同时通过API读取CRM数据、在浏览器中查询客户背景信息、调用Shell处理数据文件,最后发现Power BI没有合适的现成接口,于是直接进入软件界面完成图表制作。
模型自主选择工具的能力变强了,这才是最关键的质变。
Google的Gemini 3.8 Flash同样展现出这一方向。Google明确将其定位为“built for long-horizon coding and autonomous agents”,并强调这一代模型会在复杂任务中执行更多推理步骤、反复调用工具。这已经是Google六周内发布的第三代Flash模型。
几条原本泾渭分明的技术路线正在趋于融合:API能够直接调用就走API、网页操作更方便就进入Browser、需要批量数据处理就写代码、软件没有机器友好接口也可以直接操作GUI。
行业里曾有一条近乎默认的原则:“如果能API,就不要点鼠标。“这条原则目前仍然有效——API确实更快、更稳定、更经济。但它正在从”机器进入软件的唯一通道“转变为”Agent可以选择的最优路径之一“。
换句话说,GUI正在获得一种全新的身份:它开始成为机器(AI)的接口。过去GUI是给人使用的,API才是给机器使用的。这两者之间的边界,第一次真正开始模糊。
GPT-6“强拆”的是接口墙,而非权限墙
这里需要澄清一个常见的误解。GPT-6 Astra并没有获得绕过软件权限验证的能力。如果一个用户本身没有查看某份Salesforce数据的权限,Agent也不会因为学会了操作鼠标就自动获得权限——MFA、SSO、操作系统管理员权限仍然有效。OpenAI在描述Astra已达到“Critical”级别网络安全能力时,专门加了一个前提:“with the right tools and access”。
因此,GPT-6 Astra“拆掉”的既不是登录墙,更不是数据权限墙。
真正被打破的,是软件厂商长期以来对“机器入口”的定义权。
几十年来,软件世界形成了一套根深蒂固的分工模式:人从GUI进入,机器从API进入。软件厂商由此掌握着机器入口的定义权——要不要开放API、开放哪些操作权限、第三方可以访问什么数据、按照什么方式计费,都由厂商决定。
Computer Use能力的成熟,正在从根本上改变这一格局。如果一个拥有正常权限的人类用户能够在屏幕上完成某项操作,理论上Agent也可能沿着同一条路径完成。这意味着“不开放API”将越来越难等同于“AI无法操作我的软件”。
这一变化已经开始倒逼软件巨头主动应对。2025年,Salesforce负责AI产品的负责人就提出:“Autonomous AI agents will become the new user interface”——用户未来越来越可能直接面对Agent,由Agent在后台协调调用不同的数据和应用,而不需要用户在多个App之间来回切换。
今年,微软在一篇关于企业软件架构的文章中提出,在Agent模式下,应用程序未来可能更多扮演“系统记录(systems of record)“的角色,而不再是”系统导航(systems of navigation)“——用户不需要知道该打开哪个系统,只需要表达自己的目的,Agent负责协调背后的应用、规则和数据。
在这种模式下,Agent正逐渐成为不同软件之上的统一入口。用户从“应用的使用者”转变为“目标的表达者”,而Agent则成为目标达成的执行者。
API不会消失,但软件厂商需要重新思考策略
这里出现了一个值得深思的现象:既然AI可以操作GUI,为什么软件公司反而更加积极地开放MCP和Agent接口?
答案在于,API和Computer Use并非替代关系,而是互补关系。API仍然是高速公路:速度快、稳定、可计量,也更容易进行权限管理。Computer Use更像是让Agent突然拥有了越野能力——在没有现成公路的情况下也能到达目的地。
但恰恰是这种“没有公路也能过去”的能力,反而激发了软件厂商优化自身API的动力。过去,是Agent开发者主动争取Salesforce、Microsoft或ServiceNow开放接口;未来可能反过来,软件公司需要主动优化自己的API、MCP和Agent入口,让Agent优先使用正式接口,而不是绕道去操作GUI。
微软CEO在2026年7月的财报电话会上透露,微软正在将Dynamics 365中的超过65万个动作通过MCP协议暴露出来,使Agent能够在相同的数据模型、规则体系、权限控制和审计机制下直接执行操作。同时,微软的企业软件商业模式也开始从纯席位(seat)收费向“席位+用量(consumption)“混合模式转型。
ServiceNow则宣布开放Action Fabric,允许外部AI Agent直接调用其企业工作流。他们举了一个颇具代表性的例子:过去必须进入ServiceNow界面完成的密码重置流程,现在可以直接由Claude触发执行。
软件厂商依然掌握着至关重要的事情:客户数据、身份体系、权限管理、安全规则和系统记录。这些核心资产不会因为一个模型学会了点鼠标就消失。
但它们可能逐渐失去另一项过去习以为常的权力:定义用户从哪个入口进入、接下来该去哪里、打开哪个页面、按什么顺序完成任务。
写在最后
GPT-6 Astra没有让App消失,也没有让AI绕过软件权限。但AI能力提升的方向,使得它可以越来越不依赖软件厂商专门为自己预留的入口。
GPT-6“强拆”的,正是这堵接口墙。
截止目前,尚未有机会对GPT-6 Astra所宣称的能力进行真实测试。但可以确定的是,Agent的选择权正在变得越来越大。人类总会选择更高效、更省事的方式。Agent迎合了这种本能,也因此开始获得原本属于用户和App的选择权。
当AI能够自主选择工具、自主规划路径、自主协调多个系统完成复杂任务时,软件的形态和人们使用软件的方式,都将迎来深刻变革。这或许才是这轮模型密集发布背后,最值得关注的长远影响。
