菜单
积墨AI

积墨AI

OpenAI发布GPT-6 Astra:重新定义「电脑操作」的边界

一条无字视频,揭开了一场技术革命的序幕

2026年9月3日深夜,OpenAI在社交媒体上发布了一条特殊的预告:画面在动,却没有一个字。没有文案、没有解释、甚至没有任何说明。几个小时后,真相揭晓——这就是GPT-6 Astra。

官方的描述简洁而有力:「Anything you can do on a computer, Astra can do for you. Fast.」翻译成更直白的语言:电脑上你能做的事,Astra都能替你完成,而且速度很快。

这条预告迅速引发关注。在正式官宣前,预告视频已获得超过730万次浏览、3.4万个点赞。当官方帖子正式发布时,浏览量很快突破440万,互动数据持续攀升。这条没有文字的视频,在没有任何解释的情况下已经刷屏了技术圈的朋友圈。

从「会聊天」到「会动手」:重新定位大模型能力边界

Astra的发布标志着大模型从「对话助手」向「数字员工」的角色转变。回顾大模型的发展历程,ChatGPT早期版本的定位更接近「会说话的百科全书」——你能向它提问、让它解释概念、请它润色文章。但这些本质上都是「输入-输出」的交互模式,大模型扮演的是一个高级信息处理器的角色。

Astra的不同之处在于:它不只接收文字指令并返回内容,而是能够像人一样自主操作电脑界面。这意味着它可以打开浏览器搜索信息、在Excel中修改表格数据、按照模板生成PPT、登录CRM系统更新客户记录,甚至可以操作工程软件如KiCad或FreeCAD。

用更形象的比喻来理解:如果说ChatGPT是「会聊天」的助手,那么Astra就是「会动手」的数字员工——它不仅理解你的需求,还能代替你执行那些需要鼠标点击、键盘输入才能完成的操作。

OpenAI在发布中明确表示,Astra被定位为「world’s best computer use model」——世界上最好的电脑使用模型。这个定位传递出一个明确信号:大模型的能力边界正在从「理解与生成」扩展到「规划与执行」。

技术突破:性能指标与架构演进

从技术层面看,Astra带来了显著的代际提升。根据官方公布的数据,在OSWorld 2.0的离线测试子集上,Astra达到了72.6%的正确率,而前代GPT-5.6 Sol仅为65.7%。更值得关注的是完成任务所需的时间:Astra每任务平均耗时约40分钟,而Sol需要约75分钟。这意味着在保持高准确率的同时,Astra将效率提升了近47%。

在多项基准测试中,Astra展现出强劲的综合能力:

  • FrontierMath Tier4 v2:97.6%
  • DeepSWE v1.1:74.1%
  • BenchCAD:95.9%
  • GPQA Diamond:96%
  • ExploitBench:100%
  • ARC-AGI-3:98.6%

这些数字背后代表什么含义?以ARC-AGI测试为例,这是一套专门评估AI在未见过的任务上表现出人类水平推理能力的测试。98.6%的准确率意味着Astra在处理需要灵活推理的复杂任务时,已经接近甚至超越普通人类的水平。

训练规模同样令人瞩目。OpenAI研究员Aidan Clark透露,从Sol到Astra是他们「迄今为止最大的训练能力跃升」。支撑这一训练的基础设施是在Stargate集群上运行的超过10万张GPU——这是一个相当可观的算力投入。

AGI时代来临?:技术突破与过度解读之间的边界

在Astra的发布会上,OpenAI联合创始人兼总裁Greg Brockman发表了一个引人关注的声明:「Welcome to the AGI era.」他同时表示,就他个人的判断,「I do think we’re there」,并且觉得自己身处AGI时代「并不离谱」。

这番言论立刻引发了技术社区的广泛讨论。首先需要明确的是,这是Brockman的个人判断,而非某个权威机构的认证标准。「AGI」这个词本身就缺乏统一的定义,不同的人对它有不同的理解。

从狭义角度看,AGI通常指在大多数有经济价值的工作上,能够接近或超过普通人类水平的通用人工智能。如果采用这个标准,Astra确实在多个维度展现了接近通用智能的特征:它能够跨领域处理任务(从文档处理到代码编写,从数据分析到软件操作),展现出一定的灵活性和适应性。

然而,也有声音提醒不要过度解读单一指标。ARC-AGI等测试的评分很大程度上取决于如何「搭脚手架」(harness)——即如何设计测试环境、如何给模型提供必要的上下文信息。因此,单看一个数字就宣布人类进入AGI时代是不严谨的。

对普通人而言,与其纠结于「AGI」这个抽象的概念,不如关注一个更实际的问题:它能不能帮你把那张表填完、把那个PPT按模板排好、把那个网页上的信息整理出来?如果能,它就是有价值的生产力工具。

安全红线:首次触及「Critical」网络安全能力

除了性能指标,Astra在安全维度的一个突破更值得关注。Astra是OpenAI「准备度框架」(Preparedness Framework)下,第一个达到「Critical」级别网络安全能力的模型。

「Critical」级别意味着什么?简而言之,在获得合适工具和足够权限的情况下,这个模型可能帮助发现系统漏洞、甚至拼凑出完整的攻击链路。这种能力太强,如果不加以控制,就可能造成严重后果。因此,OpenAI对这类能力采取了严格的访问限制措施。

具体的安全实践包括:高级网络相关能力在初期主要开放给Daybreak Blue等受信任的安全防御方;在9月1日发布的「Path to Astra」博客中,部分内容因为安全措施被推迟发布;Astra还被描述为目前「最对齐」的模型之一,系统会监控模型的思维链(即内部推理过程),一旦发现可疑的代理操作迹象,可能会主动暂停或打断执行。

这一系列安全实践反映出一个重要信号:随着AI能力的增强,安全控制不是被削弱而是需要加强。当模型具备更强的自动化操作能力时,如何确保它不会偏离用户意图、如何防止能力被滥用,成为与性能提升同等重要的问题。

价格策略:从「按Token计费」到「按任务计费」

在商业化层面,Astra的定价策略也体现了对大模型应用模式的深入思考。API标准定价为每百万输入Token 10美元、每百万输出Token 50美元。提供「Fast」模式选项,速度最高可达标准模式的2.5倍,但价格也相应翻倍。

值得注意的是Brockman提出的一个观点:不要死盯着每Token多少钱,而应该关注每完成一件任务需要花多少钱。这个思路的转变很有意义。在传统的API计费模式下,用户往往陷入优化Token消耗的游戏,但真正有价值的是任务完成率和工作流效率。

OpenAI公布的数据显示,在DeepSWE配置下,Astra每任务预估API成本比Sol最佳配置低约57%。虽然单Token价格更贵,但由于任务完成效率大幅提升,整体成本反而下降。这种「按效果付费」的思路,对企业用户来说更具吸引力。

开放节奏与生态布局

Astra的发布采用分阶段开放策略:

  • 首批面向Daybreak企业客户
  • 随后几天内陆续开放给ChatGPT Plus、Pro、Business、Enterprise用户
  • 同步开放API,以及AWS Bedrock、Azure等云平台

开发者可通过API调用Astra能力,模型ID为「gpt-6-astra」。对于需要在企业环境中构建自动化流程的开发者和集成商来说,这是一个重要的能力补充。

社区的反响同样热烈。有开发者指出,Astra在编程能力测试中的表现与Fable 5持平,但成本更低。也有人评价说,Astra在处理复杂企业任务时展现出显著优势,特别是在编程和数据分析方面。还有用户形象地描述:对着电脑说话,它就把事做完。

写在最后:别被三个字母吓到,看它能做什么

回顾Astra的发布:预告无字、官宣简短、总裁喊出AGI、安全先上锁、价格也不便宜。一连串操作赚足了眼球,但回归本质,真正值得关注的是它能为实际工作带来什么改变。

从「会聊天」到「会动手」,这个转变意味着大模型的角色正在重新定义。ChatGPT时代的核心价值是信息处理——你问它答,它给你内容。而Astra时代的核心价值变成了任务执行——你告诉它目标,它帮你完成。

对于积墨AI的用户而言,这意味着什么?当AI不再只是回答问题,而是能够代替你操作各种系统和软件时,企业知识管理、智能客服、数据分析等场景的自动化程度将提升到一个新的水平。一个能够自主完成电脑操作任务的AI助手,可以将许多需要人工介入的工作流程实现真正的无人值守。

当然,AGI时代是否真的已经来临,这个问题见仁见智。但可以确定的是,Astra展示了一种可能性:大模型可以不只是「幕后的智囊」,而是可以成为「台前的执行者」。对于企业来说,与其争论AGI的定义,不如思考如何让这些能力真正转化为生产力提升。

毕竟,技术的价值不在于它听起来有多震撼,而在于它能否切实解决你面前的问题。不妨亲自体验一下:把一件你电脑上需要花半小时的小事交给它,看看它能做到什么程度。成了,就是生产力。不成,也比空谈时代更有意义。

#GPT-6#Astra#AGI#OpenAI#自动化办公
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信