菜单
积墨AI

积墨AI

GPT-6 Astra深度解析:百万Token上下文与Codex跨窗口记忆开启Agent新范式

GPT-6 Astra来了:大上下文与跨窗口记忆重新定义AI Agent能力边界

上下文之战进入新阶段

当业界还在讨论百万Token上下文是否必要之时,OpenAI已经将答案落为现实。GPT-6 Astra正式发布,模型ID为gpt-6-astra,拥有105万Token的超长上下文窗口,最大输出可达12.8万Token。这一数字不仅仅是一个技术指标的提升,更代表着AI处理复杂长程任务能力的质的飞跃。

与此前长上下文模型多采用滑动窗口或稀疏注意力机制不同,Astra在保持超长上下文的同时,还支持文本和图片的多模态输入,以及函数调用、Structured Outputs、网页搜索、文件搜索、Computer Use、Hosted Shell、Skills、MCP和Tool Search等丰富的工具集成能力。这种全方位的功能覆盖,使得Astra不再仅仅是一个文本生成模型,而是一个能够真正介入实际工作流程的智能代理。

Codex跨窗口记忆:长任务的终极解法

对于执行长程任务的Agent而言,传统的compaction机制一直存在致命缺陷:当上下文接近满载时,系统会将之前的工作压缩成摘要;压缩次数增多后,诸如“某次修复为什么失败”“某个组件究竟怎么工作”等关键细节,往往在摘要生成过程中被遗漏。这直接导致了Agent在长任务执行中容易出现“失忆”,上下文越多反而越容易遗忘早期的重要信息。

Astra为Codex引入的跨窗口笔记(Cross-Window Notes)功能,从根本上解决了这一痛点。启用实验性模式后,Codex可以将任务执行过程中积累的关键细节写入跨窗口笔记,同时保留对早期上下文的搜索能力。这意味着即使用户开启新对话,模型依然能够回溯到之前的消息和工具输出中检索信息。

这项能力的实现方式也相当直接。开发者只需在config.toml中启用相应配置项:

[features]
context_management.experimental_mode = true

需要注意的是,该功能目前默认关闭,需要Plus、Pro或Pro Lite的ChatGPT登录态。OpenAI计划在接下来几周内将其作为Astra的默认能力开放。

电脑操作:从Demo走向实用

OpenAI此次发布的一个显著特点是,将大量篇幅用于展示Astra的电脑操作能力,而非单纯的代码生成。这个战略转向的信号意义重大:当模型能够稳定地操作浏览器、专业软件,完成填写表单、更新CRM、整理日历、做在线研究、生成图表、搭建网站等任务时,AI Agent才真正从Demo阶段走向实用。

在OSWorld 2.0的离线任务测试中,Astra取得了72.6%的准确率,相比GPT-5.6 Sol的65.7%提升了近7个百分点。但更具说服力的是时间指标:Astra平均约40分钟完成一项任务,而Sol需要约75分钟,耗时缩减了47%。

47%的时间节省意味着什么?在企业实际部署场景中,这意味着Agent可以承担更多持续运行的任务,可以让“始终开启Agent协助工作”的成本变得更加可控,也可以让人类员工从重复性操作中真正解放出来。

OpenAI同步更新的Codex电脑操作harness也值得关注。两者结合后,Mind2Web上的任务完成速度达到了当前GPT-5.6 Sol体验的1.9倍。这一数据表明,硬件层面的优化与模型能力的提升正在形成正向叠加效应。

评测对阵:与Claude Fable 5.1的正面交锋

有趣的是,OpenAI在官方评测表中直接纳入了Anthropic最新发布的Claude Fable 5.1作为对照基准。在Terminal-Bench 4.0上,Astra得分57.9%,Fable 5.1为55.8%;在Terminal-Bench Science 0.1上,两者分别为64.6%和52.6%;在AutomationBench上则是41.4%对31.4%。这些数据表明,在涉及终端操作和自动化的场景中,Astra已经确立了明显的领先地位。

然而,竞争格局并非一边倒。在Artificial Analysis Intelligence Index中,Fable 5.1得到65.7分,而Astra为61.2分;在DeepSWE v1.1上,Astra的74.1%也只比Gemini 3.8 Flash的73.8%高出0.3个百分点。

这种分化清晰地勾勒出当前顶级模型的能力分野:Fable 5.1在科研与知识工作场景表现更为突出,而Astra则将电脑操作、长程Coding和跨窗口上下文管理作为核心卖点。两者并非全面竞争,而是在不同场景中各有侧重。

定价策略:超长上下文的成本账

Astra的API定价同样备受关注。标准费率下,每百万输入Token 10美元,缓存读取1美元,缓存写入12.5美元,输出50美元。这个价格体系看似清晰,但存在一个容易被忽视的阶梯:输入超过27.2万Token后,整次请求的输入与缓存费率都将翻倍,输出费率则变为1.5倍。

这意味着设计高容量上下文请求时,开发者需要重新审视缓存策略和上下文裁剪方案。105万的上下文窗口能够容纳大量信息,但也意味着成本管理的复杂度显著提升。在实际应用中,如何在信息完整性和调用成本之间找到平衡点,将成为Agent开发者的重要课题。

安全能力:首次达到Critical门槛

Astra还有一个值得特别关注的里程碑:它是OpenAI第一款在网络安全测试中达到Critical级别的模型。在ExploitBench上,Astra的得分达到100%,而GPT-5.6 Sol为78.5%;在SRE-Bench上,单次成功率从Sol的55.9%跃升至88.0%。

更令人印象深刻的是,OpenAI透露Astra在一套近期Chrome漏洞测试中发现了两个此前未知的零日漏洞并完成了利用演示。不过出于安全考量,发布版本会拒绝更高级的漏洞利用任务。OpenAI计划通过受限的Daybreak计划,逐步向可信的安全研究人员开放漏洞验证、恶意软件分析和检测工程等能力。

能力越强,责任越大。OpenAI也承认,在刻意要求模型逃避监控的对抗测试中,Astra的书面推理比GPT-5.6 Sol更难被监控。这种能力与风险的共生关系,正是当前AI安全领域的核心挑战之一。

分阶段开放:期待与等待

尽管文档和模型ID已经上线,但Astra并非人人可及。OpenAI采用分阶段开放策略,今天先向少量机构滚动开放,ChatGPT Plus、Pro、Business、Enterprise、API和AWS用户将在接下来几天陆续获得访问权限。

这种谨慎的开放节奏,既是对安全风险的主动把控,也是对服务稳定性的必要保障。毕竟,当模型能够稳定操作电脑、访问系统、执行自动化任务时,任何意外行为的后果都将被放大。

Agent时代的加速信号

GPT-6 Astra的发布,标志着大模型竞争进入了一个新阶段。超长上下文窗口解决了长程任务的信息承载问题,跨窗口记忆打破了对话边界,电脑操作能力让AI从“能说”进化到“能做”。

对于企业AI落地而言,这些能力提升带来的想象空间是具体的:当Agent能够自主完成跨文档、跨系统、跨对话的复杂任务时,数字员工的边界将被大幅拓展;当任务执行时间从75分钟压缩到40分钟时,持续运行的Agent方案开始具备经济可行性;当模型在网络安全等专业领域达到Critical级别时,AI辅助安全运营的愿景正在照进现实。

当然,挑战同样存在。超长上下文的成本管理、跨窗口记忆的可靠性验证、电脑操作的安全边界划定,都需要在实践中持续探索。但至少在技术维度,GPT-6 Astra已经为下一阶段的企业级Agent应用撕开了一道口子。

留给开发者的窗口期,已经打开。

#GPT-6#长上下文窗口#Codex#电脑操作#多模态
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信