北京时间2026年9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。距GPT-5首次发布约一年,距离上一个重要更新版本GPT-5.6仅过去两个月。OpenAI总裁格雷格·布罗克曼在发布会上直接宣告:“欢迎来到AGI时代。”
Astra在拉丁语中意为“星辰”。OpenAI官方将其定义为“新一代智能”,称这是“全球最智能且对齐程度最高的模型”。
多项基准测试接近满分
GPT-6 Astra在多个关键评测中展现出前所未有的性能:
-
FrontierMath Tier 4:得分98%,已接近饱和。据OpenAI透露,该模型已帮助解决数学领域长期悬而未决的开放问题。
-
ARC-AGI-3:得分99.9%,近乎完美。上一代GPT-5.6 Sol仅为7.8%。人类测试者的平均得分仅为48%。
-
ExploitBench(网络安全测试):得分100%。GPT-5.6 Sol为78.5%。
在Terminal-Bench 4.0上,Astra拿到57.7%,GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%。在DeepSWE v1.1软件工程基准上,Astra达到74.1%,较Claude Fable 5.1高出6.7个百分点。
105万上下文窗口,从“对话”走向“操作”
Astra的上下文窗口达到105万token,最大输出128000 token。这个数字不只是“记忆”变大,而是让模型终于有机会“连续工作”——在真实环境里持续跟踪系统状态、记录执行过的命令,并在下一步操作中参考前面的结果。
它不再是只会回答问题的工具,而是可以直接操作电脑。可以自主填写网络表单、更新CRM客户记录、整理日历,也可以进行在线搜索、撰写总结、分析科学数据、生成图表、创建网站并运行前端质量测试。
在OSWorld 2.0测试中,Astra得分72.6%,每任务耗时约40分钟;GPT-5.6 Sol为65.7%,耗时约75分钟——Astra在提升性能的同时,每任务耗时减少约47%。
首个达到“关键级”网络安全能力的模型
Astra是OpenAI首个在自家准备框架中触及“关键级”网络安全门槛的模型。在没有逐步指导的情况下,Astra能自主发现防护严密的系统里未知的漏洞。
在ExploitBench上,Astra拿下100%满分。同时它也是OpenAI“对齐程度最高的模型”——在测试中,GPT-5.6 Sol有48%的测试案例超出了授权目标,而GPT-6 Astra的越界比例为0%。
定价与开放节奏
GPT-6 Astra的API价格为输入10美元/百万token、输出50美元/百万token,是GPT-5.6 Sol的2.5倍,与Anthropic Fable 5.1定价持平。
模型将分阶段开放。初期仅向参与OpenAI Daybreak Access网络安全项目的部分组织开放,未来几天陆续向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,同时通过OpenAI API和AWS提供服务。
对开发者意味着什么?
GPT-6 Astra的能力提升是真实的——105万上下文、接近满分的推理测试、自主操作电脑的能力,这些都会让更多复杂任务变成可能。
但对开发者来说,这也意味着一个更现实的问题:当模型越来越强、选择越来越多、定价结构越来越复杂,你怎么在多个模型之间统一管理调用、对比效果、控制成本?Astra定价是上一代的2.5倍,有些任务值,有些任务不值。把简单任务也跑在旗舰模型上,账单很快就会失控。
我们团队开始用EasyAPI这类聚合层做统一管理——一个Key接入所有主流模型,统一记录调用延迟和成本,切换只改配置不碰业务代码。Astra能力再强,也只是你工具箱里的一把工具。当你有五把、十把工具的时候,“怎么管”和“用哪个”一样重要。

也有很多主流大模型可以选

694

被折叠的 条评论
为什么被折叠?



