GPT-5.6自主优化代码:服务成本降20%,token生成效率涨15%+,AI自进化来了?

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

【GPT-5.6上线,开启代码自主优化】

这回,AI开始为自己写代码了!GPT-5.6一上线,接到的第一个大活,就是给自己的运行环境来了一次大「翻修」。它自主重写、优化了OpenAI线上那套底层代码,也就是真正负责跑模型的生产GPU内核。

【优化成效显著,成本与效率双提升】

7月29日,OpenAI官方甩出一组数字:GPT-5.6 Sol参与的内核优化,让OpenAI对外的服务成本降了20%;推测解码的改进,让模型生成token的效率提升超过15%。这次GPT-5.6动的不是一个跑在演示环境里的Demo,而是OpenAI正在线上跑的,每天承载十亿级用户请求的那套生产系统。用OpenAI总裁Greg Brockman的话说:让GPT-5.6 Sol去提升生产服务效率,正是它又强又便宜的原因之一。

【OpenAI内部打法:两步提升效率】

而OpenAI内部,早已形成一套完整的打法,Codex掌门人Tibo(Thibault Sottiaux)把它概括成两步:第一步,训出一个足够强的模型;第二步,用这个模型去把一切变得更好,包括运行它自己的基础设施、推理栈和内核。

【20%服务成本节省之谜】

20%是怎么省出来的?这20%的服务成本,到底是怎么省出来的?GPT-5.6 Sol通过Codex,接进了OpenAI的生产推理栈,碰的全是推理栈里最核心的几块:GPU内核、负载均衡、推测解码、KV缓存。GPT-5.6在智能体框架、API编排、模型推理三层做优化,换来更少网络传输、更少CPU开销、更多GPU产出。负载均衡,翻译成人话就是别让某几张卡忙到冒烟,而另外几张卡却只是闲着;KV缓存,是把算过的中间结果存下来重复用,不做无用功;推测解码,是让一个小模型先抢答、大模型只负责验收。答对了,一次就能多输出好几个字,不用像平常那样一个字一个字慢慢挤。

【GPT-5.6 Sol具体行动与成效】

然后再看GPT-5.6 Sol干了什么。它分析真实的生产流量,揪出以前被忽略的负载不均,测试新的路由策略;它自主重写了用Triton和Gluon这两种GPU编程语言写成的生产内核,专门去找那些能预先算好、能跳过、能并行的活儿;在推测解码环节,它针对配套的draft模型,设计并跑了数百次架构实验,还自己启动、盯着训练流程,遇到硬件故障和训练不稳定,自己主动介入。这些环节一个个抠下来,最后就换来了开头那两个数字:服务成本降20%,token生成效率涨15%+。

【早有端倪,降本变为现实】

其实早在7月9日GPT-5.6发布时,OpenAI就已透露端倪。内部研究员已经在用它排查故障、优化训练系统、跑实验、解释结果,还专门给它设了KernelGen、NanoGPT、RSI Index这几项「自我改进」评测。这次降本20%,意味着这些布局,第一次变成账单上实打实的数字。

【闭环跑通,意义重大】

比节省20%更重要的是一个闭环。真正重要的变化,是一个闭环跑通了。分析流量、提出优化、写出代码、跑完实验、处理掉故障,再拿生产指标回来验证结果,现在这条回路的每一环,模型几乎都能参与。一次任务里,模型不断「决策→调用工具→读取结果→再决策」,循环往复直到交付。拿推测解码举例。这个技术要配一个更小的draft模型,GPT-5.6 Sol针对这个draft模型,设计并跑了数百次架构实验,改尺寸、改结构、改特性。数百次实验,过去这要靠一个稀缺的GPU工程师,凭着经验和直觉,一个配置一个配置地手工试,试上几个月。配置空间太大,大到人根本试不完,只能靠粗糙的经验法则拍脑袋。现在,模型能把这个「测量、优化、验证」的循环压到极短。于是,团队能探索更多想法,更快跟上不断变化的负载。更关键的是,这个闭环,还会自己滚起来。模型越强,越能把推理栈优化得越省;越省,同样的硬件就能服务越多请求;服务的人越多,OpenAI就能把更强的模型铺给更多的人用。OpenAI的内部数据能佐证这个环转得有多快:GPT-5.6内测阶段,每位活跃研究员的日均token输出,是GPT-5.5时代最高值的两倍以上;过去半年,用于内部代码推理的研究算力占比涨了100倍,内部智能体token用量涨了约22倍。省下的每一分算力,最后都变成了让更多人能用上的智能。

【AI自进化?尚不完全是】

AI开始自进化了吗?那么,这到底算不算「AI开始自我进化」?至少现在,还不算。GPT-5.6 Sol优化的,是运行自己的软件、服务配置,还有辅助的draft模型。没有证据表明它在线改动了自己的主体权重,也没有证据表明它能脱离工程团队,自己升级出下一代模型。如果把权重比作模型智能的「货物」,内核和配置就是运货的卡车和路线。它这次优化的是运输,还没碰到货物。因此,更准确地说这是「自优化飞轮」的早期形态,不是递归自我改进。

【自主不等于无人参与】

还有一点要注意。官方这次用了「自主(autonomously)」来形容内核重写和部分实验,但不等于「完全无人参与」,目标由谁定、接进哪套生产系统、拿什么工具验证、怎么部署上线,这些环节都还牢牢攥在OpenAI的工程体系手里。比如验证环节:模型写完的生产内核,要经过审核才能上线。OpenAI专门搬出一个叫FpSan(浮点消毒器)的开源工具,检查这些内核的结构和数据流对不对。自动验证体系跟不跟得上,才是「敢让AI写底层代码」的真正瓶颈。

【OpenAI为RSI铺路】

往前看,OpenAI也一直在为RSI(Recursive Self-Improvement,递归式自我改进)铺路。早在2月,GPT-5.3-Codex就被官方形容为「参与了自己的创造」;这一次,GPT-5.6 Sol又自主后训练了更小的Luna;在内部专门衡量自我改进能力的RSI Index上,它比GPT-5.5高出16.2分。OpenAI内部RSI Index成本-得分曲线:GPT-5.6三档全面压过5.5、5.4,同等得分更省钱。老对手Anthropic的一个判断更激进:人类如今只对个位数百分比的方向性决策负责。其联创Jack Clark更是称2028年底前出现完整的递归自我改进,概率超过60%。飞轮是转起来了,但真正的「AI自己造AI自己」还在路上。

【竞争轴转变:效率成关键】

竞争轴变了:从谁GPU多到谁榨出更多token。这20%,意味着同样一批卡,OpenAI现在能多接两成的活。它指向一个更大的变化。过去几年,AI公司比的是谁买得起更多GPU。这套逻辑简单粗暴,也砸钱如流水。但在一个算力永远不够、需求涨得比产能快的世界里,另一个关键变量已经浮出水面:同样一批卡,谁能榨出更多token?推理效率,正在变成和芯片数量同样重要的筹码。OpenAI自己已经用产品线投了票。GPT-5.6这次一口气分成Sol、Terra、Luna三档,就是要主打一个卖点:同等智力,更少token。效率,被摆到了和智能同样重要的位置。而这一次,帮OpenAI的模型提升推理效率的,正是模型自己。模型越强,越能优化推理栈;推理栈越高效,同样硬件就能服务更多token;成本一降,更强的模型又能铺给更多人用。这个飞轮,OpenAI已经让它转起来了。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

内容概要:本文围绕发光太阳聚光器开展蒙特卡洛光线追踪研究,重点利用Matlab编程实现光线在聚光系统中的传播路径模拟。通过蒙特卡洛方法对大量随机光线进行统计追踪,精确分析光能在接收面上的分布特性、聚焦效率及系统整体光学性能,进而评估不同几何结构与材料参数对聚光效果的影响,为高效太阳能收集系统的设计与优化提供理论依据和技术支持。研究不仅涵盖核心算法实现,还结合多个跨领域科研案例(如电力系统、路径规划、信号处理、机器学习等),展示了Matlab/Simulink在科研建模与仿真中的广泛应用价值,突出了算法仿真与多学科交叉融合的重要性。; 适合人群:具备一定Matlab编程基础,从事光学工程、新能源技术、仿真建模及相关领域研究的科研人员,尤其适合研究生及青年研究人员。; 使用场景及目标:①掌握蒙特卡洛方法在光学系统仿真中的原理与应用;②学习使用Matlab实现光线发射、反射、折射及能量统计的完整追踪流程;③通过实际代码实践优化聚光器结构设计;④借鉴文中多领域仿真案例,拓展科研视野与技术迁移能力; 阅读建议:此资源以代码实现为核心,建议读者结合Matlab环境动手运行与调试程序,重点关注光线追踪的物理建模与数值计算细节,并参照其他仿真范例举一反三,全面提升科研建模与算法实现能力。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值