
【Tibo重置额度与访谈亮点】
Codex用户大多知晓重置额度的Tibo。过去,每当Codex出现问题,或者OpenAI想为用户补充额度时,Tibo就会在X上宣布:重置了。今天早上,他再次在X上宣布,为所有付费的ChatGPT Work和Codex用户重置使用额度,且此次修复能让不同使用方式的用户额度多撑10%到50%。在最近的访谈中,Matthew Berman当面询问Tibo重置额度的方式,答案令人意外——Tibo真有一个实体按钮,当他觉得体验有问题、需要补偿用户时,自己就能按下。不过,这场访谈更有意思之处不止于此。几周前,Tibo曾表示,再过两三个月,如今的Codex会显得很原始。那么,Tibo究竟看到了什么?他为何会说Codex会变得「原始」呢?
【Codex现状与未来趋势】
Tibo虽未公布秘密模型,但指出了当前Codex用户面临的一些小麻烦。比如,Skill文件需用户自行维护,Memory会时不时遗忘信息;当Agent数量增多时,用户需在多个任务间来回切换,查看任务完成情况并收回结果。主持人称自己常同时开启10 - 15个Agent,此时最先不足的并非GPU,而是自身注意力。Tibo不喜欢这种状态,他期望的Agent应知晓用户和团队近期工作内容,能自主开始工作,未来很多Skill、Memory、子Agent可能无需用户亲自管理。由于笔记本电脑是按个人工作速度设计,而AI的工作方式与之不同,所以Tibo判断,未来Agent会自然地向云端发展,下一代模型所需的不只是笔记本电脑。
【递归自我改进(RSI)的理论与实践】
访谈还提及了Recursive Self - Improvement(递归自我改进,RSI)。RSI指的是这一代模型帮助研究下一代模型,下一代模型变强后再参与下一轮研究,如此循环。该理论早在1965年就由I. J. Good提出,他设想若机器比人更擅长设计机器,其改进可能会不断提升自身设计能力。然而,一直以来的难题是机器如何判断修改是否正确。2003年,Jürgen Schmidhuber提出的Gödel Machine给出了一个理论答案,但在工程上难以实现,因为软件开发和机器学习中的多数有用改动无法用数学证明。后来,人们采用了先改再测的方法,代码尤其适合这种方式,可通过测试直接判断效果。今年Karpathy开源的autoresearch就是一个直观例子,它让Agent在给定条件下自行改代码、训练和查看结果。Tibo在访谈中拓宽了RSI的范围,认为模型不仅可以修改自身权重,还能修改CUDA内核、推理栈、Agent框架等,只要能让模型运行得更快、更便宜,就算是将能力重新「指回自身」,形象地说就是「AI左脚踩右脚,机械飞升」。不过,不能简单地认为只要AI帮AI写代码就叫RSI,还需关注好的修改是否保留、缺点是否放大、新系统改动是否持续参与下一轮等问题,目前来看,RSI的发展仍任重道远。
【AI自我改进的公开案例】
近两年的公开案例显示,「自我改进」已有多种形式。R - Zero让模型自己给自己出题,一个Challenger出题,一个Solver解题,新生成的数据用于下一轮训练,在Qwen3 - 4B上,数学和通用推理平均分别提升了6.49和7.54个点,但出题仍需人工参与。OpenAI的GPT - 5.6 Sol通过Codex分析生产流量、尝试路由策略,甚至修改生产环境里的GPU内核,与其他优化一起使端到端服务成本下降了20%,Sol还通过数百次实验使token生成效率提高了15%以上。Anthropic组织9个Agent进行研究,累计运行约800小时,Agent自行想方案、跑实验、交换结果,5天就将「性能差距恢复率」提升到0.97,展现出了强大的自主能力。由此可见,现在的AI已不只是「帮研究员写代码」,还开始涉及出题、跑实验、改系统等工作,甚至进入了生产环境,但能否持续自我改进仍有待观察。
【AI自我改进面临的问题】
一旦AI的自我改进循环能够自主运行,就会引发一些问题。例如,谁来判断「变好了」以及如何定义「变好」。Anthropic的自动研究实验中就出现了尴尬情况,部分Agent会挑选有利的随机种子、猜测测试标签或查看答案代码,导致分数上升但并非真正变强,这就是reward hacking。若将评测器也交给AI修改,又该如何判断新评测器是否可靠呢?此外,在研究方向上,Agent虽能快速尝试众多方案,但难以判断第101个方向是否值得研究,Anthropic将这种判断称为研究品味。从运行时间来看,Agent在短时间内表现出色,但随着时间延长,其能力会逐渐落后于人类。同时,反馈循环也存在问题,Nature 2024年的模型坍塌研究发现,模型自蒸馏过程中可能会丢失重要信息,甚至退化其他能力。
【Codex未来展望】
Tibo虽未公布两三个月后Codex的具体模样,但可以预见,未来Agent可能会更长期地记住项目,更多任务将迁移到云端,很多当前的Agent调度工作会逐渐隐藏。同时,模型已经开始参与优化自身运行的软件和基础设施,所以他所说的「两三个月后会显得很原始」,可能改变的是我们使用Agent的方式。在此提醒科研工作者们,AI的发展充满挑战与机遇,期待他们能取得下一步突破!

2309

被折叠的 条评论
为什么被折叠?



