OpenAI首席科学家:直面AGI的可能性

db47b9213dc4ac6036ab9ef9f4320417.png

AI 寒冬曾造成机器学习和 AI 对齐之间的分歧,上世纪 90 年代,AI 对齐领域天马行空的畅想与机器学习的惨淡现实形成了鲜明对比,人们普遍对机器学习的发展持悲观态度。自2010年以来,以深度神经网络为代表的 AI 技术飞速发展,AI 对齐随之成为被逐渐重视的研究方向。

AGI 是 AI 技术发展的终极目标,鉴于这项技术的深远影响,近期在旧金山举办的AI对齐论坛的演讲上,OpenAI 首席科学家 Ilya Sutskever 指出,促进人们形成关于 AI 对齐与机器学习的统一,将 AGI 安全纳入机器学习的主流方向十分必要。他还称,通用人工智能和超级智能很有可能在我们有生之年实现,实现巨大的变革,我们不该局限于现有观念,对其潜力设限。

(以下内容由OneFlow编译发布,转载请联系授权。原文:https://www.youtube.com/watch?v=OPZxs6IXH00)

作者 | Ilya Sutskever

OneFlow编译

翻译|杨婷、宛子琳

目前,AI 领域发展迅速,通用人工智能(AGI)已不再是天方夜谭。

现在,我先补充一些相关背景知识,以帮助大家了解当前状况的成因。AI 对齐和机器学习一直在研究相关问题,但直到最近,它们才开始有了交集。

1

AI 对齐与机器学习

AI 对齐和 AGI 安全的起源可以追溯到早期的科幻文学。当时人们还可以任意发挥想象力,尚未受到现今的技术限制。人们会思考如下问题:“如果我们拥有一个足够强大的 AI 系统,它能够执行研究、科学、工程和技术等任务,能够进行 AI 研究、编程和芯片设计,并且还能将上述能力整合到一起进行管理,那将发生什么?”

扪心自问,我们或许会得出这样一个答案:那将会导致重大变革。随之而来的问题自然是:如此强大的 AI 似乎也会带来许多挑战,作为普通人,我们应该如何更好地利用 AI?这就是 AI 对齐诞生的原因。

机器学习领域也有着类似的科幻起源。在1940年代和1950年代,一些有远见的科学家开始思考以下问题,比如:什么是智能?大脑是如何运作的?我们能否在计算机上构建大脑?是否可以创造出人工神经网络?计算机能够进行学习吗?对于以上问题,当时的研究人员十分乐观,他们相信人类水平的 AI 将在五年内实现。

2

AI 寒冬

但事实证明他们错了,随后 AI 寒冬到来,造成了机器学习和 AI 对齐之间的分歧。AI 寒冬的后果是什么?它阻碍了机器学习的进展,使人们对机器学习的发展前景变得悲观而绝望。

当时,计算机的运行速度十分缓慢,在这种情况下,机器学习难以取得任何成就,传统的符号 AI 成为唯一可用的 AI,在 70、80 甚至 90 年代,符号 AI 主导了 AI 领域。在计算机如此缓慢的情况下,符号 AI 是唯一的选择。这种情况给 AI 领域造成了极大创伤,人们对 AI 的发展普遍持悲观态度。当时,AI 要取得进步是一件十分困难的事,因此,任何进步都值得赞扬。

人们对 AI 的悲观态度持续了很长时间,即使到了2010年代初期,这时早期深度学习已在视觉和语言等多个任务上取得了进展,但人们对 AI 的悲观情绪却仍在持续。我也是悲观者之一,在我看来,尽管 AI 已经发展到了一定程度,但这些都是暂时的,发展一定会停滞,AI 寒冬终将卷土重来。

上述情况导致了 AI 领域的分道扬镳,由此形成了 AI 对齐和机器学习两个领域。在 AI 对齐领域,人们可以尽情发挥想象力,就超级智能和 AI 提出最大胆的问题,想象 AI 在何种情况下会变得更好或更糟。而机器学习虽然对神经网络和一些之前的成果(如支持向量机)非常熟悉,但它只能勉强分类分辨率很低的数字。

面对这两种截然不同的情况,人们自然无法将 AI 对齐和机器学习联系在一起,AI 对齐似乎太过疯狂,与机器学习的现实差异太大。但上述看法只适用于 90 年代或上世纪初,现在已经过时。

众所周知,AI 在 2010 年代获得了飞速发展,在视觉识别、翻译、摘要生成、游戏对战以及围棋等领域取得了惊人成果,此外,图像生成、聊天机器人等技术也逐渐成为现实。AI 近年来的发展好比是一辆高性能汽车,从 0 码提速到 60 码只需两秒。

5cdbcd961d30e3fb9c98659a592dff63.png

上面这张漫画在 Twitter 上经常出现,生动地描绘了机器学习的现状:要么发展过慢,要么发展过快,中间只有短暂的过渡,就像美国东海岸的夏天。

3

让 AGI 安全成为主流

现在,通用人工智能(AGI)不再是一个暗淡无光的词汇。阿瑟·C·克拉克(Arthur C. Clarke)在他的《未来的轮廓(Profiles of the Future)》一书中探讨了原子能、火箭和航天飞行三个重要的技术革命。在每个技术革命取得突破前不久,总会有专家以坚定的口吻声称该技术是不切实际的,永远不可能成为现实。

目前,AGI 也面临着相似的情况,这种现象十分有趣。尽管 AGI 在某些方面仍然有着令人难以想象的地方,但它正在逐渐变为现实。消除或进一步减少《未来的轮廓》中描述的一个问题是:想象力缺失。正是因为缺乏想象力,上述专家才敢断言那些技术革命不会成为现实。想象力的匮乏导致他们在某些方面过度自信。然而,现在有大量证据表明,AI 已今非昔比,但在很多方面,我们仍受到想象力的限制。

希望大家能解决上述问题,使我们能够迈出坚定的步伐,将 AGI 安全纳入机器学习的主流方向。

机器学习领域有众多研究人员,将 AGI 安全纳入机器学习主流能带来更多益处。我们应该将 AGI 安全与基础策略相结合,那么为什么要关注基础策略?

4

对齐为何重要?

首先是对齐。很多机器学习领域的人可能还没有接触过与对齐相关的概念。从基础层面出发,我们将探讨对齐面临的问题和挑战。即使不涉及具体的解决方案,对上述问题的探讨本身就很有价值。

我想花几分钟时间提出几点论证,以强调对齐的重要性。在机器学习领域,人们可能会问,我们一直都能让人工智能系统按照我们的意愿工作,为什么这会发生改变呢?

接下来,我们将探索不同的 AI 范式,并探讨为何对齐可能会变得更难或更容易。

监督学习

在监督学习中,我们使用由人类标注者生成的数据集进行训练,在语音识别中,我们使用人类标注者对语音进行标注;在机器翻译中,有人类译员对语音进行翻译;在视觉识别中,我们会训练神经网络来模仿由这些数据产生的行为。

在这些情况下,数据理解对我们来说相对容易。我们对这些数据有很多见解,因此,当我们利用已充分理解的数据进行监督学习时,可以不用太担心训练结果。

无监督学习

无监督学习与上述情况有所不同,原因如下:当我们在大量互联网数据上对神经网络进行预训练时,我们知道神经网络获得了一些与语言和世界相关的知识。然而,我们对它们所学知识的理解相对有限,不能确定它们究竟学到了什么。

463ad5361e0de7ac30d27ffc1202fb2d.png

由于我们对神经网络的行为了解较少,难以让神经网络实现我们所期望的行为。实证表明,这些模型仍然存在编造内容的情况。这一点很重要,如果这一点微不足道,模型就不会编造内容。

因此,与简单的监督学习中的语音识别、计算机视觉等任务不同,无监督学习面临着新的困难,这些困难可能以一种出乎意料的方式给我们感到惊讶。

这一点在 Sydney(微软 Bing 搜索的生成式 AI 聊天机器人)上表现尤为明显。Sydney 具有丰富的个性,这并不完全符合 Bing 创建者的最初意图。在现实世界中,有更多的经验证据表明,一旦开始无监督学习,情况就会变得更为复杂。

当然,问题的关键在于,AI 系统的性质以及对齐的难易程度会随着范式的改变而改变。第二个范式是强化学习。

强化学习

如今,强化学习已成为正在构建的聊天机器人中不可或缺的一部分。在预训练之后,会启动强化学习阶段,通过某种(或一组)奖励函数进行训练。或许我们可以通过机器学习来具体说明。

df4274ba9d84c7cf6b44fa863890d7aa.png

在某种程度上,我们确实可以做到这一点,并且还能取得不错的效果,尽管我们确实会遇到早期对齐思考者假设的过度优化问题。例如,优化奖励函数或者优化从人类教师那里学到奖励模型可能会非常容易,但我们也很容易就会学到一些意料之外的东西。强化学习的过程非常复杂,事实上,强化学习还具备一定的创造性。

尽管我们可以快速解决过度优化问题,但强化学习面临着更为关键的挑战:创造性。在 AI 领域,每一个令人惊叹的创新都源自于强化学习。

例如,AlphaZero 通过强化学习发明了一种全新的游戏策略,人类打磨完善这个游戏已经有数千年。强化学习能够针对问题提出创造性的解决方案,而这些方案可能是我们所无法理解的。

f677fc51f33ee0e940889e221696fa0a.png

如果 AI 在与真实世界进行互动时,同时以我们认为有益的结果为目标,并展现出极高的创造力,那么在中长期时间跨度上进行强化学习,会带来怎样的结果?

这个问题确实存在,但并不意味着它无法解决。事实上,这表明一些相对简单的方法可能会受到一些出人意料的创造性影响,使得 Sydney 的“花招(antics)”变得合情合理。

5

AGI 与超级智能

最后,让我们尽情展开想象,来探讨通用人工智能这一终极目标。当你编程的 AI 输出了成千上万行的代码时,会发生什么?这将是一个庞大程序。你可以进行一些单元测试,甚至可以与这个程序交互。

这是一个全新的、亟待解决的问题,即确保 AI 系统输出的十万行代码内部不包含任何可疑内容。我们希望努力控制这些代码的生成过程。然而,这也带来了另一个全新挑战。

9abdcc53806dc958644445a658c495a8.png

这个问题并不简单。当我们无法理解 AI 的输出,而且它具备强大的创造力及实际行动能力时,训练 AI 或理解其行为并不容易。

现在,想象一下,如果你拥有一个能够管理一家公司或实验室的 AI,会发生什么?

最后一个问题有关欺骗(deception),顺便提一下,这对于那些有严格的机器学习背景的人来说是一个更有趣的想法。如果有这样一个人工智能,它非常智能,在训练过程中展现出了高超的医疗能力,但实际上,这个 AI 更想成为一名 YouTuber(视频号博主),这时会发生什么?

6

结语

3c6451eafdec9e73c0a682b165b199d3.png

总的来说,通用人工智能和超级智能有可能出现,而且可能将在短期内实现。虽然很难给出确切时间点,但相关进展确实发展得非常迅速,因此我们不应该局限于现有观念,不应该对其潜力设限。

AGI 将产生极其巨大(Mega gigantic)的影响,实际上,“极其巨大”只是 AGI 影响力的保守下限而已。面对这样一项影响深远的技术,谁也无法预测接下来会发生什么,一切皆有可能。

话虽如此,但至少在技术层面上,我们可以提供一定的保证,确保问题是出在人类操作上,而不是出在技术本身的行为上。这是我们可以追求的一个相对较低的基本目标。

当前的一个具体目标是,我希望让更多的人对 AI 对齐和机器学习有一个更加统一的认识。目前,这两种想法可能存在一些脱节之处,将它们联系起来并赋予更加完整的内涵具有非常重要的意义。这是我关于 AI 的未来愿景,希望通过讨论、交流等活动,这一愿景终能成为现实。

其他人都在看


欢迎Star、试用OneFlow: github.com/Oneflow-Inc/oneflow/icon-default.png?t=N7T8http://github.com/Oneflow-Inc/oneflow/

相关推荐

<span class=“js_title_inner“>OpenAI 前首席研究官:AGI 核心突破已实现</span>

归根结底,与人合作时要理解他们的诉求,既要让他们实现创作目标,又要协调所有人的贡献形成整体成果,并持续反复地解决这个问题。但如果他们知道你是在为他们争取最大利益,那么当你要求他们去做那件极其困难且令他们恐惧的事情时,有时你就能帮助他们跨越鸿沟,解决问题,避免他们做出愚蠢的举动,最终获得圆满的结果。,包括在实现方式上的品味,其中可能存在不明显的后果——也许是性能上的隐性影响,也许是用户界面演变过程中难以预见的连锁反应,进而需要改变系统更深层的抽象结构——这些只能依靠人类来完成,目前别无选择。

OneFlow深度学习框架 721

<span class=“js_title_inner“>OpenAI 前首席研究官:AGI 核心突破已实现</span>

归根结底,与人合作时要理解他们的诉求,既要让他们实现创作目标,又要协调所有人的贡献形成整体成果,并持续反复地解决这个问题。但如果他们知道你是在为他们争取最大利益,那么当你要求他们去做那件极其困难且令他们恐惧的事情时,有时你就能帮助他们跨越鸿沟,解决问题,避免他们做出愚蠢的举动,最终获得圆满的结果。,包括在实现方式上的品味,其中可能存在不明显的后果——也许是性能上的隐性影响,也许是用户界面演变过程中难以预见的连锁反应,进而需要改变系统更深层的抽象结构——这些只能依靠人类来完成,目前别无选择。

OneFlow深度学习框架 408

<span class=“js_title_inner“>LLM 推理经济学</span>

作者 | Piotr Mazurek & Felix GabrielOneFlow 编译翻译|张雪聃题图由 SiliconCloud 生成当前 LLM 公司的主要商业模式是通过 API 提供模型访问服务,推理成本结构是决定其盈利能力的关键。本文将从底层原理阐释大模型托管/服务的成本来源、单个 GPU 可生成的词元(Token)数量及其成因,本文以开源模型 LLaMA 3.3 为基础,搭建一个简化版的大模型推理运算世界模型,旨在建立关于 LLM 推理的精确直觉认知。大模型推理的经济学影响远超过技术范畴本身。随

OneFlow深度学习框架 632

Databricks“三级跳”:600 亿美元独角兽的战略跃迁

本文以 S 曲线理论为分析框架,深度解构 Databricks 的三次关键战略跃迁,还原了其技术商业化路径中的关键决策——如拒绝本地化部署的短期利益、与微软 Azure 的生态合作以及从开源社区到企业级服务的平衡艺术。Databricks 作为数据与 AI 领域的代表性企业,从开源项目 Spark 起步,逐步发展为估值超 600 亿美元的行业巨头,其成长历程不仅折射出大数据技术的演进史,更揭示了科技公司如何通过连续的战略跃迁实现指数级增长。当时的背景是:互联网的迅速发展催生了海量数据,尤其是非结构化数据。

OneFlow深度学习框架 1203

AI 云服务之争:CoreWeave 向上,Nebius 向下

平台中的大多数工具均为自主研发,包括支持大规模调度的托管 Kubernetes、基于 Slurm 的集群调度系统、用于实验管理的 MLflow、自研的可观测性工具,以及一个具备安全保障的云端基础设施控制平台。它跳过了这一环节,设计了自己的服务器机架,以建立一个更加垂直整合的系统,从数据中心架构到托管式 Kubernetes 服务,再到像 Nebius AI Studio 这样的应用层工具(该工具为 DeepSeek、Llama 和 Flux 这样的开源模型提供推理 API)。的策略更全面和“全栈”。

OneFlow深度学习框架 2074

<span class=“js_title_inner“>AI 云服务之争:CoreWeave 向上,Nebius 向下</span>

平台中的大多数工具均为自主研发,包括支持大规模调度的托管 Kubernetes、基于 Slurm 的集群调度系统、用于实验管理的 MLflow、自研的可观测性工具,以及一个具备安全保障的云端基础设施控制平台。它跳过了这一环节,设计了自己的服务器机架,以建立一个更加垂直整合的系统,从数据中心架构到托管式 Kubernetes 服务,再到像 Nebius AI Studio 这样的应用层工具(该工具为 DeepSeek、Llama 和 Flux 这样的开源模型提供推理 API)。的策略更全面和“全栈”。

OneFlow深度学习框架 142

关于 DeepSeek-R1 API 评测,至少有 7 个误区

xx 58.33%。以某评测者的“人类头发数量的乘积是多少?市面上基本不存在“非满血版 R1”,也基本不存在所谓模型“降智”,而 R1 蒸馏版(70B、1.5B等)与满血版的效果差距很明显,一般知名服务商都会注明,如果这些平台提供所谓“非满血版 R1”,很容易测试出来,这完全是自砸招牌,他们没有动机“以次充好”。可以确定的是,市面上知名的第三方平台部署的都是“满血版 R1(671B)”,之所以用户使用感受有差异,是因为模型输出的随机性、平台提供的配套功能及超参数设置等可能不一致,而非底层模型本身的差异。

OneFlow深度学习框架 1124

<span class=“js_title_inner“>关于 DeepSeek-R1 API 评测,至少有 7 个误区</span>

xx 58.33%。以某评测者的“人类头发数量的乘积是多少?市面上基本不存在“非满血版 R1”,也基本不存在所谓模型“降智”,而 R1 蒸馏版(70B、1.5B等)与满血版的效果差距很明显,一般知名服务商都会注明,如果这些平台提供所谓“非满血版 R1”,很容易测试出来,这完全是自砸招牌,他们没有动机“以次充好”。可以确定的是,市面上知名的第三方平台部署的都是“满血版 R1(671B)”,之所以用户使用感受有差异,是因为模型输出的随机性、平台提供的配套功能及超参数设置等可能不一致,而非底层模型本身的差异。

OneFlow深度学习框架 125

首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务

DeepSeek-R1、DeepSeek-V3 开源后引发全球震动,它们是深度求索团队为全人类献上的一份大礼,我们由衷为他们取得的成功感到高兴。经过硅基流动和华为云团队连日攻坚,今天,我们也为国内用户献上春节礼物:大模型云服务平台 SiliconCloud 首发上线基于华为云昇腾云服务的 DeepSeek-V3、DeepSeek-R1。 需要特别强调的是,无论是在昇腾上适配 DeepSeek-R...

OneFlow深度学习框架 4215

<span class=“js_title_inner“>首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务</span>

5. 与 DeepSeek 官方优惠期价格保持一致,SiliconCloud 上的 DeepSeek-V3 的优惠期价格(截止 2 月 8 日 24:00)为 ¥1 / M tokens(输入)& ¥2 / M tokens (输出),DeepSeek-R1 的价格为 ¥4 / M tokens(输入)& ¥16 / M tokens (输出)。华为云昇腾云服务可提供澎湃、弹性、充足的算力。双模型,还是在此前上线其他模型的过程中,我们都得到了 DeepSeek 与华为云的大力支持,向他们致以深深的谢意与。

OneFlow深度学习框架 118

站在 AI 十字路口:直面智能体与机器人狂潮

生成式 AI 正在迅速介入人类世界。随着 AI 大模型不断进步,我们正面临着巨大的社会变革。本文探讨了一个由高度智能的智能体和机器人主导的世界——AI 亚特兰蒂斯世界(指在数字领域拥有几乎无限的 AI 资源)。本文分析了当前的 AI 模型为何从根本上不同于以往的技术范式,它们如何重塑各行业,以及人类面临的关键选择。作者认为,每个人都必须理解 AI 的进步将如何重塑经济、创造力和人类潜力的规则。除...

OneFlow深度学习框架 591

<span class=“js_title_inner“>站在 AI 十字路口:直面智能体与机器人狂潮</span>

拥有 AI 的政府能够提供更好的服务,制定数据驱动的政策,增强国家安全,并为民众提供更高的透明度和问责制。这里有一个令人难以置信的想法:你现在可以雇佣智能体员工和机器人工作者,他们的薪水甚至低于你花在咖啡上的费用——然而他们却拥有与普通大学毕业生相同的技能。拥有更多的闲暇时间当然不错,但真正的关键是,AI 为你腾出了精神空间,让你能专注于更大的挑战。像 ComfyUI 这样的工具是这一转变的早期例子——人们现在可以创建复杂的 AI 工作流,其中信息和任务从一个阶段无缝流向另一个阶段。这些模型是通用翻译器。

OneFlow深度学习框架 81

迈向 AI 驱动型经济:当资本不需要打工人

AI 的迅猛发展与普及,引发了学术界与工业界对现在的社会结构与经济模型的根本性反思。此前 OneFlow 发布的《资本、AGI 与人类雄心》、《AGI 时代的智能诅咒》、《AGI 崛起之后:重构经济模式与社会结构》三篇文章,深入探讨了劳动力替代性 AI 改变人力与非人力生产要素的相对重要性后,给整个社会带来的好处与风险,以及应对挑战的解决方案。在本文中,借助一众经济学家和科幻作家的理论观点,Int...

OneFlow深度学习框架 1014

<span class=“js_title_inner“>迈向 AI 驱动型经济:当资本不需要打工人</span>

相对而言,伊恩·M·班克斯(https://en.wikipedia.org/wiki/Iain_Banks)的《文明》系列丛书则描绘了一个后匮乏的社会,在这个社会中,拥有感知能力的 “AI 智能体(AI Minds)” 管理着星舰和栖息地,根据需求分配资源,而非货币。例如,《星际迷航》中,技术(如复制器和先进的星舰 AI )消除了物质匮乏,推动了一个专注于探索和文化发展的社会。而 AI 的引入,使非人类智能体成为生产力的主要推动者,将剩余价值的核心转移到了算法、数据集和计算系统的所有权上。

OneFlow深度学习框架 91

AGI 崛起之后:重构经济模式与社会结构

AGI 日益临近,这也迫使我们重新审视现有的社会结构和经济模式。在《资本、AGI 与人类雄心》一文中,Rudolf 指出,AGI 到来之后,劳动力替代性 AI 将改变人力与非人力生产要素的相对重要性,这会降低社会对人类的关注度,同时使现有的权力更加有效和根深蒂固。基于资源诅咒现象,Luke Drago 在《AGI 时代的智能诅咒》一文中将 Rudolf 的上述核心观点描述为智能诅咒。他认为,智能诅...

OneFlow深度学习框架 1297

AGI 时代的智能诅咒

经济学研究指出,依赖出售石油等自然资源获得收入而非公民税收的国家,会受到资源诅咒的影响,结果是权贵们攫取了大量财富,却停止了对普通人的投资。当 AGI 实现后,人类是否会面临类似的“智能诅咒”?在此前发布的《资本、AGI 与人类雄心》一文中,Rudolf 指出,AGI 到来之后,劳动力替代性 AI 将改变人力与非人力生产要素的相对重要性,这会降低社会对人类的关注度,同时使现有的权力更加有效和根深蒂...

OneFlow深度学习框架 751

资本、AGI 与人类雄心

通用人工智能(AGI)正在不可阻挡地走向人类社会,有人期待它带来的巨大生产力突破,有人也在警告它可能成为洪水猛兽,也有人对它的发展只是持观望态度。不管怎样,基于你所了解的信息,你可以尝试描绘一幅 AGI 图景,并畅想它在人类政治、经济、社会发展会产生的影响。在本文中,作者 Rudolf 深入剖析了 AGI 到来之后的资本、人类劳动与社会权力结构之间的复杂关系。其核心观点是,劳动力替代性 AI 将改...

OneFlow深度学习框架 870

2025 年 AI 十大展望:软件市场扩大 10 倍、系统比模型更重要、OpenAI 先发优势消退...

尽管有 Scaling Law 放缓这样的疑虑,但整体而言,多数业内人士对AI过去一年的诸多进展感到兴奋,对新的一年 AI 的发展更是充满期待,尽管他们对未来的预测可能不尽相同。在本文中,Foundation Capital 合伙人Ashu Grag回顾了 2024 年 AI 发展的里程碑事件,并重点介绍了 2025 年的前景,主要包括:1.预训练局限将推动新的 AI 突破2.AI系...

OneFlow深度学习框架 1577

900页免费“生成式AI与大模型”电子书|OneFlow年货

难以想象,如果不是Scaling Law放缓,2024年AI领域会发生哪些惊人变化,但你可能又会感到庆幸,正是由于Scaling Law放缓,它给了这个行业的后来者们追赶的机会,也给了更多普通人搭乘这一轮技术革命的机会。AI领域的变化激荡人心。一年前,AI社区普遍认为,与OpenAI的模型相比,大部分模型与它有半年或一年的差距,但大模型预训练逐渐没有秘密,它的入局门槛数量级降低。令国内外科技界深感...

OneFlow深度学习框架 642

2024年AI盘点:投资高歌猛进、基础设施重构、技术采用加速

本文全面分析了今年AI 的发展,包含AI 技术栈的基础设施层、基础模型层、应用层、工具层,尤其是各个层面的主要收获、值得关注的趋势与值得关注的初创公司。此外,本文还概括了 AI 领域的投资和并购情况,以及其他AI 趋势。需要指出的是,可能限于作者KelvinMu的关注重心,本文除了对中国基础模型的介绍,没有更多关于中国 AI 其他技术栈的进展。不过,这并不妨碍本文仍是我们了解 2024...

OneFlow深度学习框架 1989

从零实现极速LLM推理

作者 | Andrew Chen翻译|张雪聃、刘乾裕OneFlow编译题图由SiliconCloud平台生成本文旨在从零开始,仅使用C++和CUDA构建一个大语言模型(LLM)推理引擎,且不借助其他外部库。为何要这样做?通过这种方式,我们能够全面了解LLM推理的整个技术栈——这一点正变得日益重要[1]——从CUDA kernel到模型架构,并且切实体会不同的优化方式如何影响推理速度。其中一个最为重...

OneFlow深度学习框架 1180

AI数据中心历史、技术与关键企业

过去一年,通过模型架构创新、更优质训练数据和更大算力规模来训练模型,顶尖大模型之间的性能差距急剧缩小。如果Scaling law依然有效,为了进一步扩展模型规模与性能,在模型架构创新存在极大不确定性情况下,通过获得更多的算力来建造全新的数据中心,从而更快地训练模型以取得领先地位,这是确定性更高的收益。目前,以马斯克xAI为代表的大模型公司,快速部署了10万台GPU集群,成为数据中心扩展的领头羊,可...

OneFlow深度学习框架 948

红杉资本2025年AI三大展望:大模型厂商各显神通;杀手级应用AI搜索;AI支出变稳...

2024年,随着Scaling law放缓,AI领域在大模型、基础设施上的能力稳步提升,尽管应用层出现了各种有趣的探索,但是更大的潜能有待挖掘。2025年即将来临,将出现哪些变化?近日,红杉资本投资人David Cahn对2024年AI领域的发展作了简要总结并对2025年作了三大预测。他认为,今年是AI发展的萌芽期,其构建基石已经稳固建立,只待2025年发芽结果。他在本文中阐述了三点预言:首次,基...

OneFlow深度学习框架 1657

AI半导体技术、市场与未来

过去两年,英伟达崛起是科技领域的一个经典案例。通过CUDA系统,他们创建了一个使用GPU进行机器学习的开发者生态系统;通过Mellanox,他们成为了数据中心网络的领导者。然后,他们将所有硬件集成到服务器中,提供垂直集成的算力一体机。凭借这一系列组合性技术优势,英伟达在“AI淘金热”中提供的铲子占据行业核心地位,这导致它成为有史以来最成功的公司之一。随之而来的是,不少挑战者入局以求从英伟达主导的市...

OneFlow深度学习框架 1万+

比GPU快20倍?d-Matrix推理性价比分析

AI推理算力需求正在大幅增长。一方面,像硅基流动、Fireworks这样的AI基础设施软件公司通过软件层面的优化以提供高性价比的大模型推理服务,另一方面,以Cerebras、Groq为代表的芯片公司相继推出了专用AI推理芯片,通过硬件层面的创新,以数量级的推理速度与成本优势来挑战英伟达GPU的市场地位。AI推理芯片市场的竞争者还在增加。近日,成立于2019年的硅谷推理芯片创业公司d-Matrix的...

OneFlow深度学习框架 2005

生成式AI推理技术、市场与未来

OpenAI o1、QwQ-32B-Preview、DeepSeek R1-Lite-Preview的相继发布,预示着生成式AI研究正从预训练转向推理(Inference),以提升AI逻辑推理(reasoning)能力,这一转变将极大推动上层应用的发展。红杉资本近期指出,在可预见的未来,逻辑推理和推理时计算将是一个重要主题,并开启生成式AI的下一阶段。新一轮竞赛已然开始。那么,在推理这一新兴市场,...

OneFlow深度学习框架 2072

50张图,直观理解混合专家(MoE)大模型

Mixtral 8x7B的高效训练与推理效果曾引发AI社区对混合专家(MoE)模型的广泛关注,后来居上的国产开源大模型De‍epSeek以及腾讯近期开源的Hunyuan-Large(基于Transformer的最大MoE模型)也选择了MoE框架路线。为何大语言模型总是离不开MoE的身影?借助50多个图例,数据科学家Maarten Grootendorst由浅入深多维度剖析了MoE模型,从基础概念出...

OneFlow深度学习框架 9351

LLM后训练绝招:1%预训练成本,实现最高20倍算力扩展效果

根据规模定律,扩大训练计算规模可以提高大型语言模型(LLM)性能的关键,但调研机构Epoch AI的研究,LLM再训练无需高额费用,也能让AI能力获得显著提升。在该研究中,他们引入了一个基本框架,用于量化后训练增强的收益和成本,特别是通过计算等效增益来衡量收益。他们将该框架应用于一系列具有代表性的后训练增强,并发现性能提升非常显著,但微调成本通常与预训练成本相比非常小,某些后训练增强技术可以在不到...

OneFlow深度学习框架 4602

LLM逻辑推演策略选择:推理时计算 vs 训练时计算

AGI实现的一大标志是,具备人类级别的逻辑推理(reasoning)能力。近期,随着推理(inference)模型GPT o1、DeepSeek R1-Lite的发布,模型的逻辑推理能力得到显著提升,也预示着对LLM潜力的深度挖掘正在转向推理阶段。围绕增强LLM逻辑推理能力这一目标,美国人工智能与密码学研究实验室Bagel团队结合最新研究,从算术、常识和符号这三种主要逻辑推理类型出发,对比了在推理...

OneFlow深度学习框架 4168

探索AI框架前沿|OneFlow招聘深度学习研发工程师(实习)

一、岗位名称:深度学习研发工程师-框架开发方向(实习)岗位职责1. 参与 OneFlow 框架开发、重构与性能优化;2. 参与深度学习编译、高阶自动微分等深度学习框架相关技术演进工作。岗位要求1. 计算机或电子通信相关专业,本科及以上学历;2. 具备C/C++、Python编程基础,有良好的软件开发素养,熟悉TDD、CI/CD、敏捷开发流程等;3. 了解深度学习模型,有一定机器学习基础;4. 熟悉...

OneFlow深度学习框架 553
上一篇: TorchDynamo初探②:Torch.FX调研和实践
下一篇: 英伟达的AI霸主地位会持久吗?
OneFlow深度学习框架
OneFlow深度学习框架 企业官方账号 企业官方账号
博客等级 码龄6年 5863粉丝 385原创
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值