AI半导体技术、市场与未来

0adce903ec321617a1e752ee1d67a11f.png

过去两年,英伟达崛起是科技领域的一个经典案例。通过CUDA系统,他们创建了一个使用GPU进行机器学习的开发者生态系统;通过Mellanox,他们成为了数据中心网络的领导者。然后,他们将所有硬件集成到服务器中,提供垂直集成的算力一体机。

凭借这一系列组合性技术优势,英伟达在“AI淘金热”中提供的铲子占据行业核心地位,这导致它成为有史以来最成功的公司之一。随之而来的是,不少挑战者入局以求从英伟达主导的市场分一杯羹。半导体行业的竞争愈加热烈。

在此背景下,AI半导体研究专家Austin Lyons与Eric Flaningam从AI与GPU行业的背景知识切入,结合当前AI半导体生态系统,通过行业关键数据,对未来发展趋势进行了深入分析。

(本文由OneFlow编译发布,转载请联系授权。原文:https://www.generativevalue.com/p/the-ai-semiconductor-landscape)

来源 | Eric Flaningam、Austin Lyons

翻译|张雪聃、林心宇

OneFlow编译

题图由SiliconCloud平台生成

1

AI加速器的背景知识

从一个非常宏观的角度看,所有逻辑半导体都包含以下组成部分:

1. 计算核心——执行实际的计算操作。

2. 存储器——存储要传递给计算核心的数据。 

3. 缓存——临时存储可快速检索的数据。

4. 控制单元——控制并管理其他组件的操作顺序。

传统情况下,CPU是一种通用计算机,设计用于执行任何计算任务,包括复杂的多步流程。如下图所示,CPU具有更多的缓存、更强大的控制单元以及更小的计算核心(即CPU中的算术逻辑单元,ALU)。

fa75ae40cda07669b24796dfe1d94b38.png

另一方面,GPU专为处理大量小型计算任务或并行计算而设计。最初,GPU用于图形处理,需要同时进行大量的小型计算以生成显示内容。这种基础架构非常适合AI的工作负载。英伟达率先通过早期的GPU引入可编程着色器,并推出CUDA,使所有GPU都能成为可编程计算机。

为何GPU如此适合AI?

大多数AI模型的基本单元是神经网络,其结构由多层节点组成。这些节点通过加权处理,尽可能准确地表示训练数据的特性。

当模型完成训练后,可以输入新的数据,模型则会预测输出结果(即推理)。

这种“数据传递”涉及大量的小型计算,主要以矩阵乘法的形式实现:(某一层的节点与权重)×(另一层的节点与权重)。

矩阵乘法是GPU的强项,因其具备出色的并行处理能力。

53ffab4623ec1f02a3bb9251a5213351.jpeg

(Stephen Wolfram撰写了一篇详细解析ChatGPT工作原理的文章:https://writings.stephenwolfram.com/2023/02/what-is-chatgpt-doing-and-why-does-it-work/)

当今的GPU

GPU的规模不断扩大,计算能力和内存也在持续增强,并且更加专注于适配矩阵乘法等工作负载。

以英伟达的H100为例。它由CUDA和Tensor核心(基本处理器)、处理集群(由多个核心组成)以及高带宽内存组成。H100的设计目标是以尽可能高的数据流量处理尽可能多的计算。

71dd223c116502541895cde1866f9711.jpeg

提升性能的目标不仅限于芯片本身,而是聚焦于整个系统的优化。在芯片之外,通过连接GPU构建计算集群(https://www.nvidia.com/en-us/data-center/dgx-superpod/),将服务器设计为一体化的计算设备(https://www.nvidia.com/en-gb/data-center/dgx-h100/),甚至从系统层面优化数据中心的设计(https://www.fabricatedknowledge.com/p/the-data-center-is-the-new-compute)。
 

1

训练与推理的背景知识

要理解AI半导体的格局,需要先回顾一下AI架构的基础知识。

训练指的是通过大规模数据集进行迭代,创建能够表示复杂场景的模型;而推理则是向该模型提供新的数据以生成预测。

f3964799113fd269107fcf1c47bd0182.jpeg

以下是推理的几个关键特性:

1. 时延和位置至关重要——推理为终端用户运行工作负载,因此响应速度至关重要。这使得在边缘设备或边缘云环境中进行推理更具优势,而训练则可以在任何位置完成。

2. 可靠性稍显次要——训练最前沿的模型可能需要数月时间,并需要庞大的训练集群。由于集群内部高度依赖,一个环节出错可能拖慢整个训练进程。而推理的工作负载更小且相互独立,即使发生错误,仅会影响单个请求,并能快速重新运行。

3. 硬件扩展性的重要性较低——英伟达的核心优势之一是其通过软件和网络实现大规模系统扩展的能力。然而在推理中,这种扩展性的重要性较低。

以上原因解释了为什么许多新兴半导体公司将重心放在推理上。与训练相比,推理的进入门槛更低。

英伟达的网络和软件能够支持其构建更大、更高性能和更可靠的训练集群。英伟达在AI训练方面的竞争壁垒非常牢固,其他竞争者难以企及。

接下来,我们来谈谈竞争格局。

3

AI半导体行业概览

AI半导体行业可以大致分为三个主要领域:

  1. 数据中心训练芯片

  2. 数据中心推理芯片

  3. 边缘推理芯片

下图是相关公司展示:

cafbd2b843418757819e4df5190e033e.png

(AI半导体价值链的思维模型图;该图并未展示所有公司和细分领域)

数据中心半导体市场

简单来说,英伟达主导了数据中心半导体市场,而AMD是唯一具有竞争力的通用替代方案。超大规模云公司(Hyperscalers)倾向于开发自研芯片,而大部分初创公司专注于推理或特定架构的专用硬件。

预计英伟达将在2024年销售超过1000亿美元的AI系统,而AMD紧随其后,预计实现50亿美元的收入。

以下是截至2023年底,数据中心处理器市场份额的分布:

d550ff283d396d39793b3ebe1ba55512.jpeg

(数据来源:https://www.crn.com/news/components-peripherals/2024/google-was-third-biggest-data-center-processor-supplier-last-year-research)

在超大规模云公司中,Google提供了最先进的加速器,其TPU备受关注。据TechInsights估计,Google去年出货了200万个TPU,仅次于英伟达的AI加速器。

亚马逊则开发了自研神经网络芯片(Nitro)、CPU(Graviton)、推理芯片(Inferentia)和训练芯片(Trainium)。TechInsights估计,亚马逊在2023年向客户“出租”了230万个此类芯片。

微软最近推出了CPU(Cobalt)和GPU(Maia),但由于产品较新,目前尚无法评估其市场表现。

最后值得一提的是,英特尔原本预计今年销售约5亿美元的Gaudi 3芯片,但在最近的财报中表示这一目标无法实现。

尽管英伟达凭借其软件和网络功能在训练领域占据主导地位,但推理领域由于架构差异,竞争格局更加多样化。

推理领域:更具吸引力的市场!

RunPod最近对Nvidia H100和AMD MI300X进行了有趣的对比研究,结果表明,MI300X在超大批处理和极小批处理的推理任务中更具成本优势。

e789403f7761f24d403432d0b312efdf.png

(数据来源:https://blog.runpod.io/amd-mi300x-vs-nvidia-h100-sxm-performance-comparison-on-mixtral-8x7b-inference/)

同时,许多硬件初创公司筹集了大量资金,试图抢占这一市场的一席之地:

6afc719c09ca3040f35e886f3f9db21d.jpeg

(数据来源:https://www.chipstrat.com/p/etched-silicon-valleys-speedrun)

一个有趣的趋势是,这些初创公司正向软件领域扩展。例如,GroqCerebras和SambaNova三家领先的初创公司都在提供推理软件服务。理论上,这种垂直整合能够为终端用户提供成本和性能上的双重优势。

AI半导体市场的最后一块拼图是边缘AI,这也是业内广泛关注的热点话题。

4
边缘AI?

训练最庞大且功能最强的AI模型需要高昂的成本,甚至可能需要整个数据中心的GPU资源支持。然而,模型训练完成后,可以运行在性能相对较低的硬件上。实际上,AI模型甚至可以在智能手机或笔记本电脑等“边缘”设备上运行。边缘设备通常由SoC(系统级芯片)提供支持,这种芯片包含CPU、GPU、内存,通常还集成了NPU(神经网络处理单元)。

db71451b5af5eba87dd9219e32c98c41.jpeg

例如,一个运行在智能手机上的AI模型必须足够小,以适应手机内存的限制。因此,与大型云端模型相比,边缘模型通常更小、更简单。然而,模型在本地运行能够安全地访问用户特定数据(如位置、短信),而无需将数据传输到云端。

尽管AI模型可以技术上运行在手机的CPU上,但矩阵乘法更适合由GPU这样支持并行处理的硬件来完成。由于CPU优化用于顺序处理,在推理任务中可能表现较慢,即使是处理小型模型也是如此。作为一种替代方案,AI模型可以运行在手机的GPU上。

然而,智能手机的GPU主要为图形处理而设计。在玩游戏时,用户期望GPU能全力支持平滑的画面效果。如果同时分配GPU资源给AI模型,可能会显著影响游戏体验。

因此,NPU成为边缘设备AI推理的理想选择。智能手机可以利用NPU来运行AI任务,而不会增加GPU或CPU的负担。由于电池寿命对边缘设备至关重要,NPU经过优化以降低功耗。与GPU相比,NPU在执行AI任务时的功耗可能低至其1/5到1/10,大大延长了设备的电池续航时间。

边缘推理不仅应用于消费类设备,还广泛用于工业和汽车领域。例如,自动驾驶汽车依靠边缘推理实时处理传感器数据,从而做出快速决策以确保行车安全。而在工业物联网中,传感器和摄像头数据的本地推理可以支持主动维护等措施。

工业和汽车领域的设备通常具备比消费类设备更高的功率支持,因此可以部署高性能计算平台。例如,Nvidia的Orin平台就内置了与数据中心GPU类似的功能(详见https://www.nvidia.com/en-us/edge-computing/products/igx/)。需要远程硬件可编程性的场景,则可以使用例如Altera的FPGA(详见:https://www.intel.com/content/www/us/en/content-details/765466/altera-fpgas-and-socs-with-fpga-ai-suite-and-openvino-toolkit-drive-embedded-edge-ai-machine-learning-applications-white-paper.html)。

5

对市场的一些思考

最后,我想分享几个我认为在AI半导体领域中最有趣的问题:

1. 英伟达的优势壁垒有多深厚?

多年来,英伟达在数据中心GPU市场上维持了90%以上的市场份额。作为一家极具前瞻性的公司,其在过去二十年内做出了正确的技术和战略决策。在这个领域中,经常有人问我有关英伟达的壁垒的问题。

对此,我有两个看似矛盾的观点:首先,我认为英伟达在不断扩展自己的优势,从AI软件、基础设施到模型和云服务都在积极布局。他们还在投资网络和垂直整合。这家公司持续高效执行其战略,令人惊叹。

其次,在收入上,每家公司都想与英伟达分一杯羹。如今,全球企业正投入数千亿美元争相开发通用人工智能(AGI)。英伟达最大的客户们正在斥资数十亿美元减少对其依赖,同时投资者也向竞争对手注入巨额资金,希望能瓜分英伟达的市场份额。

总结来说:英伟达是目前全球AI领域最有优势的公司,同时也面临来自竞争者、客户和投资者的数百亿美元投入的挑战。

2. 初创公司的机会在哪里?

半导体初创公司面临着极其艰难的挑战,要建立可持续的商业模式难度很大。而当竞争对手是英伟达时,这种挑战更显艰巨。不过,市场总是在通用性与专业性之间进行权衡。如果公司能够有效地专注于足够大的细分市场,就有机会成长为一家规模庞大的企业。这包括专为推理设计的硬件和特定模型优化的硬件。

我尤其对能够加速专用芯片开发的方案感兴趣。这类方法能够降低芯片开发的门槛,同时利用专业化带来性能优势。

然而,半导体行业极其复杂,这类产品需要经过时间和多代技术的积累才能成熟。这些公司需要持续的资金支持,才能完成多个产品代际的研发。

3. 边缘AI会成为现实吗?

从历史来看,技术的颠覆往往发生在一种新产品以更低价格提供了较少的功能时,而现有企业难以与之竞争。例如,大型主机让位于小型计算机,小型计算机又被PC取代,PC之后是智能手机。

这些颠覆的关键变量在于性能的“过剩供应”。顶级解决方案常常解决了大多数人非必需的问题。许多计算领域的颠覆来自于计算能力的去中心化,因为消费者并不需要额外的性能。

在AI领域,我认为这种“性能过剩”还没有出现。ChatGPT很强大,但还称不上完美。一旦它变得足够优秀,边缘AI的时代才会到来。小型语言模型和NPU将推动这一时代的到来。届时,问题将不再是“AI是否会进入边缘设备”,而是“什么时候进入”。

其他人都在看


让超级产品开发者实现“Token自由”
 

邀好友用SiliconCloud狂送2000万Token/人

即刻体验QwQ-32B-Preview
siliconflow.cn/zh-cn/siliconcloud

相关推荐

<span class=“js_title_inner“>OpenAI 前首席研究官:AGI 核心突破已实现</span>

归根结底,与人合作时要理解他们的诉求,既要让他们实现创作目标,又要协调所有人的贡献形成整体成果,并持续反复地解决这个问题。但如果他们知道你是在为他们争取最大利益,那么当你要求他们去做那件极其困难且令他们恐惧的事情时,有时你就能帮助他们跨越鸿沟,解决问题,避免他们做出愚蠢的举动,最终获得圆满的结果。,包括在实现方式上的品味,其中可能存在不明显的后果——也许是性能上的隐性影响,也许是用户界面演变过程中难以预见的连锁反应,进而需要改变系统更深层的抽象结构——这些只能依靠人类来完成,目前别无选择。

OneFlow深度学习框架 721

<span class=“js_title_inner“>OpenAI 前首席研究官:AGI 核心突破已实现</span>

归根结底,与人合作时要理解他们的诉求,既要让他们实现创作目标,又要协调所有人的贡献形成整体成果,并持续反复地解决这个问题。但如果他们知道你是在为他们争取最大利益,那么当你要求他们去做那件极其困难且令他们恐惧的事情时,有时你就能帮助他们跨越鸿沟,解决问题,避免他们做出愚蠢的举动,最终获得圆满的结果。,包括在实现方式上的品味,其中可能存在不明显的后果——也许是性能上的隐性影响,也许是用户界面演变过程中难以预见的连锁反应,进而需要改变系统更深层的抽象结构——这些只能依靠人类来完成,目前别无选择。

OneFlow深度学习框架 409

<span class=“js_title_inner“>LLM 推理经济学</span>

作者 | Piotr Mazurek & Felix GabrielOneFlow 编译翻译|张雪聃题图由 SiliconCloud 生成当前 LLM 公司的主要商业模式是通过 API 提供模型访问服务,推理成本结构是决定其盈利能力的关键。本文将从底层原理阐释大模型托管/服务的成本来源、单个 GPU 可生成的词元(Token)数量及其成因,本文以开源模型 LLaMA 3.3 为基础,搭建一个简化版的大模型推理运算世界模型,旨在建立关于 LLM 推理的精确直觉认知。大模型推理的经济学影响远超过技术范畴本身。随

OneFlow深度学习框架 632

Databricks“三级跳”:600 亿美元独角兽的战略跃迁

本文以 S 曲线理论为分析框架,深度解构 Databricks 的三次关键战略跃迁,还原了其技术商业化路径中的关键决策——如拒绝本地化部署的短期利益、与微软 Azure 的生态合作以及从开源社区到企业级服务的平衡艺术。Databricks 作为数据与 AI 领域的代表性企业,从开源项目 Spark 起步,逐步发展为估值超 600 亿美元的行业巨头,其成长历程不仅折射出大数据技术的演进史,更揭示了科技公司如何通过连续的战略跃迁实现指数级增长。当时的背景是:互联网的迅速发展催生了海量数据,尤其是非结构化数据。

OneFlow深度学习框架 1203

AI 云服务之争:CoreWeave 向上,Nebius 向下

平台中的大多数工具均为自主研发,包括支持大规模调度的托管 Kubernetes、基于 Slurm 的集群调度系统、用于实验管理的 MLflow、自研的可观测性工具,以及一个具备安全保障的云端基础设施控制平台。它跳过了这一环节,设计了自己的服务器机架,以建立一个更加垂直整合的系统,从数据中心架构到托管式 Kubernetes 服务,再到像 Nebius AI Studio 这样的应用层工具(该工具为 DeepSeek、Llama 和 Flux 这样的开源模型提供推理 API)。的策略更全面和“全栈”。

OneFlow深度学习框架 2075

<span class=“js_title_inner“>AI 云服务之争:CoreWeave 向上,Nebius 向下</span>

平台中的大多数工具均为自主研发,包括支持大规模调度的托管 Kubernetes、基于 Slurm 的集群调度系统、用于实验管理的 MLflow、自研的可观测性工具,以及一个具备安全保障的云端基础设施控制平台。它跳过了这一环节,设计了自己的服务器机架,以建立一个更加垂直整合的系统,从数据中心架构到托管式 Kubernetes 服务,再到像 Nebius AI Studio 这样的应用层工具(该工具为 DeepSeek、Llama 和 Flux 这样的开源模型提供推理 API)。的策略更全面和“全栈”。

OneFlow深度学习框架 142

关于 DeepSeek-R1 API 评测,至少有 7 个误区

xx 58.33%。以某评测者的“人类头发数量的乘积是多少?市面上基本不存在“非满血版 R1”,也基本不存在所谓模型“降智”,而 R1 蒸馏版(70B、1.5B等)与满血版的效果差距很明显,一般知名服务商都会注明,如果这些平台提供所谓“非满血版 R1”,很容易测试出来,这完全是自砸招牌,他们没有动机“以次充好”。可以确定的是,市面上知名的第三方平台部署的都是“满血版 R1(671B)”,之所以用户使用感受有差异,是因为模型输出的随机性、平台提供的配套功能及超参数设置等可能不一致,而非底层模型本身的差异。

OneFlow深度学习框架 1125

<span class=“js_title_inner“>关于 DeepSeek-R1 API 评测,至少有 7 个误区</span>

xx 58.33%。以某评测者的“人类头发数量的乘积是多少?市面上基本不存在“非满血版 R1”,也基本不存在所谓模型“降智”,而 R1 蒸馏版(70B、1.5B等)与满血版的效果差距很明显,一般知名服务商都会注明,如果这些平台提供所谓“非满血版 R1”,很容易测试出来,这完全是自砸招牌,他们没有动机“以次充好”。可以确定的是,市面上知名的第三方平台部署的都是“满血版 R1(671B)”,之所以用户使用感受有差异,是因为模型输出的随机性、平台提供的配套功能及超参数设置等可能不一致,而非底层模型本身的差异。

OneFlow深度学习框架 125

首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务

DeepSeek-R1、DeepSeek-V3 开源后引发全球震动,它们是深度求索团队为全人类献上的一份大礼,我们由衷为他们取得的成功感到高兴。经过硅基流动和华为云团队连日攻坚,今天,我们也为国内用户献上春节礼物:大模型云服务平台 SiliconCloud 首发上线基于华为云昇腾云服务的 DeepSeek-V3、DeepSeek-R1。 需要特别强调的是,无论是在昇腾上适配 DeepSeek-R...

OneFlow深度学习框架 4216

<span class=“js_title_inner“>首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务</span>

5. 与 DeepSeek 官方优惠期价格保持一致,SiliconCloud 上的 DeepSeek-V3 的优惠期价格(截止 2 月 8 日 24:00)为 ¥1 / M tokens(输入)& ¥2 / M tokens (输出),DeepSeek-R1 的价格为 ¥4 / M tokens(输入)& ¥16 / M tokens (输出)。华为云昇腾云服务可提供澎湃、弹性、充足的算力。双模型,还是在此前上线其他模型的过程中,我们都得到了 DeepSeek 与华为云的大力支持,向他们致以深深的谢意与。

OneFlow深度学习框架 118

站在 AI 十字路口:直面智能体与机器人狂潮

生成式 AI 正在迅速介入人类世界。随着 AI 大模型不断进步,我们正面临着巨大的社会变革。本文探讨了一个由高度智能的智能体和机器人主导的世界——AI 亚特兰蒂斯世界(指在数字领域拥有几乎无限的 AI 资源)。本文分析了当前的 AI 模型为何从根本上不同于以往的技术范式,它们如何重塑各行业,以及人类面临的关键选择。作者认为,每个人都必须理解 AI 的进步将如何重塑经济、创造力和人类潜力的规则。除...

OneFlow深度学习框架 591

<span class=“js_title_inner“>站在 AI 十字路口:直面智能体与机器人狂潮</span>

拥有 AI 的政府能够提供更好的服务,制定数据驱动的政策,增强国家安全,并为民众提供更高的透明度和问责制。这里有一个令人难以置信的想法:你现在可以雇佣智能体员工和机器人工作者,他们的薪水甚至低于你花在咖啡上的费用——然而他们却拥有与普通大学毕业生相同的技能。拥有更多的闲暇时间当然不错,但真正的关键是,AI 为你腾出了精神空间,让你能专注于更大的挑战。像 ComfyUI 这样的工具是这一转变的早期例子——人们现在可以创建复杂的 AI 工作流,其中信息和任务从一个阶段无缝流向另一个阶段。这些模型是通用翻译器。

OneFlow深度学习框架 81

迈向 AI 驱动型经济:当资本不需要打工人

AI 的迅猛发展与普及,引发了学术界与工业界对现在的社会结构与经济模型的根本性反思。此前 OneFlow 发布的《资本、AGI 与人类雄心》、《AGI 时代的智能诅咒》、《AGI 崛起之后:重构经济模式与社会结构》三篇文章,深入探讨了劳动力替代性 AI 改变人力与非人力生产要素的相对重要性后,给整个社会带来的好处与风险,以及应对挑战的解决方案。在本文中,借助一众经济学家和科幻作家的理论观点,Int...

OneFlow深度学习框架 1014

<span class=“js_title_inner“>迈向 AI 驱动型经济:当资本不需要打工人</span>

相对而言,伊恩·M·班克斯(https://en.wikipedia.org/wiki/Iain_Banks)的《文明》系列丛书则描绘了一个后匮乏的社会,在这个社会中,拥有感知能力的 “AI 智能体(AI Minds)” 管理着星舰和栖息地,根据需求分配资源,而非货币。例如,《星际迷航》中,技术(如复制器和先进的星舰 AI )消除了物质匮乏,推动了一个专注于探索和文化发展的社会。而 AI 的引入,使非人类智能体成为生产力的主要推动者,将剩余价值的核心转移到了算法、数据集和计算系统的所有权上。

OneFlow深度学习框架 92

AGI 崛起之后:重构经济模式与社会结构

AGI 日益临近,这也迫使我们重新审视现有的社会结构和经济模式。在《资本、AGI 与人类雄心》一文中,Rudolf 指出,AGI 到来之后,劳动力替代性 AI 将改变人力与非人力生产要素的相对重要性,这会降低社会对人类的关注度,同时使现有的权力更加有效和根深蒂固。基于资源诅咒现象,Luke Drago 在《AGI 时代的智能诅咒》一文中将 Rudolf 的上述核心观点描述为智能诅咒。他认为,智能诅...

OneFlow深度学习框架 1297

AGI 时代的智能诅咒

经济学研究指出,依赖出售石油等自然资源获得收入而非公民税收的国家,会受到资源诅咒的影响,结果是权贵们攫取了大量财富,却停止了对普通人的投资。当 AGI 实现后,人类是否会面临类似的“智能诅咒”?在此前发布的《资本、AGI 与人类雄心》一文中,Rudolf 指出,AGI 到来之后,劳动力替代性 AI 将改变人力与非人力生产要素的相对重要性,这会降低社会对人类的关注度,同时使现有的权力更加有效和根深蒂...

OneFlow深度学习框架 752

资本、AGI 与人类雄心

通用人工智能(AGI)正在不可阻挡地走向人类社会,有人期待它带来的巨大生产力突破,有人也在警告它可能成为洪水猛兽,也有人对它的发展只是持观望态度。不管怎样,基于你所了解的信息,你可以尝试描绘一幅 AGI 图景,并畅想它在人类政治、经济、社会发展会产生的影响。在本文中,作者 Rudolf 深入剖析了 AGI 到来之后的资本、人类劳动与社会权力结构之间的复杂关系。其核心观点是,劳动力替代性 AI 将改...

OneFlow深度学习框架 870

2025 年 AI 十大展望:软件市场扩大 10 倍、系统比模型更重要、OpenAI 先发优势消退...

尽管有 Scaling Law 放缓这样的疑虑,但整体而言,多数业内人士对AI过去一年的诸多进展感到兴奋,对新的一年 AI 的发展更是充满期待,尽管他们对未来的预测可能不尽相同。在本文中,Foundation Capital 合伙人Ashu Grag回顾了 2024 年 AI 发展的里程碑事件,并重点介绍了 2025 年的前景,主要包括:1.预训练局限将推动新的 AI 突破2.AI系...

OneFlow深度学习框架 1577

900页免费“生成式AI与大模型”电子书|OneFlow年货

难以想象,如果不是Scaling Law放缓,2024年AI领域会发生哪些惊人变化,但你可能又会感到庆幸,正是由于Scaling Law放缓,它给了这个行业的后来者们追赶的机会,也给了更多普通人搭乘这一轮技术革命的机会。AI领域的变化激荡人心。一年前,AI社区普遍认为,与OpenAI的模型相比,大部分模型与它有半年或一年的差距,但大模型预训练逐渐没有秘密,它的入局门槛数量级降低。令国内外科技界深感...

OneFlow深度学习框架 642

2024年AI盘点:投资高歌猛进、基础设施重构、技术采用加速

本文全面分析了今年AI 的发展,包含AI 技术栈的基础设施层、基础模型层、应用层、工具层,尤其是各个层面的主要收获、值得关注的趋势与值得关注的初创公司。此外,本文还概括了 AI 领域的投资和并购情况,以及其他AI 趋势。需要指出的是,可能限于作者KelvinMu的关注重心,本文除了对中国基础模型的介绍,没有更多关于中国 AI 其他技术栈的进展。不过,这并不妨碍本文仍是我们了解 2024...

OneFlow深度学习框架 1994

从零实现极速LLM推理

作者 | Andrew Chen翻译|张雪聃、刘乾裕OneFlow编译题图由SiliconCloud平台生成本文旨在从零开始,仅使用C++和CUDA构建一个大语言模型(LLM)推理引擎,且不借助其他外部库。为何要这样做?通过这种方式,我们能够全面了解LLM推理的整个技术栈——这一点正变得日益重要[1]——从CUDA kernel到模型架构,并且切实体会不同的优化方式如何影响推理速度。其中一个最为重...

OneFlow深度学习框架 1180

AI数据中心历史、技术与关键企业

过去一年,通过模型架构创新、更优质训练数据和更大算力规模来训练模型,顶尖大模型之间的性能差距急剧缩小。如果Scaling law依然有效,为了进一步扩展模型规模与性能,在模型架构创新存在极大不确定性情况下,通过获得更多的算力来建造全新的数据中心,从而更快地训练模型以取得领先地位,这是确定性更高的收益。目前,以马斯克xAI为代表的大模型公司,快速部署了10万台GPU集群,成为数据中心扩展的领头羊,可...

OneFlow深度学习框架 949

红杉资本2025年AI三大展望:大模型厂商各显神通;杀手级应用AI搜索;AI支出变稳...

2024年,随着Scaling law放缓,AI领域在大模型、基础设施上的能力稳步提升,尽管应用层出现了各种有趣的探索,但是更大的潜能有待挖掘。2025年即将来临,将出现哪些变化?近日,红杉资本投资人David Cahn对2024年AI领域的发展作了简要总结并对2025年作了三大预测。他认为,今年是AI发展的萌芽期,其构建基石已经稳固建立,只待2025年发芽结果。他在本文中阐述了三点预言:首次,基...

OneFlow深度学习框架 1662

比GPU快20倍?d-Matrix推理性价比分析

AI推理算力需求正在大幅增长。一方面,像硅基流动、Fireworks这样的AI基础设施软件公司通过软件层面的优化以提供高性价比的大模型推理服务,另一方面,以Cerebras、Groq为代表的芯片公司相继推出了专用AI推理芯片,通过硬件层面的创新,以数量级的推理速度与成本优势来挑战英伟达GPU的市场地位。AI推理芯片市场的竞争者还在增加。近日,成立于2019年的硅谷推理芯片创业公司d-Matrix的...

OneFlow深度学习框架 2005

生成式AI推理技术、市场与未来

OpenAI o1、QwQ-32B-Preview、DeepSeek R1-Lite-Preview的相继发布,预示着生成式AI研究正从预训练转向推理(Inference),以提升AI逻辑推理(reasoning)能力,这一转变将极大推动上层应用的发展。红杉资本近期指出,在可预见的未来,逻辑推理和推理时计算将是一个重要主题,并开启生成式AI的下一阶段。新一轮竞赛已然开始。那么,在推理这一新兴市场,...

OneFlow深度学习框架 2072

50张图,直观理解混合专家(MoE)大模型

Mixtral 8x7B的高效训练与推理效果曾引发AI社区对混合专家(MoE)模型的广泛关注,后来居上的国产开源大模型De‍epSeek以及腾讯近期开源的Hunyuan-Large(基于Transformer的最大MoE模型)也选择了MoE框架路线。为何大语言模型总是离不开MoE的身影?借助50多个图例,数据科学家Maarten Grootendorst由浅入深多维度剖析了MoE模型,从基础概念出...

OneFlow深度学习框架 9363

LLM后训练绝招:1%预训练成本,实现最高20倍算力扩展效果

根据规模定律,扩大训练计算规模可以提高大型语言模型(LLM)性能的关键,但调研机构Epoch AI的研究,LLM再训练无需高额费用,也能让AI能力获得显著提升。在该研究中,他们引入了一个基本框架,用于量化后训练增强的收益和成本,特别是通过计算等效增益来衡量收益。他们将该框架应用于一系列具有代表性的后训练增强,并发现性能提升非常显著,但微调成本通常与预训练成本相比非常小,某些后训练增强技术可以在不到...

OneFlow深度学习框架 4602

LLM逻辑推演策略选择:推理时计算 vs 训练时计算

AGI实现的一大标志是,具备人类级别的逻辑推理(reasoning)能力。近期,随着推理(inference)模型GPT o1、DeepSeek R1-Lite的发布,模型的逻辑推理能力得到显著提升,也预示着对LLM潜力的深度挖掘正在转向推理阶段。围绕增强LLM逻辑推理能力这一目标,美国人工智能与密码学研究实验室Bagel团队结合最新研究,从算术、常识和符号这三种主要逻辑推理类型出发,对比了在推理...

OneFlow深度学习框架 4168

探索AI框架前沿|OneFlow招聘深度学习研发工程师(实习)

一、岗位名称:深度学习研发工程师-框架开发方向(实习)岗位职责1. 参与 OneFlow 框架开发、重构与性能优化;2. 参与深度学习编译、高阶自动微分等深度学习框架相关技术演进工作。岗位要求1. 计算机或电子通信相关专业,本科及以上学历;2. 具备C/C++、Python编程基础,有良好的软件开发素养,熟悉TDD、CI/CD、敏捷开发流程等;3. 了解深度学习模型,有一定机器学习基础;4. 熟悉...

OneFlow深度学习框架 553

企业生成式AI最新调查:AI支出激增6倍,多模型部署盛行

企业AI格局正在迅速重塑。随着实验项目逐步落地投入生产,海外风险投资机构‍Menlo Ventures最新发布的《2024年企业生成式AI现状》报告对600名企业IT决策者展开了调研,深入分析了这场变革中正在浮现的新赢家与失利者。(本文由OneFlow编译发布,转载请联系授权。原文:https://menlovc.com/2024-the-state-of-generative-ai-in-the...

OneFlow深度学习框架 5739
上一篇: 比GPU快20倍?d-Matrix推理性价比分析
下一篇: 红杉资本2025年AI三大展望:大模型厂商各显神通;杀手级应用AI搜索;AI支出变稳...
OneFlow深度学习框架
OneFlow深度学习框架 企业官方账号 企业官方账号
博客等级 码龄6年 5863粉丝 385原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值