(万字长文)图解大模型的推理,理解大模型推理过程,理解什么是测试时计算扩展test-time compute

原文:https://zhuanlan.zhihu.com/p/23556533098

目录

本文在以下两篇博客基础上,结合了自己的一些经验,希望尽可能用通俗简单的语言帮助你理解 推理型大模型,以及最近流行的 测试时计算扩展等核心概念,两篇博客分别为:全英文的a-visual-guide-to-reasoning-llms,作者Maarten Grootendorst,原文地址为  https://newsletter.maartengrootendorst.com/p/a-visual-guide-to-reasoning-llms?utm_campaign=post&utm_medium=web,另一篇为这篇英文的中文翻译:图解推理型 LLMs,出自 Afunby Afunby的 AI Lab。

总的来说,大模型可以分为常规大模型和推理型大模型,我们大多数人口中的大模型一般都是指常规大模型,本文重点介绍推理型大模型,并尽可能将大模型的推理过程解释清楚,最后再来说说deepseek为什么能成功,用了哪些技术。

什么是推理型大模型

与常规 LLM 相比,推理型 LLM 在回答问题前,往往会先将问题拆解为更小的步骤(通常称为推理步骤或思考过程),也可以说是思维链COT。

普通大模型直接给出答案,没有给出求解过程。推理型大模型会将推理过程和答案一起输出。那么,“思考过程”、“推理步骤”或“思维链”(CoT, Chain-of-Thought)究竟意味着什么?

我在之前的复旦大学文章中也提到过过思维链,可以说某种程度上,思维链直接决定了大模型的推理规划能力:

​编辑细说复旦大学,斯坦福大学智能代理AI-Agent(二更)281 赞同 · 16 评论 文章

​编辑大模型中的思维链、思维树、思维图19 赞同 · 2 评论 文章

虽然我们可以探讨大模型是否真的能像人类那样思考,但这些步骤将整个过程拆解为更小,且结构化的推理。推理型大模型不仅学习“回答什么”,更学习“如何回答”。

为了理解推理型大模型的构建过程,我们首先需要探讨一个范式转变。

Train-time compute 到 Test-time compute

大模型从关注训练阶段的扩展(训练时计算)转向关注推理阶段(测试时计算),下面对两者分别进行介绍。

训练时计算:Train-time compute

在 2024 年上半年之前,为了提升大模型在预训练阶段的性能,开发者通常会增加以下几个方面的规模:

• 模型参数(parameters)

• 数据集(tokens )

• 计算量(FLOPs )

这三者合称为训练时计算(train-time compute),它体现了预训练数据作为“ AI 之燃料”的理念。基本上,预训练投入越大,最终得到的模型就会越出色。

训练时计算不仅包括训练期间所需的计算量,还涵盖了微调时所需的计算量。

长期以来,这些因素一直是提升 LLMs 性能的关键。研究人员通过各种 Scaling Law 探讨模型规模(包括计算量、数据集大小和模型参数数量)与模型性能之间的关系。这些定律属于所谓的“幂律”:某一变量(例如计算量)的增加会导致另一变量(例如性能)按比例发生变化。

通常,这些关系会在对数-对数坐标系下展示(呈现直线),以突出计算量的大幅增加。最为知名的规模定律包括“Kaplan 定律”和“Chinchilla 定律”。这些定律能大致说明,随着计算量、token 数量和参数数量的增加,模型性能也会相应提升。

(图片来自《Scaling laws for neural language models》)展示了模型性能如何随着不同计算指

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值