AI理论学习
文章平均质量分 91
大模型核心概念的拆解与理解。
庞轩px
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
第一篇:Embedding与向量语义——大模型是怎样“理解”文字的?
Embedding是将文字转化为数字向量的过程,使计算机能处理语义信息。其核心原理是通过分布假说,让语义相近的词在向量空间中距离更近。经典例子"国王-男人+女人≈女王"展示了向量运算能捕捉语义关系。余弦相似度比欧氏距离更适合衡量语义相似性,因为它关注向量方向而非长度。不同Embedding模型在维度和性能上各有优劣,如OpenAI的1536维模型表达力强,而M3E-base更适合中文场景。在RAG中,Embedding用于将文档转换为向量,通过最近邻搜索实现语义检索原创 2026-05-04 22:02:21 · 580 阅读 · 0 评论 -
第二篇:Transformer的核心思想——Attention机制直观理解
Transformer通过Attention机制解决RNN的长距离依赖问题。核心是Q/K/V向量:Q代表查询需求,K匹配相关信息,V提供实际内容。Self-Attention直接建模词间关系,Multi-Head机制从多角度分析语义。Encoder-Decoder结构整合这些组件,使模型能并行处理并理解全局上下文,成为现代语言模型的基础架构。原创 2026-05-04 22:18:01 · 412 阅读 · 0 评论 -
第三篇:大模型为什么会有“幻觉”——从训练方式到推理局限
大模型幻觉指模型生成看似合理但虚假的内容,源于训练目标(预测token而非验证事实)、生成机制(误差累积)及缺乏"未知"反馈。解决方法包括RAG技术(提供参考文档变"闭卷"为"开卷")和Prompt工程(设定知识边界、要求引用原文、调整温度参数)。完全消除不可能,但可控制到可接受范围。需将大模型视为"表达力强但记忆不可靠的助手",引导其基于参考而非记忆工作。原创 2026-05-04 22:25:27 · 441 阅读 · 0 评论 -
第四篇:Prompt Engineering——从随意提问到工程化调用
大模型Prompt Engineering的核心方法包括角色设定缩小语义空间、Few-shot示范输出模式和Chain of Thought分步推理。实验表明Prompt对模型输出有显著影响。输出格式约束可采用自然语言或结构化方式,各有优劣。课程问答项目的Prompt模板展示了实际应用。Prompt管理应从硬编码转向配置化,并建立量化评估体系,涵盖准确性、诚实性等维度。复杂任务应拆解为多步骤Prompt,每步专注单一目标以提升输出稳定性。这些方法将Prompt设计从经验转化为可复用的工程实践。原创 2026-05-04 22:30:55 · 478 阅读 · 0 评论 -
第五篇:RAG检索增强生成——让大模型学会“开卷作答”
RAG(检索增强生成)技术通过离线索引和在线生成两阶段优化大模型问答效果。离线阶段将文档切分(如500字块+100字重叠)并向量化存储;在线阶段混合向量检索与关键词检索,过滤低相关性内容后送入大模型生成回答。RAG解决了直接输入长文档导致的成本高、注意力分散和幻觉增多问题,尤其适合需要精准引用的场景(如课程问答)。其核心优势在于让模型仅处理相关片段而非全部文档,平衡了效果与成本。但需注意文档切分策略、检索算法选择和相关性过滤等关键环节的调优。原创 2026-05-05 09:41:21 · 496 阅读 · 0 评论 -
第六篇:大模型的“记忆”——从上下文窗口到会话管理
大模型在多轮对话中依赖外部记忆机制,核心限制来自上下文窗口。BufferMemory全量存储对话历史,适合短对话和技术问答;SummaryMemory通过摘要压缩历史,支持长闲聊但可能丢失细节。128K大窗口存在注意力稀释问题,上下文过长会引发成本激增、早期信息遗忘及注意力分散。需根据场景权衡记忆深度与效率:精确性要求高的场景选择BufferMemory,长对话优先考虑SummaryMemory。记忆管理本质是对有限上下文资源的优化分配。原创 2026-05-05 18:11:10 · 576 阅读 · 0 评论 -
第七篇:大模型API调用——从Token到流式输出
Token作为计费单位,反映计算量,中英文Token比例不同。Temperature控制输出随机性,Top-p限制候选词范围,建议先固定Top-p再调Temperature。流式输出提升响应感知速度,优于普通请求。SSE比WebSocket更轻量,适合单向AI回答场景。生产环境需注意Nginx代理配置和API密钥安全。原创 2026-05-06 16:54:49 · 477 阅读 · 0 评论 -
第八篇:LangChain不是“套壳”——它解决了什么实际问题
LangChain框架为复杂AI应用提供核心价值:1)通过流程编排抽象简化多步骤开发;2)Chain模块化固定流程;3)Agent支持动态决策;4)Tool扩展模型能力。对比直接调用API,其在复杂场景优势明显,但存在过度封装风险与Agent"迷路"问题。以课程问答为例,Chain适合固定检索生成流程,Agent更匹配开放式任务。需根据需求选择工具,LangChain对复杂开发具有独特价值但非万能。原创 2026-05-05 18:27:53 · 300 阅读 · 0 评论
分享