大模型学习指南
文章平均质量分 90
大模型学习实践指南
Cosolar
在大模型的世界里持续探索。记录学习路径,分享技术洞察,并与所有对AI充满热情的朋友交流。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
vLLM 生产级部署完全指南
vLLM 0.24.x 生产部署全指南 摘要:vLLM是由伯克利开发的高性能大语言模型推理引擎,其核心创新PagedAttention技术将显存碎片控制在4%以内,结合连续批处理技术可实现10-24倍于HuggingFace的吞吐量。v0.24版本引入了多项重要更新,包括设备选择变更、Transformers v5支持、Rust前端实验性功能以及安全加固等特性。本文档提供了从环境配置到生产部署的全流程指南,涵盖硬件要求(NVIDIA GPU≥V100)、安装方式、基础参数配置(网络、服务、性能优化等),以及原创 2026-07-02 19:54:40 · 504 阅读 · 0 评论 -
藏在 Claude Code 里的极致浪漫:完整 187 条 Spinner Verbs 全收录
Anthropic工程师在Claude Code命令行工具中埋藏了187种"正在思考"的加载提示词(如"Beboppin'"、"Flibbertigibbeting"),远多于仅8种完成提示词(如"Baked")。这一设计在2026年源码泄露后被曝光,展现了AI开发中罕见的创意与幽默。这些动词涵盖从科技术语到生活俚语,将枯燥的等待过程转化为充满想象力的文字游戏,体现了"创造过程比结果更丰富"的浪漫理念。原创 2026-06-21 10:57:15 · 784 阅读 · 0 评论 -
LlamaIndex 文档解析与分块策略深度解析
本文剖析了LlamaIndex在RAG系统中的文档解析与分块技术架构。文章首先指出分块策略是影响检索质量的关键因素,随后详细介绍了LlamaIndex的核心设计: 数据模型采用Document→Node转换管线,通过NodeRelationship维护节点间关系,支持层级分块等高级特性 文档加载通过SimpleDirectoryReader实现多格式文件批量读取,并自动过滤干扰性元数据 分块策略体系包含四大类: 文本分块(基于规则) 语义分块(基于相似度) 结构化分块(按文档格式) 层级分块(维护节点关系)原创 2026-06-08 21:19:51 · 334 阅读 · 0 评论 -
LlamaIndex索引类型全解析:原理与实战指南
本文深入解析了LlamaIndex的14种索引类型,重点介绍了最常用的VectorStoreIndex、SummaryIndex、TreeIndex和KeywordTableIndex四种索引。VectorStoreIndex基于向量相似度检索,适用于90%的RAG场景;SummaryIndex通过遍历所有内容实现简单汇总;TreeIndex采用分层摘要树结构,适合大规模文档;KeywordTableIndex利用关键词倒排映射实现高效检索。文章从构建原理、检索策略、内部组件、特点对比和适用场景等方面进行了原创 2026-06-08 17:14:12 · 512 阅读 · 0 评论 -
RAGFlow 从入门到精通:完整学习教程
RAGFlow是一款开源的企业级RAG(检索增强生成)引擎,通过结合检索和生成技术解决大语言模型的固有局限。其核心优势包括深度文档理解能力、智能分块模板、可追溯引用、可视化Agent工作流编排等。RAGFlow支持混合检索策略和广泛的模型兼容性,相比竞品在文档解析精度和易用性上更胜一筹。系统架构涵盖数据接入、文档解析、知识处理和应用层,提供从文档处理到智能问答的全链路解决方案,尤其适合需要高准确性、可追溯性的企业场景。原创 2026-06-05 09:50:38 · 798 阅读 · 0 评论 -
AutoGen:微软开源的多Agent对话框架详解
AutoGen是微软开源的多Agent对话框架,支持多个LLM智能体通过对话协作完成复杂任务。核心特点包括: 核心架构:基于Agent(智能体)、Conversation(对话)、Tool(工具)等组件构建,支持代码执行、工具调用和人类参与。 核心优势: 企业级支持(微软生态) 灵活的Agent类型(如UserProxyAgent/AssistantAgent) 支持人类反馈和代码沙箱 活跃开发者社区(GitHub 45k+ Stars) 快速上手: 通过pip安装pyautogen包 配置LLM(如Ope原创 2026-06-05 09:30:25 · 730 阅读 · 0 评论 -
2026 年 - AI 开发者必备:Agent 开源生态图谱
2026年AI开源项目全景概览 GitHub最新数据显示,AI领域呈现爆发式增长,Agent框架成为最热门赛道,AutoGPT以18.4万星位居榜首。个人AI助手OpenClaw以37.5万星成为现象级项目,RAG、推理部署等工具也蓬勃发展。Python仍是主导语言,微软、阿里等企业及开源社区贡献显著。技术趋势显示:多Agent协作、轻量化部署、结构化输出成为关键方向,AI正加速渗透编程、图像生成等各领域。原创 2026-05-27 15:59:17 · 1025 阅读 · 0 评论 -
2026年AI Agent技术生态开源项目合集
本文梳理了2026年AI Agent技术生态的八大核心领域及主流开源项目。核心框架方面,LangGraph、AutoGen等提供全流程编排能力;多智能体协作框架如CrewAI、MetaGPT支持角色分工与协同;工具调用与编排模块包含LangChain Tools、ToolFormer等工具集成方案;记忆系统部分涵盖LlamaIndex、Milvus等向量数据库技术。此外还介绍了低代码平台Dify、RAGFlow等可视化开发工具,以及专业领域Agent、评估监控、安全沙箱等关键技术组件,为AI Agent的选原创 2026-05-26 11:53:53 · 1627 阅读 · 0 评论 -
Chroma向量库面试学习指南
Chroma向量数据库面试速查指南 核心要点 核心概念:Collection容器、WAL日志机制、HNSW分层图索引、距离度量方法 API操作:集合CRUD、数据增删改查(注意upsert用法)、相似度查询语法 性能优化:批量写入、先过滤后搜索、合理设置n_results参数 常见坑点:必须手动传ID、生产环境部署模式选择、索引碎片处理 适用场景 适用于语义搜索、RAG系统开发,特别适合中小规模AI应用的原型开发和生产部署。 (字数:149字)原创 2026-05-26 11:13:36 · 457 阅读 · 0 评论 -
2026最新RAG面试题集:45问覆盖全链路
RAG(检索增强生成)技术通过结合外部知识检索与大模型生成能力,显著提升了问答系统的准确性和时效性。其核心流程包括文档索引(数据清洗、文本切分、向量化存储)和查询处理(检索、重排序、生成)。相比微调,RAG具有知识更新快、成本低、可解释性强等优势,尤其适合知识频繁更新的场景。RAG架构经历了从基础版到模块化的演进,数据质量是影响效果的关键因素。与搜索引擎相比,RAG更擅长生成精准答案而非返回文档列表。处理复杂文档格式时需采用针对性解析策略,如PDF使用PyMuPDF,表格结合OCR与布局分析等。实际应用中,原创 2026-05-25 19:34:29 · 618 阅读 · 0 评论 -
万字拆解:从“伪AI项目”到工业级RAG,如何用“三板斧”彻底解决语义丢失,征服大厂面试官
本文揭示了工业级RAG项目中的三大核心痛点:文档结构丢失、上下文割裂和检索性能低下。针对这些问题,作者提出了全链路技术解决方案"三板斧":1)通过多模态解析和元数据绑定实现源头结构还原;2)采用中文优化递归切分、HanLP语义分析和父子块关联的三层递进式语义分割;3)构建分层关联与混合检索的增强体系。该方案从数据预处理到最终检索形成闭环,既保障语义完整性,又满足高并发场景下的工业级性能要求,为RAG系统落地提供了可落地的技术路径。原创 2026-05-20 18:50:48 · 426 阅读 · 0 评论 -
2026年全球向量数据库技术全景与架构演进深度解析报告
摘要: 2026年,向量数据库市场因AI技术发展迎来范式转移。检索增强生成(RAG)技术推动向量数据库成为核心基础设施,需求从基础功能转向高性能、低成本解决方案。新一代嵌入模型带来高维数据挑战,混合检索(结合语义、关键词和元数据过滤)成为企业级标准。成本压力促使压缩算法和存算分离架构兴起。底层技术围绕距离度量(如欧几里得、余弦相似度)和近似最近邻算法(如HNSW、IVF-PQ)优化,平衡精度与效率。HNSW虽快但内存消耗大,IVF-PQ通过聚类和量化降低资源需求,成为超大规模部署的关键。企业需根据业务场景选原创 2026-05-19 17:55:06 · 608 阅读 · 0 评论 -
PageIndex技术全解析:基于推理的无向量RAG框架,重构长文档智能检索范式PageIndex 是一个创新的、无向量
《PageIndex:颠覆传统RAG的长文档处理新范式》技术解析: 本文深入剖析了传统向量RAG在长文档处理中的四大痛点:文本切片导致的上下文割裂、语义相似度与相关性脱节、结构化信息丢失及可解释性差。VectifyAI开源的PageIndex创新性提出"结构索引+推理导航"技术路线,通过构建文档层级语义树(PageTree),模拟人类专家的阅读逻辑实现精准检索。该方案摒弃向量数据库依赖,支持完整上下文保留和全链路追溯,在金融、法律等专业场景中展现出显著优势。其核心突破在原创 2026-04-19 12:22:13 · 655 阅读 · 0 评论 -
大模型格式转换全解析:从训练到部署的完整技术路线与最佳实践
大模型格式转换是连接训练与部署的核心技术环节。本文从技术原理、实现方案和性能优化三个维度,系统剖析了safetensors、ONNX、GGUF等主流格式的底层机制与转换策略。重点分析了计算图优化、量化压缩(Q4_K_M/Q5_K_M)等关键技术,对比了不同格式在训练存储、中间转换和推理部署阶段的适用场景。针对CPU/GPU不同硬件平台,提供了完整的格式转换技术路线,包括环境配置、模型验证、量化策略选择等实操方案,为工程落地提供系统性的技术参考。原创 2026-04-20 14:16:45 · 409 阅读 · 0 评论 -
EasyEnsemble(集成学习——处理不平衡样本分类问题)
(1, 2) X. Y. Liu, J. Wu and Z. H. Zhou, “Exploratory Undersampling for Class-Imbalance Learning,” in IEEE Transactions on Systems, Man, and Cybernetics, Part B (Cybernetics), vol. 39, no. 2, pp. 539-5...原创 2019-01-07 19:32:47 · 13132 阅读 · 0 评论 -
2026年向量数据库选型指南:Qdrant、Pinecone、Milvus、Weaviate 与 Chroma 深度解析
本文对比分析了五大主流向量数据库(Qdrant、Pinecone、Milvus、Weaviate和Chroma)的技术特性及应用场景。Qdrant以高性能和灵活性见长,适合中大型RAG应用;Pinecone提供全托管服务,适合无运维需求的场景;Milvus擅长处理超大规模数据;Weaviate具备混合搜索优势;Chroma则适合快速原型开发。文章还结合Dify、Coze等平台给出了选型建议,并提供了基于数据规模、运维能力和搜索需求的决策树。综合推荐Qdrant作为通用生产首选,Pinecone为最佳托管服务原创 2026-04-19 15:42:20 · 1634 阅读 · 0 评论 -
万字详解:RAG 向量索引算法与向量数据库架构及实战
本文深入解析RAG架构中向量检索的核心技术,指出检索系统质量决定回答上限。从数学原理出发,详细介绍了向量与Embedding的语义映射、相似度度量方法(余弦、欧氏、内积),以及精确检索KNN与近似检索ANN的区别。重点剖析了四大主流向量索引算法:基于树的Annoy、基于哈希的LSH、基于量化的IVF-PQ/SQ,以及基于图的HNSW,分析其原理、构建过程、查询机制及优缺点。特别强调量化技术的内存优化价值,以及HNSW作为高性能首选算法的分层设计。为RAG场景下的向量数据库选型与优化提供了理论依据和实践指导。原创 2026-05-19 16:53:51 · 673 阅读 · 0 评论 -
智能体 Agent 完全拆解:架构、组件与实战指南
**智能体(Agent)是一种能够自主感知环境、制定计划并执行行动的AI系统,其核心架构包含六大组件:1)大脑LLM负责推理决策;2)规划模块拆解复杂任务;3)工具集实现外部交互;4)记忆系统管理短期与长期信息;5)感知层处理多模态输入;6)行动循环通过ReAct模式迭代执行。这些组件协同工作,使Agent具备类人的任务处理能力,典型应用包括AutoGPT等框架。关键技术涉及思维链推理、函数调用和向量数据库等,推动AI从被动响应迈向主动协作。原创 2026-05-17 09:20:07 · 538 阅读 · 0 评论 -
封神级 TTS!VoxCPM2 凭连续表征,玩转多语言合成 + 创意音色 + 无损声纹克隆
VoxCPM2是OpenBMB与清华大学合作开发的开源TTS模型,采用连续表征扩散自回归架构,直接生成48kHz高质量语音。模型参数量达20亿,基于MiniCPM-4框架,支持30种语言和9种中文方言,并具备音色设计与可控声音克隆功能。原创 2026-05-02 17:43:14 · 647 阅读 · 0 评论 -
本地大模型部署指南:16G/32G/64GB内存配置全解析(附最新模型速查表)
本文针对不同内存配置(16GB/32GB/64GB)提供了本地大模型选型指南。16GB设备推荐2B-9B量级模型如Qwen3.5 9B,32GB可运行27B-35B级别模型如Qwen3.5 27B,64GB则能驾驭70B级旗舰模型和视觉多模态应用。文章详细列出了各场景下的最优模型组合,并解释了GGUF量化等级的选择策略,帮助用户根据硬件条件平衡模型性能与推理质量。原创 2026-04-24 11:03:37 · 3834 阅读 · 0 评论 -
多 AI 编码工具技能乱套?skills-manage 一站式统一管理全平台 Agent Skills
AI技能管理神器skills-manage重磅发布!这款开源桌面工具通过中央技能库+软链接同步技术,彻底解决多AI平台技能管理难题。核心功能包括:1)统一管理20+主流AI编码工具技能;2)可视化查看、安装/卸载技能;3)支持本地项目、GitHub和市场多渠道导入;4)技能集合批量管理。采用Tauri框架开发,具有轻量高性能、隐私安全、跨平台等特点,支持macOS/Windows/Linux系统。开发者可免费下载使用,实现"一次安装,全平台通用",告别技能重复配置和版本混乱问题。原创 2026-04-24 09:11:30 · 987 阅读 · 0 评论 -
Agent Skills 深度解析:AI 编码代理的工程化生产级工作流引擎
Agent Skills 是一套由 Addy Osmani 设计的工程化框架,旨在解决当前 AI 编码代理的短视化开发问题(如跳过测试、忽视安全)。该框架通过标准化工作流、质量门禁和反合理化机制,强制 AI 代理遵循生产级研发流程,输出工业级代码。其核心架构包括六阶段研发生命周期(定义、规划、构建、验证、审查、交付)、20 项结构化技能(如规格驱动开发、TDD、安全加固)及七层命令映射体系(如 /spec、/test)。通过角色层(审查专家)和参考层(核查清单)的协同,确保代码质量、安全与性能,兼容原创 2026-04-22 18:25:21 · 578 阅读 · 0 评论 -
大模型推理部署框架深度解析:核心技术原理与实践指南
大模型推理部署面临算力成本高、响应延迟和吞吐量瓶颈等挑战。本文系统分析了主流推理框架的核心技术,包括KV Cache缓存优化、PagedAttention分页管理、Continuous Batching批处理、推测解码和量化技术等,显著提升了推理效率。重点介绍了vLLM等框架如何通过创新架构实现显存利用率从40%提升至95%以上,吞吐量增加3-10倍。文章还探讨了Prefill-Decode分离架构和NVFP4等前沿量化技术,为企业选择最优部署方案提供参考。原创 2026-04-21 10:31:48 · 986 阅读 · 0 评论
分享