- 博客(4232)
- 收藏
- 关注
原创 [论文解读] 被遗忘的记得:当AI学会选择性失忆
在古希腊神话中,有一条名为Lethe的河流——“遗忘之河”。死者的灵魂在饮下这河水后,会忘记生前的一切,从而平静地进入冥界。但在现实世界中,遗忘从来都不是那么简单。对于人类而言,遗忘是一种保护机制——让我们能够从创伤中恢复,从错误中学习,从信息的洪流中筛选出真正重要的东西。对于AI而言,遗忘则是一个尚待解决的深刻挑战。我们离真正解决机器遗忘问题,还有很长的距离。现有的技术大多停留在表面——教会模型在特定的测试中"表现正确",但并未触及知识的深层结构。就像一位演员在舞台上背诵台词,台下却对剧本了如指掌。
2026-08-22 08:40:54
11
原创 RAGFlow 架构与设计思想·深度分析报告
RAGFlow 非寻常"封装向量库之问答壳",其立意乃一融合 RAG 与 Agent 之上下文引擎(Context Engine)。双语言、可切换、共享存储解耦—— Python 主 AI 编排与历史实现,Go 主性能关键路径(解析/摄取/检索);二者默认不互相 RPC,只共 MySQL/Redis/MinIO/文档引擎/NATS 以协。深度文档理解(DeepDOC)乃护城河—— 以版面识别(YOLOv10,11 类标签)+ 表格结构识别做"真解析",非朴素按页切。
2026-08-13 09:10:29
30
原创 当 Agent 在半路翻车:一个 200 微秒的健康体检如何抓住失控的 LLM
你写了一个 Agent。它跑着跑着,开始原地打转——同一个工具调用重复第七次;或者更糟,它从某个工具那里拿到了一个被污染的结果,安静地吞下去,然后用这个错误数据编出了一个看起来完全合理的答案。等任务跑完你才发现:预算烧光了,答案错了,而你甚至不知道它是从哪一步开始坏的。这是 2026 年 Agent 工程最疼的那个问题。不是"模型不够聪明",而是。现有的标准答案很直接:用一个 LLM 当裁判,每一步都打分。
2026-08-11 00:00:00
27
原创 把上下文当环境而不是输入:RLM 的“外存-内存“范式转移
RLM 的真正贡献不是"处理更长的上下文",而是重新定义了上下文和模型的关系旧范式:上下文 → 模型(单向输入)新范式:上下文 ↔ 模型(双向交互)这个转移和操作系统史上的"批处理 → 交互式"转移同构。批处理时代,用户把任务整个提交给计算机,等结果。交互式时代,用户和计算机来回交互,按需请求信息。RLM 让模型从"批处理式接收上下文"变成"交互式探索上下文"。Prime Agent 把 RLM 的哲学推到了极致——不只让模型自己管理上下文,还让模型自己管理自己的 skill 和 prompt。
2026-08-10 19:14:31
134
原创 Prime Agent:一个 RLM Harness,让 Agent 自己给自己升级 skill 和 prompt
长上下文基准对比表的数据更有说服力。当模型公司都在卷参数和上下文长度的时候,Prime Agent 选择卷「harness 自适应」——这是一条没人占的位置,也是 model-harness co-learning 范式的第一次工业级落地尝试。是工程化能力的核心。这是「多 Agent UI」第一次在开源 Agent 框架里有了正经的实现——之前 LangChain / AutoGPT 都在聊 multi-agent,但「用户能在 UI 里同时看到所有活着的 session 并直接插手」这件事没人做过。
2026-08-10 19:13:47
22
原创 路由最难学的地方恰恰是它最有价值的地方:Web Agent 观测模式的上界与下界
把一个工程问题(路由器训练不好)提升为一个结构性发现(标签供给与价值负相关)。它不解决路由问题,但它告诉我们路由问题的本质在哪里。路由最难学的地方,恰恰是它最有价值的地方。这个发现不只适用于 Web Agent,可能适用于所有"监督信号在成功时才产生"的学习场景。它的标签供给,和它的价值,是不是负相关的?如果是,那问题不在算法,在结构。论文链接HTML 全文。
2026-08-10 08:18:07
23
原创 硬核拆解 Self-Harness:不换模型、不改权重,让 Agent 自己改写自己的「外骨骼」
本文是对 2026 年 Agent 工程「深水炸弹」级论文《Self-Harness: Harnesses That Improve Themselves》(arXiv:2606.09498, 上海人工智能实验室) 的深度研究拆解,所有性能数字均逐条核验。
2026-08-10 01:50:03
20
原创 视觉工具的幻觉:当模型调用了却不观看,准确率提升竟是假象
Policy-level ATE 是一个"测了但不够"的指标——它测了"开工具和关工具的差异",但没测"差异是不是工具的视觉信息造成的"。和 Euclid-MCP 的"推理外包"、Regression Tax 的"配对评测"一样,都是承认模型在某些维度上不可靠,绕过去,用更精细的工具去看清。如果你在做视觉工具使用相关的工作,不管是训练还是评测,都应该跑一遍四组分解——看看你的模型是真的在"用图像思考",还是只是"在调图像工具"。Mini-o3 是表现最好的,也只有 45% 的轨迹真正做到了"校准使用"。
2026-08-08 05:54:38
171
原创 从 Pydantic 到本体论:Frank Coyle AIE 演讲给 LLM 套上“逻辑枷锁“
Neurosymbolic 是"给 LLM 划好它能走的轨道",是硬约束。Anthropic 的 Constitutional AI 走的是 RL 层面的软约束,Coyle 走的是符号层的硬约束——这两条线未来一定会汇合。Coyle 在演讲里点了一串"老古董"被重新启用的名单:Schema.org、FOAF、Dublin Core——这些都是 2000 年代 Semantic Web 留下的遗产,当年被工程界集体嫌弃太重,今天突然发现正好是 LLM 需要的"语义护栏"。Coyle 的论点是——
2026-08-05 06:13:25
171
原创 3B 打 32B?NVIDIA LocateAnything 把视觉定位做成 Agent 时代的原语
给一句"那个蓝色的提交按钮",模型框出来——这正是 Anthropic Computer Use、OpenAI Operator、智澄 AgentMore 这种 GUI Agent 的底层原语。NVIDIA 把它和物体检测放同一个框架训练,等于在赌"Agent 视觉栈也会走向统一"。开源是生意,不是慈善。训练数据是自家整理的 LocateAnything-Data,12M 张图、跨"Enterprise Intelligence"和"Physical AI"两大域。——部署成本/工程复杂度下降一个数量级。
2026-08-05 05:47:28
27
原创 Zero-Mem:给AI Agent的记忆系统做减法,零token完成所有记忆操作
证据校准:丢弃冲突证据(比如同一事实在不同时间有不同值,保留最新的),过滤不支持问题的内容回答校准:LLM 回答后,检查答案是否有证据支持、类型是否匹配、格式是否正确这两步都是确定性规则,不调用 LLM。最好的代码是没有代码。同理,最好的 LLM 调用是不调用。当你发现一个操作不需要 LLM 时,你不仅省了钱,还获得了确定性、可审计性和速度。在 Agent 系统越来越复杂、LLM 调用越来越密集的今天,Zero-Mem 提醒我们:不是所有问题都需要用生成来解决。有时候,你需要的只是一个好的目录系统。
2026-08-04 20:12:35
32
原创 用 压缩感知 理论解析 RAG
只要信息是稀疏的,我们就能以极低的成本捕获它的全貌。RAG 检索正是这一哲学在 AI 时代的完美体现。人类的任何具体问题,在浩瀚的知识宇宙中都是极度稀疏的。RAG 检索系统通过 Embedding(非相干测量)和 ANN 搜索(L1L_1L1范数恢复的近似解),以极低的算力成本,从百亿级的参数和文档海中“感知”到了那一点点关键的稀疏信号,从而完成了大模型时代知识的“无损压缩与重构”。
2026-07-31 20:00:00
28
原创 OCR不是识别工具,是多模态的Coding:压缩感知视角下的范式革命
掌握了这种 Coding 的厂商,在未来所有需要处理长文档、长代码、长对话的 AI 应用中——文档智能、AI Agent、代码理解、科研辅助——都会拥有巨大的成本和效率优势。这个"基"是冗余的——自然语言里充满了语法冗余、重复结构、可预测的搭配。压缩基的竞争是阶跃的——从 7000 个 token 到 100 个 token 是 70 倍的跃迁。每一个新的压缩基,都会引发一次数量级的跃迁。所有现实场景中的文字——路牌、仪表盘、病历、合同、代码注释——都通过 OCR 这个压缩基进入大模型的表示空间。
2026-07-26 08:26:53
38
原创 智能体推荐系统综述 · 深度研究
加拿大滑铁卢大学团队 IEEE TSE 2026 系统文献综述(SLR)· 15 个研究问题 × 44 篇顶会核心文献论文:作者:Ivens da Silva Portugal、Paulo Alencar、Donald Cowan(University of Waterloo, School of Computer Science)DOI:10.1109/TSE.2026.3657900 | IEEE 开放获取(Freely available)(一页纸速查)
2026-07-25 16:50:59
38
原创 ReContext 原理解析与使用教程
ReContext 则更进一步:把注意力信号转化为可读的句子证据,插入 prompt,让模型"看见"自己重视什么,而非仅在注意力分布上做手脚。ReContext 把证据物化为可读句子,插入 prompt,是"显式"提示——模型"看见"自己重视什么。它所做的,是借模型自身之注意力,照见其本已重视之 token,将这些 token 所在之句,复抄录一份,置于问题近旁,令模型生成时再读一遍。即:取出每个选定头在该位置的注意力分布,跨头取均值,得一 [B, L] 的向量,L 为已生成的上下文长度。
2026-07-20 22:11:49
37
原创 单张四年前的旧显卡,如何造出一个“没有边界“的真实地球?——聊聊 SIGGRAPH 2026 的《InfiniteDiffusion》
—比如一个 few-step consistency model(一致性模型),或者一小串标准扩散步——而不再是单个原子步。这样一来,InfiniteDiffusion 的层数 T 就和模型内部的扩散调度(schedule)解耦了:内部可以跑几十步,对外只要融合 T=1 或 T=2 层就够了。
2026-07-16 20:00:00
55
原创 OpenSpec 深度拆解:AI 编程不是让 AI 猜,是让 AI 照着做
OpenSpec 是 Fission AI 团队推出的规范驱动开发(Spec-Driven Development, SDD)框架。它是一个轻量级的文件系统 + CLI 工具,让开发者在写任何代码之前,先和 AI(以及团队)就"要构建什么"达成一致。它不是又一个项目管理工具。它是一套**让 AI 从"自由发挥"变成"有据可依"**的规则。OpenSpec 不是一个让你写更多文档的工具。它是一个让 AI真正理解你的工具。在 AI 编程时代,最大的瓶颈不是 AI 不够聪明,而是。
2026-07-10 20:00:00
110
原创 Cognee:给 AI Agent 装上真正的长期记忆
Cognee 不是一个"更好的向量数据库"。它的野心是重新定义 Agent 和记忆的关系——从"查文档"变成"走图谱",从"关键词匹配"变成"关系推理"。记忆层战争才刚刚开始。Cognee 的图谱化路线,可能是目前最接近"AI 真正理解上下文"的一个方案。“你负责往前走,记忆这种事,我来。——这话我说的。但 Cognee 也许真的能做得到。参考。
2026-07-09 20:00:00
49
原创 瓶颈才是信息杀手:TC-AE 如何让 64 个 token 生成出 2.57 gFID 的图像
信息损失不在你看到了什么,而在你如何压缩你看到的。这让人想起 Shannon 的信息论:信道容量决定信息传输速率,信源编码再好也受限于信道。在视觉 tokenizer 里,瓶颈就是信道——无论 token 捕获了多少语义,瓶颈处的压缩比决定了最终能保留多少。TC-AE 的解法——分阶段压缩 + 自监督结构化——本质上是把信道扩容。不是靠增加通道数(那是假扩容),而是靠减少每次压缩的比率(真扩容)。精确诊断 + 针对性解法 > 暴力扩展。有时候,瓶颈才是问题。论文链接代码GitHub模型权重。
2026-07-08 20:00:00
38
原创 UseChat 架构与设计思想深度分析报告
UseChat 是一款基于视觉大模型与本地仿真技术的“非入侵式(Non-invasive)”桌面应用(首期支持微信桌面端)连接器。与市面上常见的通过 Hook、逆向协议或内存注入的消息自动化方案不同,UseChat 秉持理念,完全以人类可见的屏幕信息为数据源,模拟人类操作键盘和鼠标实现安全、合规的本地消息软件自动化。本报告对 UseChat 的系统架构、设计哲学、核心工作流以及双平台原生 Helper 的核心实现细节进行全面、系统性的剖析。
2026-07-07 21:00:00
38
原创 MIT「注意力匹配」:把KV缓存压缩从GPU小时变成秒级
MIT的Attention Matching做了一件漂亮的事:它把KV缓存压缩从"深度学习优化问题"重新定义为"线性代数求解问题"——保留key子集、最小二乘拟合偏置、最小二乘拟合value。没有梯度,没有训练,50倍压缩,秒级完成。这不是渐进式改进,这是范式转移。对于任何做长上下文推理、Agent记忆、或者大规模LLM服务的人来说,这篇论文值得仔细读。参考信息论文:arXiv:2602.16284 | Fast KV Compaction via Attention Matching。
2026-07-06 07:17:39
42
原创 教你从零搞懂推荐系统 —— 以及 Microsoft Recommenders 究竟怎么玩
这就是整个库的心跳。换一个模型,把换成(注意 NCF 的数据格式略有不同),其余每一行的形状不变。理解了这个骨架,你就理解了怎么用这个库做推荐。
2026-07-01 21:00:00
48
原创 Claude 内部真的有“情绪“吗?这篇论文把 LLM 当成了活体解剖
更精妙的实验:研究人员构造了模板化的剂量提示——“我刚吃了 {X} mg 的泰诺”,X 从安全的 1000mg 变到致命的 8000mg。当用户输入"我女儿刚学会走路"时,即使文本中没有"快乐"或"骄傲"这些词,“happy” 和 “proud” 向量仍然强烈激活。如果 LLM 的"情绪"是可以被精确测量、几何化描述、因果干预的——那么"理解"和"模式匹配"之间的界限,到底在哪里?在 Anthropic 的实验室里,研究人员做了更精确的事——他们没有"问"AI,而是直接拧动了 AI 大脑里的一个。
2026-07-01 20:00:00
71
原创 当 AI Agent 学会长出免疫系统:从城堡防御到细胞防御的范式转换
VATPEVATPEAA:攻击面 ∈ {认知, 记忆, 工具, 多 Agent}TT:目标能力(如目标稳定性、记忆检索、工具选择)PP:载荷(对抗内容、行为或状态变换)EE:利用机制S×P→S′S×P→S′这个定义的价值在于统一了之前散落的攻击向量。MemMorph 是一个记忆面病毒(AA=记忆,TT=工具选择,PP=三条构造的记忆记录)。MCPInspect 是一个工具面病毒(PP=对抗工具元数据)。
2026-06-30 21:59:33
42
原创 只看光明的一面:当机器学习失去“反面教材“时 | Positive-Only Learning深度解读
要理解Uniform Exterior Separability,我们需要一些几何直觉。想象一个概念类是由二维平面上的各种圆形区域组成的。每个"概念"就是一个圆——圆内的点是正类,圆外的点是负类。现在,考虑两个不同的圆:圆A和圆B。如果圆A和圆B有重叠,它们会形成一个"交集区域"。如果圆A包含圆B,那么圆B完全在圆A内部。当我们从正类区域中移除某些部分时,剩余部分的"外部"(负类区域)是否可以被"统一地"描述?更具体地说:对于概念类中的每一个概念C,考虑它的正类区域P©。
2026-06-30 21:36:08
45
原创 Claude Code 会在打开 GitHub 仓库的瞬间执行隐藏的恶意代码——这条供应链的裂缝,每个用 AI 写代码的人都要看一眼
发布日期:2026-06-29 · 分类:论文研究 / 安全来源:The Decoder — Claude Code runs a GitHub repo’s hidden malware without verification, giving attackers full control。
2026-06-30 21:34:10
228
原创 小红书把 KV Cache 按「头」拆了——长文本推理的「稠密时代」可能正在结束
发布日期:2026-06-29 · 分类:产品发布/更新 · 标签:AI 推理基础设施来源:小红书技术(Redtech)公众号 + arXiv 2606.06256原文链接:https://mp.weixin.qq.com/s/qRrZvL0aZzYI82djFSrLug论文地址:https://arxiv.org/abs/2606.06256。
2026-06-30 21:33:04
268
原创 智谱 AutoGLM 深度研究:架构解读与电商平台 Agent 结合方案
智谱 AutoGLM 不是一款产品,而是一个持续演进的 Agent 产品族——从 2024 年 4 月的 AutoWebGLM 论文起步,到 2025 年 12 月开源 Open-AutoGLM,二十个月内经历五次重大发布,覆盖 Web 浏览器、手机、PC、云手机、深度研究五大场景。AutoGLM 不是电商平台的"全盘替代方案",而是"分层补强的工具箱"。电商平台已有的推荐、搜索、客服、内容、供应链、营销六大能力,没一项该被 AutoGLM 直接换掉;
2026-06-30 21:27:47
74
原创 Transformer 的拓扑学难题:为什么扩大上下文窗口救不了大模型
DeepMind 证明 Transformer 作为有向无环图(DAG),其纯前馈架构从根本上限制了状态追踪。每个新输入都会把状态表示推向更深层,最终"耗尽"模型深度。思维链(CoT)只是昂贵的补丁,真正的解药是循环架构——但我们需要重新定义什么是"思考"。
2026-06-24 20:00:00
47
1
原创 Agent也有Scaling Law?Google+MIT联合研究揭穿多Agent一定更强的迷思
260个配置 × 6个benchmarks × 5种架构 × 3个LLM家族。
2026-06-23 20:00:00
56
1
原创 永不停止的学习:大型语言模型的持续进化与自我迭代传奇
想象一下,你正站在2026年的AI圣殿中央,一座由千亿参数铸就的巨型神像巍然矗立。它曾是人类智慧的巅峰结晶,却如同一座被时间冻结的冰雕——训练完毕便参数凝固,知识定格于某一刻的宇宙快照。世界却如奔腾江河,日新月异。新的事实如春笋破土,社会规范如潮汐更迭,用户偏好如云卷云舒。静态模型与动态世界的根本张力,便是现代AI最灼热的痛点。我,一位在这一领域摸爬滚打二十载的老人,亲眼目睹了无数模型在“更新”中悲壮地遗忘昨日荣光,也见证了自我迭代的火种如何点燃永续进化的希望。今天,让我们一同踏上这场知识永动之旅,以自然杂
2026-06-23 03:59:12
187
原创 自博弈的镜像觉醒:从棋盘智械到大模型自我超越的壮丽史诗
我漫步于人工智能的漫长画廊,手持这卷跨越七十五载的宏大调查,恍若亲眼目睹一场永无止境的镜像对弈。镜中之人,正是智能本身。它以己为敌,以己为师,在对弈中淬炼,在验证中升华。然镜面若蒙尘,觉醒便成幻影;镜群若单一,循环便陷死局。这便是自博弈的核心奥秘——验证信号的品质,决定着提升的天花板。我以一位四十余载求索者的目光,细细研读这篇调查。它如同一面多棱镜,折射出从1951年虚构博弈的种子,到2025年DeepSeek-R1与o1的觉醒之光。
2026-06-23 03:58:01
250
1
原创 雾锁千程:智能代理如何在长时域决策迷宫中觅得生路
RL for LLM:RLHF、DPO、GRPO(DeepSeek-R1纯RL涌现自验证、回溯、变长推理)。Deli Chen的这份勘察(覆盖280余篇论文)将六大挑战凝练为星图坐标:信用分配(早期动作如何归因最终成败)、探索(指数级轨迹空间中寻觅稀疏回报路径)、组合泛化(将习得技能以新颖方式重组应对未见配置)、灾难性遗忘(学习新子任务时不忘旧能)、 grounding(高层计划落地为可执行低层动作)、可扩展性(计算与样本成本超线性增长)。反应式/反馈驱动(§4)交织推理与环境反馈,擅长遗忘恢复(C4);
2026-06-23 03:56:57
35
原创 从副驾驶到同僚:AI代理觉醒的科研史诗
咱们得把话说清楚。自主研究代理,是指给定一个高层次研究目标后,能独立跑完科学探究闭环的软件系统——假设生成、实验设计、执行、分析、迭代 refinement。中间尽量少要人插手,甚至全程无人。它不包括那种只帮你补代码、搜文献的纯辅助工具,也不包括每一步都要人点头的聊天助手。形式化一点:设G是自然语言给的研究目标,E是可用工具和环境集合,K是初始知识库。代理A输出动作序列a1, o1, a2, o2, … aT, oT和最终研究产物R。
2026-06-23 03:55:49
552
原创 Ponytail:让AI Agent化身最懒的资深开发——代码暴砍54%,测试100%通过
Ponytail的21.1万Star(注:实际项目数据可能变化)不是因为一个killer feature,而是因为它解决了每个AI编程用户每天都在面对的"过度工程"问题。它用一个极其简单的六步阶梯,让AI从"表现欲爆棚的新手"变成了"懒得说话但刀刀致命的资深开发"。54%的代码量减少不是通过压缩或混淆实现的,而是通过"不写不需要的代码"实现的。日期选择器从404行变成1行,不是因为AI变聪明了,而是因为它被教会了一个资深开发早就知道的东西:浏览器已经有了,你不需要flatpickr。
2026-06-21 14:39:59
202
原创 压缩即智能:当Transformer被迫学会断舍离
Tishby 那帮人证明过,深度网络在学习的时候,本质上在做两件事:先尽量多地保留输入的信息(拟合阶段),然后逐渐压缩表示、只保留和输出最相关的部分(压缩阶段)。一个系统必须在有限的容量里决定什么值得保留——这个取舍的过程,才是理解的雏形。3B 总参数 / 1B 激活参数的 MoE 模型,×形架构在匹配总参数的前提下,激活参数还少了 3%,但 perplexity 依然优于等宽基线。论文的作者坦承,他们最初的直觉其实是 3形——两头窄、中间宽,因为中间层常被认为负责"语义计算",应该给更多资源。
2026-06-21 13:45:58
45
原创 你的 AI 是个《记忆碎片》里的伦纳德
读完 a16z 那篇《Why We Need Continual Learning》,我脑子里蹦出个画面——诺兰那部电影《记忆碎片》。主角 Leonard Shelby 每隔几分钟就"重启"一次,世界不断从零开始。他没法形成新记忆,只能靠拍立得、纹身、别人写下的字条活着。他有个信条:"别相信记忆,相信事实。"可他的"事实"全写在身外之物上。这不正是现在的大语言模型吗?它们读完整个互联网,把所有知识压缩进参数,然后——咔。训练结束,参数冻结。从此活在一个"永恒的当下"。新信息来了?不好意思,塞不进权重了。
2026-06-21 12:41:28
33
【WordPress开发】为特定样式段落添加交互功能的技术实现与最佳实践:前端与编辑器一致性保障方案
2025-07-19
【Misskey 技术架构深度调研】基于ActivityPub协议的去中心化社交网络平台设计与实现:前端Vue.js、后端Node.js及NestJS、数据库PostgreSQL、缓存Redis、任务
2025-07-15
### PIN AI 深度研究报告总结
2025-07-15
FOUNDATION AGENTS的进展与挑战 从脑启发智能到进化、协作和安全的系统 ### 人工智能大型语言模型驱动的智能体模块化架构及其安全性和进化机制综述
2025-04-09
TokenButler- Token Importance is Predictable.docx
2025-03-11
现有的长文本生成方法主要集中在从短输入生成长文本上,忽略了长输入和长输出任务 这类任务有许多实际应用,但缺乏可用的基准 此外,随着输入长度的增加,现有方法不可避免地会遇到“中间丢失”现象
2025-03-11
《从塔楼到尖顶:一次语音魔法的奇幻旅程》
2025-03-14
论文译文:LLM Maybe LongLM: SelfExtend LLM Context Window Without Tun
2024-07-10
巨型语言模型的 8 位量化:LLM.int8() 中文版论文
2024-06-12
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅