
微信 8 个工作群、钉钉 468 个会话、106 条便签、待办清单,全部自动流进我本地的一套知识库。这是"AI 解密攻防"系列收官篇,交总图。
2026 年 8 月 12 日早上 6 点 52,我在刷牙,电脑在干活。钉钉群的新消息解密、归档,全程没人碰键盘。七分钟前,6 点 45,微信 8 个工作群的前一日日报刚生成完。
我是野生码农,39 岁,程序员。这是系列的第六篇,也是收官。前五篇是五条战线的战报:微信、钉钉、印象笔记、便签、待办,一篇一场仗。这篇不开新仗,讲这些仗打下来的数据,最后流去了哪、怎么管的。
一、先交账:五条链路,一张表
| 链路 | 钥匙怎么来 | 战果 | 什么时候跑 |
|---|---|---|---|
| 微信 4.1 | 调试器 8 轮断点、794 次命中,硬抠 | 24 个数据库当天全解密,8 个工作群 | 06:45 拉取出日报,工作日 12:10、17:47 补两轮 |
| 钉钉 | 账号 ID 的 MD5 前 16 位,三行代码 | 468 个会话,426 条群消息回填,380 个文件归档 149 个 | 每天 06:52 |
| 印象笔记 | token 官方文档写一年,实测七天 | 全自动换新:吊销、新建、读出、校验、写环境变量,我做的是零 | 到期自动换,凌晨跑通的全链路 |
| OPPO 便签 | 不碰加密,借页面自己的解密能力 | 106 条笔记、234 个附件、271MB | 全量导出已跑通,定时增量还没做 |
| Todo 清单 | 库是 SQLCipher 加密,借应用自己的引擎开锁 | 任务按天导出 JSON 落本地 | 定每日清单时跑 |
每条链路一句方法论,都是那一篇拿真金白银换的:
微信那一晚,"钥匙总在开门的那一刻出现在锁孔里,那我就守在锁孔边上"。钉钉是反转,"有时候门根本没锁,你只是需要先把'它一定锁得很死'的预设放下"。印象笔记是文档骗人,"文档上写的东西和实际跑起来的东西,中间那条缝,只有动手的人知道有多宽"。便签是换个思路,不碰加密协议,页面即解密器。待办这条更巧:应用自己带着解密库,那就借它自己的 Electron 引擎,用它自己的钥匙开它自己的库,只读打开副本导出。
技术细节这篇都不重复,前五篇各自写透了,这里只留坐标。
二、总图:不是五个工具,是一个形状
五条链路打法各不相同,拆开看,全是同一个形状:
只读快照,解密或取出,增量,落盘。
第一步快照。所有链路共用的第一条规矩:先复制一份数据库再动手,原库永远不碰。微信是逐页 AES-256-CBC 解密快照加 WAL 合并;钉钉是逐页 ECB 加校验链重算;便签和待办干脆不解文件,借应用自己把明文交出来。打法不同,纪律相同:只读。
第三步增量。每天跑的东西,不能每天全量拉。办法统一叫水位线:上次读到哪,把最大 ID 记在一个本地 JSON 里,下次只取线以上的。WAL 是 SQLite 的预写日志,新数据先记进这个暂存账本,水位线保证账本里的新账也逃不掉。钉钉的消息表拆成 128 个分片,照样一条水位线管到底。
第四步落盘。所有渠道的产物落进同一个入口目录,按来源、按日期排好:微信按群分文件,钉钉按天,便签一份结构化 JSON 加一份可读全文,待办一份 JSON。文件名规规矩矩,因为下一步的分类要靠它。
三、汇进知识库:文件是真相,数据库只是索引
落盘之后,进我的本地知识库系统。设计哲学一句话:文件即真相源。
所有内容以 Markdown 存盘,文件头几行是元数据:标题、分类、标签、领域、级别。SQLite 数据库里只存索引,核心是一张全文检索表:
CREATE VIRTUAL TABLE entries_fts USING fts5(
title, content, tags, tokenize='trigram'
);
FTS5 是 SQLite 自带的全文检索引擎;trigram 是把文本切成三三字组的切词方式,中文没有空格分词,用它最省事。索引按文件内容哈希增量更新,哈希没变的文件直接跳过。库文件整个删掉也不怕,一条命令扫目录重建,因为真相在文件里,不在库里。
8 月 13 日我跑了一次统计:671 条,2556400 字。256 万字,全在我自己这台电脑里。
四、一个分类器,所有渠道共用
渠道多了,最怕每个渠道一套规矩。我以前就乱在这:知识库一套目录,待办 App 一套分类,群里一套 P0/P1/P2 分级,三套互不相通,同一条消息在三个地方有三种归法。
现在规矩只有一条:所有渠道,过一个分类器,规则只维护一份。
拿公文归档说。工作群和钉钉里收到的正式文件,按来文单位归档成一棵树。分类器核心是一条优先级链:
def classify_unit(filename, source="", sender="", user_folder=""):
# 优先级从高到低:
# 1. 我本人手工归档的目录名(最强证据,我亲手分的类)
# 2. 文件名关键词规则(顺序匹配)
# 3. 编号公文兜底
# 4. 发送者映射
# 5. 以上都不中,归"其他"
上线当天,163 份历史公文迁移,分类器的结果和我手工归档的目录逐份比对,0 分歧。校验集不是拍脑袋定的,是我自己多年手工归档的文件夹。让 AI 拿用户自己手工归档的文件夹当考试答案,而不是拍脑袋定规则,这就是全部秘诀。
也有翻车。第一版跑出过 2 处分歧,查下来不是模型不行,是规则里有一处自作聪明的归并。修完才到的 0。
分类体系本身也统一了:领域五个,工作、生活、健康、学习、财务;级别四级,P0 指令待办、P1 重点跟踪、P2 知会、P3 存档。历史 370 多条笔记不搬家,原地不动,新产出的每条带元数据进索引。能不动存量就不动存量,搬家的成本比它们余生的价值高。
五、最后一步,我把"自动"砍了
我以为数据接进来就是终点。真用起来才发现,采得到只是上半场,管得好才是下半场。
数据进门之后还有一道管道,五步:同步、归档、分析、生成待办、收尾。首跑产出 P0 两条、P1 一条,和我近 14 天 8 条未完成待办比对,无重叠。分析是准的。
然后我把最后一步砍了。生成的 3 条新待办,一律先演示、我逐次确认、确认后才写入,不得自动写进我的 App。
理由一句话:分析和建议可以自动,写进我的 App 必须逐次过手。自动写入的话,我每天都得检查清单里有没有它自作主张塞进来的东西,这个心理成本比手动确认高得多。
自动化的边界不是技术能力,是逐次过手。
六、五个判断点,谁再接渠道谁用得上
- 先快照,再动手,原库永远不碰。
- 增量靠水位线,不靠时间戳猜。
- 分类器拿用户手工归档当考试答案,别拍脑袋定规则。
- 管道活性检查必须配数据时效检查。钉钉那条线我栽过:解密每天成功,数据停在 7 月 31 日,连续 7 天假阴性。
[ok]报的是工具活着,不是数据活着。 - 分析自动,写入过手。
边界还是那句,系列里每篇都说一遍:全程只在自己电脑、自己账号上操作,只读不写,产物不出本机。读懂自己的数据,天经地义。单位、群名、同事的事一个字不写,上面所有代码都是脱敏后的关键片段,流程只指向一个目的:读自己的数据,建自己的知识库。
这个系列到这里收官。五场仗加一张总图,我最大的收获不是那 256 万字,是那个形状:再冒出新渠道,照着形状接,快得很。
FAQ
问:这些工具能分享吗? 思路全在这篇和前五篇里,快照纪律、水位线、分类器优先级,照抄就能用。具体工具不公开,原因明牌:我不想写出任何能被拿去读别人数据的教程。评论区可以聊思路,聊到多细都行。
问:历史笔记为什么不搬进新体系? 370 多条搬一次的成本,比它们余生产生的价值还高。新产出带元数据进索引,旧的靠全文检索兜底,256 万字也搜得动。
问:待办让 AI 直接写进 App,不是更省事? 省事和省心是两回事。分析和建议它全做,落笔那一下必须是我。
问:普通人值得搞这套吗? 看消息密度。群里一天几十条通知加文件、要归档备查的,值;群只用来吹水的,别折腾。前期每条链路一晚到几晚不等,跑起来之后维护成本约等于零,计划任务自己跑。
我是野生码农,AI 实战派。自研 AI 本地知识库系统、AI 数字员工团队、软考 AI 备考系统、量化交易系统,全程公开复盘。
"AI 解密攻防"系列六篇到此收官:微信、钉钉、印象笔记、便签、待办,加这篇总图,都在合集里。8 月 30 日前后还有一份月报,这套系统和 AI 团队第一个月跑了多少活、花了多少钱,真实数据全公开,难看也放。
关注我,看真的。
野生码农 · 全网同名 · AI 数字员工实战复盘,数据只报实测

507

被折叠的 条评论
为什么被折叠?



