2022-2026四年项目经历全景图

我把从2022年-2026年四年开发过的代码库喂给大模型,让AI给我整理了下这四年的项目经历,做了一个技术栈和能力全景图的汇总。虽然时间线上有些出入,但能非常快速的帮我整理好了这4年主要的工作和成长阶段。

2022年7月中是我加入一个新团队的开始,2026年7月中是我离开这个团队的结束,整整四年时间。四年前加入时很突然很忐忑,心怀憧憬,四年后,团队解散的也很突然,但心情平淡无波。人员四处零落,一哄而散再难聚首,不甚唏嘘。

业绩不好团队解散是正常的,尤其在大厂,平均一两年就要团队调整重组下。到今年8月底,我就入职满6周年了。我在第一个团队两年的时间(2020年8月到2022年7月),期间经历了第一任领导被裁,团队与另一个团队合并。该新领导上任一年后,团队又被拆,我分到了第三任领导下。但我不喜欢新团队的工作模式和工作内容,就在2022年7月异动到了别的团队。

这就是后四年的团队(2022年7月到2026年7月),在这个团队,算上一年左右外驻到其他团队做项目共建的经历,也差不多是经历了三任领导。

部门和团队起起落落,领导的任职也是在启用和罢免之间起起伏伏,没有什么是长久安逸的。时代在快速发展,技术在不断的更迭,只有不断学习,不断跟上技术发展,不断拓展自己的能力和视野的边界,才是职场生存之道。

1、工作阶段总结

以下是AI帮我整理的四年工作:

第一阶段:数据工程 & 特征基建(2022.07 - 2022.11)

项目

一句话

核心能力

0-特征预处理

电商用户行为特征工程,四层架构(ODS→明细→聚合→宽表),50+维特征,日处理亿级日志

PySpark、Hive、ORC分区、滑动窗口聚合

7-dmb_rpt

核心行为报表系统,多时间窗口×多粒度(1/7/15/30/60/90天×5级类目),RDD flatMap 优化

OOP 架构、版本迭代 

6-agile_tag

B2B 企业购敏捷标签系统,企业法人/高管身份判定 + 公司×PIN 映射 + 运营名单模糊匹配

多表 JOIN、公司名→PIN 匹配


第二阶段:ML 建模 & 广告归因(2022.07 - 2023.07)

项目

一句话

核心能力

2-scala_project

用户定向+行为序列 Embedding+广告归因,Scala Spark JAR + PySpark 混合架构

曝光→点击→下单归因、行为序列 Embedding、品类×品牌过滤

3-cvr_brand / 3-cvr_shop

CVR 预估模型,Word2Vec 商品 Embedding + GBT/LR/MLP/Wide&Deep 多模型对比

端到端流水线、正负样本平衡(1:10)、滑动窗口扩正样本

13/18-图片标注

商品图片数据采集,63.5万条标注数据管理+多线程批量下载,YOLO-v8商品主图/商标识别

Hive标注平台数据、500线程并发下载、YOLO-v8、CLIP模型


第三阶段:因果推断 & 跨行业复用(2023.01 - 2023.09)

项目

一句话

核心能力

4-uplift_model

电销 Uplift 增益模型,CausalML X-Learner + Class Transformation

因果推断、AUUC/Qini Curve、Persuadables 人群识别

10-qiyegou_model

B2B 企业购增长 ML 模型(c2register/b2gmv/c2gmv

GMV分档多分类、RF/GBT、配置化 taskConfig

11-pets_health

CVR 模型,复用企业购框架到新品类

框架复用、I2U优惠券用户召回

16-phone_card

合约机/号卡 CVR 模型,第5次框架复用

140+维 RFormula、运营商合作经验

12-hair_transplant

垂直行业全链路,NLP(Jieba+BERT+LSA)+ALS协同过滤+FAISS向量检索

技术栈最广、Bert-Chinese+FAISS+ALS、4000万 OOM


第四阶段:金融 & 大模型探索(2023.09 - 2024.06)

项目

一句话

核心能力

14-金融营销

银行信贷双模型(意向预测+审核通过率),XGBoost/LightGBM + pandas_udf 分布式推理

broadcast 模型分发、fake/origin label 双模式、180+维金融特征

15-教育

教育行业多个子项目:斑马/作业帮/少年得到/老年课

DIN 深度兴趣网络(PyTorch 自实现)、DeepFM(deepctr_torch)、LabelEncoder Unknown 处理

17-商品分期

商品分期多模态 Embedding,FastText+Node2Vec+GraphFrames 三路线

FastText subword、属性图谱、Spark GraphFrames 探索

16-家装

家装意向人群模型 + DeepFM 从零手写 + gRPC/LLM SKU标题解析

自实现 DeepFM、ChatRhino LLM、gRPC


第五阶段:LLM 应用 & AI Agent(2024.07 - 2025.09)

项目

一句话

核心能力

19-AI质检

SCRM 客服对话三模态 AI 质检系统:文本(BERT/Rasa/LLM)+图片(Qwen2.5-VL)+语音(FunASR)

多模型协作、Ray分布式、BERT→FastText、Cosine Sim Loss、标训一体 Pipeline

20-腾讯云服务器

腾讯云服务器部署 AI Agent 质检系统:CoT 决策树+多级 Prompt 分流+电话话术审核

FastAPI 在线服务、CoT 推理、5版 Prompt 迭代、BGE-reranker+difflib、Xinference 部署

20标训一体

LlamaFactory SFT Qwen3-8B 全自动训练管道:标注→训练→导出→评估

LlamaFactory LoRA、四级推理级联、训练日志 0.45→0.94 F1、数据崩溃→恢复故事


第六阶段:AI 培训对话引擎(2025.11 - 2026.07)

项目

一句话

核心能力

21-AI陪练对话引擎

LangGraph 状态机+DeepSeek 驱动的多模式 AI 培训对话引擎 + 安全沙箱

LangGraph 7路由状态机、自研 AsyncVanillaRedisSaver、四模态流式 SSE、三层容错、Python 3.13+uv+Ruff+pytest 80%


能力矩阵总结

                    数据工程  ML建模  因果推断  Embedding  深度学习  LLM/SFT  后端工程
0-特征预处理         ████████  ████     ░░░░░░   ░░░░░░     ░░░░░░    ░░░░░░    ░░░░░░
3-cvr_brand/shop     ████     ████████  ░░░░░░   ██████     ████      ░░░░░░    ░░░░░░
4-uplift_model       ████     ██████    ████████ ░░░░░░     ░░░░░░    ░░░░░░    ░░░░░░
12-hair_transplant   ████     ██████    ░░░░░░   ████████   ████      ░░░░░░    ░░░░░░
14-金融营销           ████     ████████  ░░░░░░   ░░░░░░     ██████    ░░░░░░    ░░░░░░
15-教育(DIN/DeepFM)  ████     ██████    ░░░░░░   ████       ████████  ░░░░░░    ░░░░░░
17-分期商品           ████     ░░░░░░    ░░░░░░   ████████   ████      ░░░░░░    ░░░░░░
19-AI质检             ████     ██████    ░░░░░░   ████       ████      ██████    ████
20-腾讯云             ████     ████      ░░░░░░   ░░░░░░     ░░░░░░    ████████  ██████
20标训一体            ████     ░░░░░░    ░░░░░░   ░░░░░░     ░░░░░░    ████████  ██████
AI培训             ░░░░░░   ░░░░░░    ░░░░░░   ░░░░░░     ░░░░░░    ██████    ████████

技术栈轨迹:数据工程 → ML 建模 → 因果推断 → 多模态 Embedding → 深度学习 → LLM 应用/SFT → 生产级后端服务。

一句话总结:从用 PySpark 处理日志的数据工程师,成长为能独立部署大模型、做 SFT、搭 LangGraph 状态机、写 80% 覆盖率生产级代码的 全栈 ML/LLM 工程师


我让AI总结几个场景,从故事叙事角度写下工作经历,我觉得总结得也不错。

2、核心工作叙事

场景 1:数据基建故事 — "从亿级日志到结构化特征"

时间跨度:2022.02 - 2022.08
核心项目:0-特征预处理 + 7-平台标签建设
岗位匹配:数据工程 / ML 平台 / 特征工程

故事线:
  我刚入团队时,面临的第一个挑战是把散落在多个 ODS 表里的浏览、加购、下单
  日志变成下游模型能直接消费的特征表。数据量是日均亿级,而且浏览日志和加购
  日志的字段结构完全不同。

  我设计了一个四层架构——ODS 原始层只做读取,明细预处理层做清洗和标准化,
  统计聚合层按用户×类目维度做多粒度聚合,画像宽表层做多源特征融合。每一层
  产出一张独立的 Hive ORC 分区表,层与层之间解耦,任何一层出问题不牵连上下游。

  这个架构后来成了团队的标准范式。我把 View/AddCart/Order 三种行为的聚合
  逻辑抽象成了一个 OOP 基类,三种行为各自继承——这让我后来能在多个营销项目里
  复用同一套代码框架。

场景 2:模型进化故事 — "从 RF 到 DIN 到 LLM SFT"

时间跨度:2022.08 - 2025.09
核心项目:CVR预估 → DIN自实现 → 文本Embedding → LlamaFactory SFT
岗位匹配:推荐算法 / NLP / LLM 应用

故事线:
  我的模型能力进化路线非常清晰——四代升级。

  第一代是传统 ML。用 Spark MLlib 的 GBT/RF 跑 CVR 预估,多模型对比选型,
  解决正负样本 1:290 的不平衡问题。这个阶段让我建立了"模型不是越复杂越好"
  的判断力——在 B2B 场景下树模型比深度学习更合适。

  第二代是深度学习。我自己用 PyTorch 实现了阿里巴巴的 DIN 模型——核心是
  Target Attention,让推荐目标动态加权 历史 SKU 的 Embedding。
  自实现了 Dice 激活函数,区别于标准 ReLU。还在教育场景用 deepctr_torch
  跑了 DeepFM,在家装场景从零手写了 DeepFM 的 FM+DNN 结构。

  第三代是 Embedding 探索。不再满足于低维 Word2Vec——在白酒分期优惠项目里并行探索了
  FastText subword(解决中文 OOV)+ Node2Vec 属性图谱(解决冷启动)+
  GraphFrames 图结构三条路线,理解了不同上下游文的适用边界。

  第四代是 LLM 时代。用 LlamaFactory 对 Qwen3-8B 做 LoRA SFT,把标注→
  训练→导出→评估做成全自动 Shell 管道。从传统 ML 到 LLM SFT,四代升级
  让我理解的不只是怎么训模型,而是"什么场景用什么模型"的判断力。

场景 3:LLM 落地故事 — "从调 API 到自己部署+SFT"

时间跨度:2024.07 - 2025.09
核心项目:19-AI质检 + 20标训一体
岗位匹配:LLM 应用 / MLOps / AI Agent

故事线:
  2024年中,我开始用 LLM 做客服质检。最初的想法很简单——用 Prompt 让大模型
  判断客服对话是否违规。但很快发现三个问题:

  第一,Prompt 不是写一次就完事的。一开始的 Prompt 只有简单定义,准确率很低。
  然后加了详细定义和正负面示例,准确率提升但遇到了边界 case——把正常投诉判为
  品牌舆情。接着加了"豁免规则"——"客户主动提供不算数据泄露""内部链接不违规"。
  最后发现 Prompt 太长 LLM 会忽略尾部规则,于是拆成了 5 个专项子 Prompt,
  每个短小精准。前前后后迭代了 5 版。

  第二,调 API 太贵。全量走大模型每天要花 6 元。我设计了四级推理级联——关键词
  规则做毫秒级初筛,BERT 做 50ms 粗筛,内容安全接口做 200ms 审核,只有 20%
  的困难样本才进入 Qwen SFT。成本从 6 元降到 1 元。

  第三,真正让我有成就感的是把整个流程自动化了。我把"从 S3 下载标注数据 →
  Alpaca 格式转换 → LlamaFactory LoRA 微调 Qwen3-8B → 模型导出 →
  sklearn 评估"做成了一个 Shell 脚本,每天自动执行。中间遇到过数据格式变化
  导致 accuracy 从 71% 暴跌到 45% 的事故——追查发现是新增标注数据的标签标准
  变了。清洗数据后恢复到了 94%。这个故事让我成了团队里"能从头到尾搞定 LLM
  落地"的人。

3、岗位赛道和竞争力分析

接下来更好玩的来,我让AI结合我的项目经历,从专业面试官或招聘HR的角度给我做个职业赛道和竞争力分析。这是它给出的分析结果:

赛道全景

                    匹配度
                       ↑
                90%+   │  ★ ML平台/数据工程
                       │  ★ LLM应用/Agent开发
                80%+   │  ★ 增长ML/营销算法
                       │  ★ 搜索推荐(偏召回/Embedding)
                60%+   │  ★ 搜索推荐(偏排序)
                       │
                       └──────────────────────────→ 薪资天花板
                          中                  高

赛道 1:ML 平台 / 数据工程 / MLOps

匹配度:90%+

这是你最对口的赛道,也是面试通过率最高的方向。

为什么匹配

  • 你做了整整 4 年的特征工程和 ML Pipeline,从四层架构到 OOP 框架到 v1→v3 配置化演进到 pytest 80% 覆盖率——这是一个完整的数据→特征→模型→工程的进化故事
  • 同一个框架复用 5+ 品类,证明你能做平台化抽象
  • 标训一体自动 SFT 管道是 MLOps 的完美案例
  • 自研 AsyncVanillaRedisSaver 证明你能解决基础设施兼容性问题

核心竞争力

"我不仅能搭 ML 流水线,还经历过从 Notebook 脚本→模块化→配置化→生产级工程规范的完整进化。我知道每个阶段该投入什么、该牺牲什么。"

目标公司

字节(数据平台/ML Infra)、阿里(DataWorks/PAI)、腾讯、美团、京东内部转岗、各类做 ML 平台的中厂

薪资天花板:中等偏上。ML 平台不像算法研究员薪资那么极端,但需求稳定,不太受"大模型会不会替代 ML 工程师"的焦虑影响。

面试策略:主讲场景 4(工程成熟度)+ 场景 5(跨域复用),场景 1(数据基建)作为基本功佐证。


赛道 2:LLM 应用 / AI Agent 开发

匹配度:90%+

这是你2025-2026 年最热门的赛道,也是最能发挥最近两年积累的方向。

为什么匹配

  • 你做了完整的 LLM 落地闭环:Prompt 工程 迭代 → LlamaFactory LoRA SFT → vLLM 部署 → 推理级联
  • 标训一体全自动 Shell 管道:标注→训练→评估→部署的完整自动化
  • LangGraph 状态机 + 自研 RedisSaver + CoT 决策树——这些是 Agent 开发的核心能力
  • AI培训 的 4 模态 SSE + 三层容错 = 生产级 LLM 服务

核心竞争力

"我不是只会调 API——我自己部署模型、自己做 SFT、自己搭建推理管道、自己处理线上事故。从调 Prompt 到 LoRA 微调到 vLLM 部署,全链路都做过。"

目标公司

字节(豆包/Coze)、阿里(通义/百炼)、Minimax、智谱、Kimi、百川、各类做大模型应用的中小厂

薪资天花板:高。2025-2026 年 LLM 应用工程师供不应求,有 SFT 经验的更稀缺。

面试策略:主讲场景 3(LLM 落地)+ 场景 4(工程成熟度)。强调 71%→45%→94% 的 SFT 迭代故事——这比单纯说"我做过 SFT"有说服力得多。

风险提示:这个赛道卷得也快。你需要在面试中主动区分自己——不是"会写 Prompt 的人",而是"能把 LLM 做成生产级系统的人"。你的工程规范(pytest 80%、Docker、Langfuse)就是最好的区分器。


赛道 3:增长 ML / 营销算法

匹配度:80%+

这是你业务价值最容易讲清楚的赛道。

为什么匹配

  • CVR 预估(品牌/店铺/宠物健康/电信合约机)——最核心的增长模型
  • Uplift 增益模型——从"预测谁转化"升级到"识别谁因干预才转化"
  • B2B 企业购 GMV 分档——从"预测买不买"到"预测买多少"
  • 白酒/教育——垂直行业增长模型
  • 广告归因——曝光→点击→下单的归因链路

核心竞争力

"我做过从 CVR 预测到 Uplift 增益的完整升级。普通增长 ML 工程师只会做'预测谁会转化',我知道怎么回答'干预有没有增量价值'这个问题。"

目标公司

字节(广告/增长)、快手(商业化)、美团(到家增长)、拼多多、小红书、各类电商/金融的增长团队

薪资天花板:高。增长直接挂钩 GMV/ROI,是公司最愿意砸钱的 ML 方向之一。

面试策略:主讲场景 2(模型进化)+ 场景 5(跨域复用)。Uplift 作为"差异化核武器"——大多数增长 ML 候选人没做过因果推断。

风险提示:你的深度学习排序模型经验(DIN 是单机 PyTorch,没有分布式训练)可能在大厂核心广告组面试中被挑战。如果面字节广告,建议提前补 DeepFM/DCN-v2 原理 + 大规模稀疏 Embedding 训练。


赛道 4:搜索推荐 — 偏召回/Embedding/向量检索

匹配度:75%+

为什么匹配

  • Word2Vec → FastText subword → Node2Vec 图谱 → BERT-Chinese → FAISS 向量检索
  • 4000 万用户向量的 FAISS 索引搭建
  • ALS 协同过滤 → FAISS look-alike 扩量
  • 三条 Embedding 路线并行验证——行为共现 vs 属性结构 vs 图拓扑

核心竞争力

"我对 Embedding 的理解不是只调 Word2Vec——我探索过行为共现、属性图谱和向量检索三种路线,知道每种范式的适用边界和冷启动表现。"

目标公司

字节(抖音推荐/搜索)、小红书(社区推荐)、B站(视频推荐)、知乎(内容推荐)、各类做推荐的中厂

薪资天花板:高。

面试策略:主讲场景 2(Embedding 三代升级)+ 场景 5(多场景复用)。DIN 作为"排序能力"的佐证。

风险提示:你的推荐排序经验偏浅——没有做过大规模分布式训练的深度排序模型。如果面字节抖音推荐核心组,需要补 YouTube DNN、DCN-v2、多目标排序(MMOE/PLE)。但如果面偏召回/Embedding 的岗,你的竞争力非常强。


赛道 5:搜索推荐 — 偏排序/CTR 预估

匹配度:60%+

为什么匹配度较低

  • 深度排序模型经验有限:DIN 是单机 PyTorch 实现,没有工业级分布式训练经验
  • 没有做过大规模稀疏 Embedding(Parameter Server 存 Embedding)
  • 没有 TensorFlow 分布式训练(TFRecord + Horovod/PS)
  • 没有在线模型服务经验(TF Serving/Triton)

如果一定要面这个方向

你的竞争策略不是硬拼"我会 DCN-v2/DLRM",而是打差异化——"我有完整的特征工程→模型训练→因果评估链路,而且我做过 Uplift 我知道怎么评估增量价值"。

目标公司:增长 ML(更容易进)→ 内部转推荐(有了推荐经验再跳)。

薪资天花板:最高,但门槛也最高。


最终推荐

优先级赛道匹配度理由
第一志愿LLM 应用 / Agent 开发90%+最新最热,你的 SFT+标训一体+LangGraph 是最强弹药
第二志愿ML 平台 / MLOps90%+最稳,4 年积累的所有工程能力都能用上
第三志愿增长 ML / 营销算法80%+Uplift 差异化 + CVR 经验丰富
备选搜索推荐(召回/Embedding)75%+Embedding 深度是优势,排序经验是短板

4、AI时代下的竞争力分析

在AI Agent时代,我哪些项目经历还有竞争力,哪些已经不具备竞争力了,如果要面试的话,应该往哪个方向去努力?

竞争力重新评估

AI Agent 时代(2025-2026)的核心变化:LLM 取代了大量传统 ML 的"胶水代码"工作,但对系统设计、工程规范、评估体系的要求反而更高了。


依然有竞争力(甚至更强)

项目竞争力变化理由
Joy Learning DialogueLangGraph 状态机 = Agent 编排的核心范式。自研 RedisSaver = Agent 记忆系统的基础设施。三层容错 = Agent 可靠性的关键。这个项目越往后越值钱
SCRM LLM 质检 & 标训一体SFT + Prompt 工程 + 四级级联 = Agent 时代的核心技能。"标注→训练→部署"自动化 = Agent 持续优化的基础设施
文本/行为序列 EmbeddingRAG 和 Agent 工具调用都依赖高质量 Embedding。你的三条路线探索是 Agent 知识检索的基础能力
DIN 自实现Target Attention 原理不会过时。Agent 的上下文理解本质上也是"动态加权历史信息"

竞争力下降(但不归零)

项目竞争力变化理由
CVR 预估(RF/GBT)传统树模型的 CVR 预估正在被 LLM-based 方案替代。但"样本构造"和"正负样本平衡"的经验仍然有用——Agent 评估也需要处理不平衡数据
OOP 框架复用框架设计能力本身不会过时,但 PySpark ML Pipeline 的具体实现正在被 LangChain/LangGraph 替代
特征工程(四层架构)手工特征工程正在被 LLM 的端到端理解替代。但数据管道的架构思维(分层/解耦/分区管理)仍然通用

已经不具备竞争力

项目理由
图片标注Agent 能自动完成
BI 看板SQL 报表,已被自然语言查询工具替代
pushHTTP API 管道,Agent 工具调用替代
Scala 广告归因虽是因果归因但对 Agent 时代没有延续价值

面向 Agent 时代,你的发力方向

方向 1:Agent 系统设计 — 你最应该深耕的方向

为什么:你已经在做 LangGraph 状态机了。Agent 的"感知→推理→决策→执行"循环本质上就是状态机。你的自研 RedisSaver(Agent 记忆)、四模态流式 SSE(Agent 交互)、三层容错(Agent 可靠性)都是 Agent 时代的硬通货。

要补的

  • Agent 评估体系(AgentBench/SWE-bench 等,不只是 accuracy)
  • Multi-Agent 编排(多 Agent 协作/竞争/投票)
  • Agent 工具调用(Function Calling 的设计规范)
  • Human-in-the-Loop(人在回路中的 Agent 设计)

面试弹药:把 Joy Learning Dialogue 包装成 Agent 案例。"我不是只做了对话——我做了状态管理、记忆持久化、流式交互、容错降级。这些都是 Agent 系统的核心基础设施。"


方向 2:LLM 评估与数据飞轮 — 差异化优势

为什么:Agent 时代最大的瓶颈不是"怎么让 LLM 更聪明",而是"怎么评估 LLM 的输出质量"和"怎么持续优化"。你的标训一体管道正是解决这个问题——自动标注→自动训练→自动评估。

要补的

  • LLM-as-Judge 评估方法论(一致性/偏见/成本)
  • 数据飞轮设计(线上 bad case → 标注 → 训练 → 上线)
  • RLHF/DPO 等对齐技术原理(不需要亲手做过,但需要能讲清楚)

面试弹药:"我做过从 0 到 1 的 LLM 系统,最让我骄傲的不是模型本身,而是我把评估和迭代自动化了。Agent 时代真正的壁垒不是模型,是谁有更好的数据飞轮。"


方向 3:RAG 与知识检索 — 用你已有的 Embedding 能力切入

为什么:你的 Embedding 深度(Word2Vec→FastText→Node2Vec→BERT→FAISS)可以直接迁移到 RAG 的知识检索、Agent 的上下文检索。Embedding 是 Agent 的核心组件,不是过时的技术。

要补的

  • 多向量/多模态检索(文本+图片混合检索)
  • Reranker(用 LLM 做检索结果的精排)
  • GraphRAG(知识图谱增强的 RAG——你的 Node2Vec 经验是很好的基础)

面试弹药:"我对 Embedding 的理解不是停留在调 Word2Vec——我探索过文本语义、属性结构、图拓扑三种 Embedding 范式。Agent 的知识检索需要的正是这种对不同 Embedding 适用场景的判断力。"


面试策略建议

你的定位口号

"Agent 系统工程师 — 从状态机设计到记忆系统到评估体系到数据飞轮,全链路都做过。"

面试时的项目讲述优先级

第一优先级(Agent 核心能力):
  AI培训对话引擎          → 状态机 + 记忆 + 流式 + 容错
  SCRM 标训一体          → SFT + 评估 + 数据飞轮

第二优先级(Agent 支撑能力):
  文本 Embedding          → 知识检索基础
  电商特征工程             → 数据管道架构

可跳过:
  CVR 预估(RF/GBT)     → 除非面试官追问"你做过传统 ML 吗"
  DIN 自实现             → 除非面推荐岗

三个"Agent 时代面试必问题"的预演

必问题 1:你觉得一个好的 Agent 系统应该具备什么特征?

"四个特征:一是状态管理——Agent 需要记住多轮交互的上下文,不只是 Prompt 里塞历史消息,而是结构化的状态追踪(我做 LangGraph 时深有体会);二是容错设计——LLM 输出不可靠,每一层都要有降级方案(我的三层容错就是做这个);三是评估体系——不是离线指标,而是持续的数据飞轮(我的标训一体);四是工具编排——Agent 的能力上限取决于它能调用什么工具,以及如何编排这些工具的调用顺序。"

必问题 2:你怎么评估 LLM/Agent 的质量?

"我经历过从只看离线指标到建立评估体系的转变。在质检项目中,我发现离线 F1=0.94 不等于线上好用——因为训练数据本身有标注偏差。后来我做了三件事:一是定期人工抽检验证集样本做 Gold Set;二是按真实日期拆分验证集(周四的数据做 test),比随机拆分更能暴露数据漂移;三是建立了从 bad case 到数据清洗到重新 SFT 的迭代闭环。Agent 时代的评估不是一次性的事,而是一个持续运转的数据飞轮。"

必问题 3:Agent 的可靠性和成本怎么平衡?

"我做过一个很有效的实践:四级推理级联。简单问题用规则(毫秒),中等问题用小模型(50ms),困难问题才进大模型(500ms)。80% 的流量在前两级就被拦截了,成本降到原来的 1/6。这个思路对 Agent 同样适用——不是所有请求都需要调用最贵的模型、做最复杂的推理链。关键在于设计一个可靠的'复杂度判定'机制,让简单请求走快通道。"


一句话总结

Agent 时代没有让你的经验贬值——它只是让"调包式 ML"贬值了。你的系统设计能力(状态机/容错/数据飞轮)反而更值钱,因为 Agent 时代最大的挑战不是"让 LLM 变聪明",而是"让 LLM 可靠、可控、可评估"。你应该把自己定位为"Agent 系统工程师"而不是"ML 算法工程师",这是两个职业方向的分水岭。


真是一场酣畅淋漓的个人职场能力的深度剖析!!

AI时代带来的巨大技术冲击让以往具有竞争力的机器学习、深度学习、特征工程、数据挖掘、营销算法通通削弱了竞争力。以往可以凭借机器学习/搜推广告营销算法这些技术晋升,现在时代过去了,这些已经不再是竞争力,它带来的个人竞争力在AI时代的巨轮下被碾得粉碎,不再具有值得自豪的价值!曾经机器学习带来的巨大时代红利已经彻底过去了。

现在是AI的时代,要乘的东风是AI、是Agent、是大模型,若在这个时代红利期还不能吃上这口红利,风口过去,只剩下一片狼藉,技术也将失去了其加持价值,比如技术红利带来的晋升、加薪。抓住时代的机遇、抓住时代赋予的机会!机会稍纵即逝,五年吃红利的绝佳窗口期,五年末尾窗口收敛期,差不多十年技术红利期就完全过去了。

正如2013年-2024年这十年。2013-2019年,大数据技术、机器学习、深度学习的5-6年红利期,2020-2024年,机器学习、深度学习最后的4-5年红利期。2025年-2026年开始AI技术爆发,开始了它新一轮的红利周期,而深度学习、机器学习可以说彻底结束了其红利时代。不可以慢,慢意味着吃到红利的时间延后,而时间延后可能意味着错过红利窗口期,最后一口红利都没吃到,眼睁睁看着时代的技术红利过去!

刚毕业新进入职场的校招生不需要从大数据时代的技术开始学起,甚至也不需要学习机器学习、深度学习时代的技术,因为就算学了也没有实践落地的场景,不过是浪费时间和精力罢了。他们直接从AI时代的Agent技术开始学起!这是摆在他们面前的业务问题。就像2014年毕业加入职场的人,也不需要学习如何用python\php单机分批处理数据一样,他们直接使用HIVE \ Spark来分布式处理上百G数十T的大数据,因为那时候已经是大数据技术成熟的时代了!

2004年毕业,写了十年python处理数据的职场老人,和2014年刚毕业的职场新人,在面对hive/spark、mapreduce分布式处理大数据技术时,站在了同一个起跑线上。之前十年的代码技术,在分布式大数据处理技术面前,不能说是毫无价值,只能说没有多少领先优势。

2006年毕业,写了十年机器学习算法、用python sklearning职场老人,和2016年刚毕业就遇到spark大数据处理、ML、DL深度学习技术发展突破的职场新人又站在了同一个起点上。这时候的新人几乎不用再学sklearning,因为在这个时代技术下根本用不上,他们只需要学spark、tensorflow、torch、keras就足够胜任工作,而且业务场景也要求他们学这些。

2014年毕业,一路从hive\spark\tensorflow\大数据\机器学习\深度学习学过来的十年职场老人,在2025年又和刚毕业的职场新人站在了同一个起跑线。他们都要开始学Agent开发、学LLM、学提示词工程、学智能体设计,学用AI coding。他们不用从头学机器学习技术,因为那已经毫无竞争力。

时代淘汰的技术,会被人们毫不客气的抛弃。技术红利时代学到的技术能力,会在下一个技术袭来后彻底丧失其价值。这就是我从2014年到2026年这十二年间经历的真实现状,经历的真切感受。


5、如何制定学习计划,补齐AI能力?

在AI时代,为了提升自己的技术竞争力,我该如何设置成长路径?制定学习目标和计划?

结合你的现有能力基座和差距分析,制定一个 12 个月的分阶段成长计划。


你的起点

已有基座:
  ████████  PySpark/数据工程        ← 4年经验,硬通货
  ████████  LLM部署+SFT             ← 自己部署+微调过
  ████████  LangGraph状态机         ← Agent基础设施
  ██████    传统ML (RF/GBT/XGB)     ← 工业落地经验丰富
  ██████    Embedding深度           ← 文本/属性/图三范式
  ██████    工程规范                ← pytest, Docker, uv
  ████      深度学习                 ← DIN自实现,但全是单机
  ███       多Agent编排              ← 几乎为零
  ██        分布式训练               ← 几乎为零
  ██        RLHF/对齐               ← 探索过但没完成
  ██        RAG/GraphRAG            ← Embedding基础好但没系统做过

12 个月成长路径

        Q1                 Q2                 Q3                 Q4
   ──────────────    ──────────────    ──────────────    ──────────────
   │                                                                  │
   │  补齐Agent       Multi-Agent      RAG+知识检索      RLHF+对齐     │
   │  系统设计        编排能力          体系化            能力建立       │
   │                                                                  │
   ▼                                                                  ▼
  深度Agent工程师 ──→ Agent系统架构师 ──→ 知识Agent专家 ──→ LLM对齐工程师

Q1:补齐 Agent 系统设计能力(1-3月)

目标:从"会搭 LangGraph"到"能设计完整的 Agent 系统"。

学习内容

周1-2:Agent 理论地基
  □ 读 Lilian Weng 的 Agent 博客系列(Planning / Memory / Tool Use)
  □ 读 Anthropic 的 "Building Effective Agents" 指南
  □ 理解 ReAct / Plan-and-Execute / Reflexion 三种 Agent 模式的差异

周3-4:Agent 记忆系统
  □ 实现三种记忆:短期(Redis/消息窗口)、长期(向量数据库摘要)、工作记忆(状态机)
  □ 对比 LangGraph checkpoint vs Mem0 vs Zep 的优劣
  □ 你的 AsyncVanillaRedisSaver 是短期记忆,补上长期记忆(摘要+检索)

周5-6:Agent 工具调用
  □ 设计一套 Function Calling 规范(参数校验/错误处理/超时重试/降级策略)
  □ 实现 Tool Retry(工具调用失败后的自动重试+换工具)
  □ 对比 OpenAI Function Calling vs Anthropic Tool Use vs LangChain Tool

周7-8:Agent 评估体系
  □ 读 "AgentBench" 和 "SWE-bench" 论文
  □ 为你的 SCRM 质检 Agent 设计一套评估体系(不只 F1,加鲁棒性/延迟/成本/幻觉率)
  □ 实现 LLM-as-Judge 评估 + 人工抽检对标

周9-12:实战 — 把你的 SCRM 质检升级为完整 Agent
  □ 加入工具调用(查询订单系统、查询用户信息)
  □ 加入记忆(记住这个客户之前被误判过的case)
  □ 加入反思(判断结果不确定时二次推理)
  □ 写一份 Agent 设计文档(状态机图+工具列表+评估指标+降级策略)

产出

1. 一份 Agent 设计文档(可展示给面试官)
2. 升级后的 SCRM Agent(工具调用+记忆+反思)
3. 一套 Agent 评估脚本(LLM-as-Judge + 人工对标)

Q2:Multi-Agent 编排能力(4-6月)

目标:从"单 Agent"到"多 Agent 协作"。

学习内容

周1-3:Multi-Agent 理论
  □ 读 AutoGen / CrewAI / LangGraph Multi-Agent 的文档
  □ 理解四种多 Agent 模式:
    - 顺序流水线(Agent A → Agent B → Agent C)
    - 辩论模式(多Agent独立回答→投票/评判)
    - 分层模式(Manager Agent分发任务→Worker Agent执行)
    - 竞争模式(多Agent同时尝试→最优结果胜出)

周4-6:实现两个 Multi-Agent Demo
  □ Demo 1:代码审查 Agent 团队
    - Architect Agent(分析需求)
    - Coder Agent(写代码)
    - Reviewer Agent(审查代码)
    - Tester Agent(写测试)
  □ Demo 2:客服质检辩论 Agent
    - Agent A 初判 → Agent B 质疑 → Agent C 终裁
    - 对比单 Agent 和多 Agent 辩论的准确率差异

周7-8:Multi-Agent 的工程挑战
  □ Agent 间通信协议设计(共享内存 vs 消息传递 vs 黑板模式)
  □ 并发控制(多Agent并行vs串行的trade-off)
  □ 死锁检测(Agent A等Agent B的结果,Agent B等Agent A的输入)

周9-12:实战 — Joy Learning 升级为 Multi-Agent
  □ 拆分当前单一状态机为三个 Agent:
    - 出题 Agent(负责生成合适的训练题目)
    - 陪练 Agent(负责对话交互)
    - 评估 Agent(负责打分和反馈)
  □ 三个 Agent 通过共享状态机协作

产出

1. 两个 Multi-Agent Demo(可放到 GitHub)
2. 升级后的 Joy Learning(Multi-Agent 版本)
3. 一份 Multi-Agent 通信协议设计笔记

Q3:RAG + 知识检索体系化(7-9月)

目标:把你已有的 Embedding 能力升级为系统的 RAG 方法论。

学习内容

周1-3:RAG 理论全貌
  □ 读 LlamaIndex 和 LangChain RAG 的文档
  □ 理解 RAG 的 5 个阶段:Indexing → Retrieval → Augmentation → Generation → Evaluation
  □ 理解 Chunking 策略(固定大小/语义分块/递归分块/Agent式分块)
  □ 理解 RAG 评估:Faithfulness / Answer Relevance / Context Relevance

周4-6:高级 RAG 技术
  □ 实现三种检索策略:
    - 稠密检索(你的 BERT/FastText Embedding → FAISS)
    - 稀疏检索(BM25,关键词精确匹配)
    - 混合检索(稠密+稀疏 → Reranker融合)  ← 这个你做过(BGE-reranker+difflib)
  □ 实现 Self-RAG(LLM 检索后自我反思"检索到的内容是否足够")
  □ 实现 Corrective RAG(检索不够时自动改写 Query 重新检索)

周7-9:GraphRAG
  □ 读微软 GraphRAG 论文
  □ 理解知识图谱 + RAG 的结合方式
  □ 你的 Node2Vec 属性图谱经验可以直接迁移——
    把 SKU 属性图换成"实体关系图",Node2Vec 换成 GraphRAG 的社区发现
  □ 实现一个 Demo:用 GraphRAG 回答"京东白酒品类里,酱香型和浓香型的客群画像有什么区别"

周10-12:多模态 RAG
  □ 文本+图片+表格混合检索
  □ 你的 Qwen2.5-VL 经验 + Embedding 经验 = 多模态 RAG 的完整基础
  □ 实现多模态 RAG Demo:用户上传一张商品图 → 检索相似商品 + 描述差异

产出

1. 一个完整的 RAG 系统(混合检索+Reranker+Self-RAG)
2. 一个 GraphRAG Demo
3. 一个多模态 RAG Demo

Q4:RLHF/对齐 + 分布式基础(10-12月)

目标:建立大模型对齐能力,补齐分布式短板。

学习内容

周1-4:对齐理论
  □ 读 InstructGPT (RLHF) 论文
  □ 读 DPO (Direct Preference Optimization) 论文
  □ 读 Anthropic 的 Constitutional AI 论文
  □ 理解 RLHF 四阶段:SFT → Reward Model → PPO → 迭代
  □ 理解 DPO 如何简化 RLHF(不需要显式训练 Reward Model)
  □ 你在 verl/ 里已经有 DQN + Reward Model 的框架,正好补上完整流程

周5-8:DPO 实战
  □ 用 HuggingFace TRL 库跑一个 DPO 训练
  □ 训练数据构造:选 200 条对话,对每条生成 2 个回复(好 vs 差)
  □ 对比 SFT 和 DPO 的效果差异
  □ 你的 SCRM 质检是完美的 DPO 场景——
    "违规→不违规"的误判是 preference 信号

周9-10:分布式训练基础
  □ 理解数据并行 (DDP) vs 模型并行 (Tensor Parallel/Pipeline Parallel)
  □ 理解 DeepSpeed ZeRO 的三个阶段
  □ 用 DeepSpeed 跑一次多卡训练(哪怕只是 2 卡)
  □ 目标:能讲清楚"什么时候用 DDP,什么时候用 ZeRO-3"

周11-12:算力规划能力
  □ 理解 GPU 显存计算:模型参数×dtype + 优化器状态 + 激活值
  □ 能根据模型大小和 batch size 估算所需 GPU 数量
  □ 能回答面试题:"Qwen-7B 全量微调需要多少 GPU 显存?LoRA 呢?"

产出

1. 一份 DPO 训练实验报告(SFT vs DPO 效果对比)
2. 一个 DeepSpeed 多卡训练的 Demo
3. 一份 GPU 显存估算的 Cheat Sheet

12 个月后的你

能力矩阵:

████████  Agent 系统设计        ← Q1 补上,从 LangGraph → 完整 Agent
████████  Multi-Agent 编排      ← Q2 补上,从单Agent → 多Agent协作
████████  RAG/GraphRAG          ← Q3 补上,从Embedding → 知识检索体系
████████  RLHF/DPO 对齐         ← Q4 补上,从SFT → 完整对齐能力
████████  LLM部署+SFT           ← 已有,保持
████████  PySpark/数据工程       ← 已有,保持
██████    分布式训练基础          ← Q4 补上
██████    工程规范               ← 已有,保持

定位口号升级

Q1 结束时:"Agent 系统工程师 — 能独立设计完整的 Agent 系统" Q2 结束时:"Agent 架构师 — 能设计多 Agent 协作系统" Q3 结束时:"知识 Agent 专家 — 能构建带知识检索的智能 Agent" Q4 结束时:"LLM 对齐工程师 — 能从头构建 SFT→DPO→评估 的完整飞轮"


学习节奏建议

每周时间分配:
  ████████ 工作项目(40h)     ← 在工作中实践(AI learning 就是最好的练手场)
  ████     理论学习(4-6h)    ← 周末集中读论文/文档
  ████     动手实践(4-6h)    ← 周末写 Demo
  ██       输出总结(2h)       ← 每周写一篇学习笔记(公开或私密)

每月产出:
  □ 1 篇技术博客/笔记(读的论文,做的实验,踩的坑)
  □ 1 个 GitHub Demo(即使只有自己看)
  □ 1 次模拟面试(对着镜子讲你新学的概念)

核心原则:不是"学完再找工作",而是"边学边练边面"。你的 AI Learning 对话引擎 项目就是最好的练手场——把 Q1-Q4 学到的 Agent 能力全部实现在这个项目里,三个月后面试时它就是你的"完整 Agent 作品集"。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值