AI 工程师路线
目标:从「数学焦虑、只会调库」到能独立完成一条 AI 流水线——选模型、拿数据、训练或检索、评估、上线并持续改进。这份路线把本站已收录的 AI 笔记串成一条可执行主线,并如实指出:AI 领域现在更像「工程 + 科学」的混合体,动手、留痕、评测远比囤课重要。
建议用法:每到一个阶段,先读本页对应章节 → 按链接进站内文档学习 → 完成该阶段的「练习与验收」→ 在过程记录里留一篇学习日志。路线建议自建一个贯穿全程的里程碑项目(下文用「个人学习助手」举例:从数据探索到最终做成一个可问答、可评测的 RAG/Agent 应用),各阶段在它之上做增量。
全景与学习策略
AI 工程有一条贯穿始终的主线——一条管线的五个环节:问题定义 → 数据 → 模型 → 评测 → 上线迭代。无论做经典机器学习还是大模型应用,逃不出这五环。本站文档也是按这条线组织的:
| 阶段 | 主题 | 里程碑产出 | 建议周期(每天 2 小时) | 说明 |
|---|---|---|---|---|
| 阶段一 | Python 与数学基础 | 一份数据探索分析小项目(清洗 + 特征 + 可视化) | 1.5~2 个月 | 数学「够用即可」,重点是工具链与直觉 |
| 阶段二 | 机器学习与深度学习原理 | 复现一个经典模型 + 自有数据集上的训练评估 | 2~3 个月 | 建立损失、优化、评估、防过拟合的完整心智 |
| 阶段三 | PyTorch 与训练工程 | 从零写训练循环 + 一个自训项目(如字符级 Transformer) | 2~3 个月 | 从「调库跑通」到「能排错、能复现」 |
| 阶段四 | LLM:原理 → 应用或微调 → 服务化 | 个人 LLM 应用(RAG 问答 + Agent)或微调模型,评测后上线 | 3~4 个月,之后持续 | 先通原理,再在「应用」与「模型」两赛道选一深耕 |
三条贯穿始终的策略:
- 产出型学习:每个阶段必须有可运行、可评测、可被追问的产出,杜绝「收藏夹学习」;
- 评测闭环:AI 的进步必须用数据说话——每做一个模型或应用,都给出评测集与量化结果,写进过程记录;
- 文档闭环:每学一个主题,回本站对应文档做一次整理/补注,把你实测的数字(loss 曲线、评测分数、推理耗时)回填到页面里。
阶段一:Python 与数学基础
本阶段目标:扫清两个拦路虎——「不会用工具处理数据」与「看不懂公式」。两者都以够用为原则:不啃完数学书才动手,而是在做小项目的过程中补直觉。
知识地图
- [ ] Python 语言:数据模型(魔术方法)、异常与错误处理、装饰器 / 生成器 / 迭代器、类型注解;用 Pydantic 做配置与数据结构校验
- [ ] 数值与数据栈:NumPy(向量化、广播、索引)、Pandas(DataFrame 变换、分组聚合、合并)、可视化库基本画图;Notebook 与脚本的分工习惯
- [ ] 数学「够用」三块:线性代数(向量 / 矩阵 / 内积 / 范数——看懂 loss 表达式与权重的形状)、微积分(导数 / 链式法则 / 梯度——看懂反向传播在干嘛)、概率统计(分布 / 期望 / 条件概率 / 相关性——看懂评测指标与采样)
- [ ] 工程习惯:Git、虚拟环境与包管理、依赖锁定、数据与代码可复现(固定随机种子、记录环境版本)
站内文档闭环
- 语言模块 Python 页:数据模型、装饰器 / 生成器、类型注解与 Pydantic、NumPy / Pandas 速查——本阶段的主修文档
- 机器学习基础的「够用的数学直觉表」一节:先扫读建立地图,细节留到阶段二
- AI 方向目录:通读「已收录」列表,知道后续章节长什么样
练习与验收
- 选一个公开数据集(Titanic / 房价 / 电商订单),完成一份可复现的数据探索报告:缺失值与类型清洗、特征加工、分组聚合与可视化,全部以脚本 + Notebook 呈现;
- 用 NumPy 从零写一次线性回归的最小二乘与梯度下降(先不调 sklearn),把迭代次数与误差画成曲线——机器学习基础页有同源示例(实测输出
y ≈ 2.100x + 0.718),对照你的结果; - 用 Pydantic 为上述流程定义配置与中间数据结构。
验收标准:拿到一份陌生数据敢动手清洗与分析;能看懂一条 loss 表达式里每个符号在代码里对应哪个量;讲得清「为什么要用向量化 / 广播」而非写 for 循环。
常见误区:先花三个月补完数学才动手(正确姿势是「用到哪补到哪」);只看 Python 语法不看数据栈(AI 干活主战场是 NumPy / Pandas);跳过数据清洗直接用脏数据训练——「垃圾进,垃圾出」,这是 AI 界第一铁律。
阶段二:机器学习与深度学习原理
本阶段目标:建立完整的建模工作流心智——任务定义 → 目标函数 → 优化 → 评估 → 防过拟合,并沿着「感知机 → 神经网络 → 卷积 → Transformer」的主线理解模型为什么被设计成这样。这一阶段不追求手推一切公式,但要能看懂训练曲线并解释它的含义。
知识地图
- [ ] 监督学习:回归与分类、线性模型与 L1 / L2 正则、决策树与 Bagging / Boosting 集成、SVM 与 KNN 的适用认知
- [ ] 无监督:KMeans / DBSCAN 聚类、PCA 降维;知道「无标签时能做什么」
- [ ] 评估方法论:偏差-方差权衡、指标速查(准确率 / 精确率 / 召回率 / F1 / AUC)、类别不平衡处理、特征工程与数据泄漏红线(泄漏是隐蔽扣分王)
- [ ] 深度学习主线:反向传播与梯度直觉(链式法则)、激活函数与梯度消失、优化器从 SGD 到 AdamW、BatchNorm / LayerNorm、Dropout 等正则、CNN 直觉、RNN / LSTM / GRU 门控、Transformer 结构(注意力 / 多头 / 位置编码)
- [ ] 文献阅读起步:读论文不是「全文啃」,先读「它解决了什么问题、核心做法、代价与局限」(本站论文笔记模板直接可用)
站内文档闭环
- 机器学习基础:三范式与统一流程、算法图谱、评估指标与类别不平衡、特征工程与防泄漏、端到端工作流清单与踩坑
- 深度学习:反向传播、优化器与 warmup / 余弦退火、BatchNorm / LayerNorm、CNN 结构演进、RNN / LSTM / GRU、Transformer 机制点(注意力 / KV cache / RoPE)、训练工程与踩坑
- 文献收藏经典论文:ResNet、Attention Is All You Need、BERT 的精读卡,与上面两页互链
练习与验收
- 用 sklearn 在一个数据集上同时做回归与分类两任务,报告「用什么指标、为什么、结果说明什么」;
- 用高层库训练一个手写数字识别模型,找出 3 个典型失败样本,分析失败原因(形态、噪声、类别不平衡……);
- 读经典论文中 ResNet 或 Attention 的笔记,用自己的话写一段「它解决了什么问题、关键做法、遗留局限」,贴进过程记录。
验收标准:面对一个新任务能脱口说出「目标函数是什么、评估指标选哪个、最可能的坑在哪」;能解释「训练好但测试差」意味着什么及至少三种对策;能沿着「输出 → 各层 → 输入」讲一遍梯度回传的大致路径。
常见误区:把 sklearn / 框架默认参数当真理,从不问「为什么这个默认值合理」;把数据泄漏当成了提升分数的手段;准确率当唯一指标,遇到类别不平衡直接翻车;跳过原理直接「炼丹」——训练不收敛时连排查方向都没有。
阶段三:PyTorch 与训练工程
本阶段目标:脱离示例模板,能独立用 PyTorch 搭出数据管线 + 训练循环 + 评估 + 保存/恢复的完整工程,并能系统排查「不收敛 / 梯度爆炸 / 显存 OOM」三类经典问题。里程碑产出:一个你自己训练、可复现、能讲清每个设计决策的模型。
知识地图
- [ ] 张量与自动求导:计算图、
requires_grad与梯度累积清零、detach的用途 - [ ] 数据管线:Dataset / DataLoader、batch 与 shuffle、归一化、预处理与缓存;数据加载成为瓶颈时怎么办
- [ ] 训练循环:优化器与学习率调度、AMP 混合精度(正确写法与反模式)、早停与检查点、可复现性(seed、确定性)
- [ ] 分布式认知:DDP 多卡与 FSDP 的适用场景与路线(先单卡跑明白再上)
- [ ] 部署起步:
torch.compile/ ONNX 导出 / 简单服务化推理
站内文档闭环
- PyTorch:张量与广播、自动求导、
nn.Module、Dataset / DataLoader、可直接套用的训练循环、AMP / 早停 / 检查点、DDP 与 FSDP 路线、torch.compile与 ONNX 部署、踩坑清单(示例按 torch 2.4 语境标注) - 深度学习:训练工程一节与本节呼应(AMP、梯度累积、复现性)
- AI 工程化:先预习「显存估算与量化路线」,为阶段四打底
- 文献收藏经典论文:对照论文结构检查你的实现
练习与验收
- 从零实现一个小型字符级 Transformer(单卡可跑):数据加载 → 模型 → 训练 → 采样生成;观察 loss 曲线,故意制造一次不收敛并用踩坑清单的步骤定位;
- 把阶段二的模型用 PyTorch 完整重写:DataLoader + AMP + 检查点 + 早停,训练过程全程留痕(超参表、曲线、失败尝试);
- 写一份训练复盘:哪些超参试过、各自效果、最终结论,贴进过程记录。
验收标准:不查文档能默写训练循环骨架;面对「loss 不降 / 梯度爆炸 / OOM」三个场景能给出按序排查的步骤;能解释 AMP 做了什么、以及它为什么不能盲目全量开启。
常见误区:复制官方示例改两行就宣布「会了」;不记实验日志——每个超参改动都要留痕,否则永远无法收敛;loss 不降就放弃而不是系统排查(数据问题 → 代码 bug → 超参 → 模型结构,按此顺序);单卡都没跑明白就急着上多卡分布式。
阶段四:LLM——原理、赛道与服务化
本阶段目标:先补齐 LLM 原理,再在两条赛道里选一条深耕,最后都落到「能评测、能上线、能算账」:
| 维度 | 赛道 A:LLM 应用工程师 | 赛道 B:模型工程师 |
|---|---|---|
| 核心问题 | 把现成大模型做成可用、可控的产品 | 把模型调得更符合特定任务、跑得更便宜 |
| 主修文档 | Prompt 工程、RAG 与 Agent | 模型微调 |
| 关键技术 | 提示词模式、上下文工程、RAG 管线、Agent 循环、评测与防护 | 数据工程、LoRA / QLoRA、训练框架、评估与上线闭环 |
| 站内配套 | LLM 原理 + AI 工程化 | 同左 |
| 决策参考 | 想贴近产品、交互、业务落地选 A | 想深耕训练、推理性能、底层优化选 B |
无论选哪条,AI 工程化都要学:推理服务(vLLM / Ollama 等)、量化与显存估算、KV cache 与长上下文、成本计量、可观测与评测门禁——这是「Demo」与「能上线的东西」的分界线。
知识地图
- [ ] LLM 原理(共有):BPE 分词、Decoder-only Transformer(因果掩码 / KV cache / RoPE)、预训练与 Scaling、SFT 与 RLHF / DPO 对齐、解码策略、幻觉成因与缓解
- [ ] 赛道 A:提示词模式库与结构化输出、上下文工程与系统提示、RAG 五环管线(加载 → 切分 → 嵌入 → 检索 → 生成)、BM25 / 稠密 / 混合检索、Agent 工具循环与框架、评测(RAGAS / LLM-as-judge)、提示注入防线
- [ ] 赛道 B:微调 vs Prompt vs RAG 的选型决策、数据工程(格式 / 质量 / 负例 / 评测集隔离)、全参 vs LoRA vs QLoRA、训练框架与观测、评估与上线闭环
- [ ] 共用底座:推理框架选型、量化路线(GPTQ / AWQ / GGUF)、显存与成本估算、长上下文工程、OpenTelemetry 可观测与合规清单
- [ ] 前沿追踪:用文献追踪方法建立论文阅读习惯,跟进LLM 前沿笔记
站内文档闭环
- LLM 原理:原理补课 + 推理显存成本估算 + 术语速查
- Prompt 工程:五条原则、模式库、结构化输出、评测迭代、注入防护(赛道 A 起点)
- RAG 与 Agent:选型决策表、管线五环、检索与重排、RAGAS 评测、ReAct 与框架对比、失败模式调试表(赛道 A 主战场)
- 模型微调:决策表、数据工程、LoRA / QLoRA 超参起点、训练实践、评估上线闭环(赛道 B 主战场)
- AI 工程化:推理服务、量化、成本、可观测、安全合规(两条赛道共同收尾)
- 文献收藏:经典论文(原理脉络)、LLM 前沿(追新)、追踪方法(可持续阅读习惯)
练习与验收
- 赛道 A 里程碑:个人学习助手——选一批你熟悉的资料(技术笔记 / 文章),搭 RAG 问答(带引用来源),再接至少一个工具调用做成 Agent 循环;用 RAGAS 或人工金标做一轮评测并迭代;最后做一次提示注入自测并记录防护手段;
- 赛道 B 里程碑:一次真实微调——对一个开源小模型做 LoRA 微调,与基座对比评测(注意评测集隔离),导出并服务化,给出显存占用与推理成本数据;
- 两条赛道共通:对照AI 工程化把产出接入可观测与评测门禁;写一份「为什么选这套方案」(RAG vs 长上下文 vs 微调的取舍);
- 立一个文献追踪习惯:每周读一篇论文并用模板填卡。
验收标准:产出可演示且可被追问——每个组件(为什么用这个嵌入 / 为什么 LoRA / 为什么 4bit 量化)都有依据;有评测数据证明「比基线好」;能报出推理成本与延迟并给出优化方向;知道提示注入、数据泄漏、评测集污染这些红线并做了防护。
常见误区:赛道 A 纯手调 prompt 从不评测;赛道 B 不评估就微调,甚至拿评测集当训练集;把「长上下文」当万能药而不先判断是否该用 RAG;不重视成本与延迟(量化不是可选项);对注入攻击毫无防备;Demo 能跑就宣告完成,从未想过上线后的可观测与降级。
跨路线协同
AI 工程师不该只对着模型,交叉点往往是竞争力:
- 接前端做 AI 产品:Agent 流式输出、对话界面、可视化评测——前端工程师路线打底后,AI 应用的产品化能力会显著加分(前端出身的同学可重点参考其「全栈与内容工程」方向);
- 接后端做 AI 底座:网关、限流、缓存、鉴权、可观测是模型服务上线的地基——后端工程师路线与 AI 工程化天然衔接(后端同学转 AI 的路径最顺);
- 做研究与内容:把论文阅读沉淀成技术内容(本站文献收藏就是范例),长期复利最高。
常见误区与放弃点自检
对照检查自己是否正在踩坑(AI 方向的坑比别的方向更隐蔽,因为「loss 降了」不等于「做对了」):
- [ ] 收藏了上百门课,练习停留在 hello world,数据科学项目永远没跑完一个;
- [ ] 数学焦虑驱动囤课,迟迟不进入数据与模型环节;
- [ ] 用脏数据 / 泄漏特征训练,还拿虚高的分数沾沾自喜;
- [ ] 不写实验日志——超参改来改去,永远不知道什么有效;
- [ ] 评测集与训练数据混用、只挑好结果汇报,产出的「效果」不可复现;
- [ ] 只会用现成大模型 API 拼 Demo,不懂成本、不懂幻觉、不防注入、不建评测。
附录:路线 × 本站文档速查
| 学习主题 | 站内文档 | 建议阶段 |
|---|---|---|
| Python 与数据栈 | Python | 一 |
| 数学直觉与工作流 | 机器学习基础 | 一、二 |
| 机器学习算法 | 机器学习基础 | 二 |
| 深度学习原理 | 深度学习 | 二、三 |
| PyTorch 训练工程 | PyTorch | 三 |
| LLM 原理 | LLM 原理 | 四 |
| Prompt 工程 | Prompt 工程 | 四(赛道 A) |
| RAG 与 Agent | RAG 与 Agent | 四(赛道 A) |
| 模型微调 | 模型微调 | 四(赛道 B) |
| AI 工程化与推理部署 | AI 工程化 | 三、四 |
| 论文精读与追踪 | 论文笔记模板、经典论文、LLM 前沿、追踪方法 | 二、四、全程 |
| 过程留痕 | 过程记录(踩坑记录、项目复盘) | 全程 |
写作规范请参阅学习路径总览。