AI 方向
收录 AI 领域的技术笔记:从机器学习基础、深度学习原理,到 LLM 应用开发(Prompt / RAG / Agent / 微调),随学习持续补充。
已收录
- 机器学习基础 — 数学速成、经典算法图谱(回归/分类/聚类/集成)、评估指标与特征工程
- 深度学习 — 反向传播、激活与归一化、优化器、CNN / RNN / Transformer 结构演进与训练工程
- PyTorch — 张量、自动求导、模型搭建、可复用训练循环、AMP / DDP / 推理部署
- LLM 原理 — Token 化、Decoder-only Transformer、预训练与 Scaling、对齐、采样解码与幻觉
- Prompt 工程 — 提示词模式库、结构化输出与函数调用、上下文工程、评测迭代与注入防护
- RAG 与 Agent — RAG 管线五环、检索召回与重排、评测(RAGAS)、智能体循环与框架
- RAG 进阶 — 索引结构与检索策略进阶、重排与上下文工程、GraphRAG / Agentic RAG、检索评测与生产化
- 模型微调 — 微调选型决策、数据工程、LoRA / QLoRA 超参、训练框架、评估与上线闭环
- AI 工程化 — 推理服务(vLLM)、量化与 KV cache、成本优化、可观测评测、安全合规与部署
- MCP(模型上下文协议) — 连接模型与外部世界的开放协议:架构原语、2026-07-28 新版规范(无状态 + OAuth 2.1)、接入与安全
- Agent 架构通论 — 智能体形态谱系与五要素、控制循环类型学、记忆与上下文工程、工具层设计、多智能体编排与失败模式
- Agent 评测与可观测 — 轨迹级评测方法论、Trace 与指标设计、失败分析闭环与发布门禁
- Agent 记忆与状态 — 记忆需求分级、记忆系统四环节(写入/存储/检索/更新)、状态持久化、记忆安全与评测
- LangGraph 编排 — 图式状态机:State / Node / Edge、Checkpointer 与 Store、interrupt 人机协同、常见图模式与生产化
- Code Agent 与计算机使用 — 仓库内写码循环(理解/编辑/验证/自修复)与浏览器/桌面操作 Agent 的工程、沙箱与失败模式
- GUI Agent(界面操作) — 感知与动作空间、循环与状态校验、沙箱与提示注入防线、评测基准与能力边界
- Agent 安全与治理 — 威胁模型(间接注入/工具滥用/记忆中毒/外渗)、四层纵深防御、审批闸门与治理清单
- 平台与框架选型 — 技术栈六层拆解、五类路线对比、决策七问、TCO 估算与避免锁定
规划清单
| 主题 | 说明 | 状态 |
|---|---|---|
| 机器学习基础 | 线性代数/概率统计速成、回归/分类/聚类、评估指标 | ✅ 已收录(machine-learning.md:够用的数学直觉表、监督/无监督/强化三范式与统一流程、线性回归与 L1/L2 正则化、逻辑回归与 SVM/朴素贝叶斯/KNN、决策树与 Bagging/Boosting 集成、KMeans/DBSCAN/PCA、偏差-方差、指标速查表与类别不平衡、特征工程与数据清洗、端到端工作流清单与 10 条踩坑;含 python3.7 实测梯度下降示例) |
| 深度学习 | 反向传播、优化器、CNN/RNN/Transformer 结构 | ✅ 已收录(deep-learning.md:神经元与激活表、反向传播链式法则直觉与梯度消失、SGD→AdamW 优化器与 warmup/余弦退火、BatchNorm/LayerNorm 对比、CNN 卷积直觉与结构演进、RNN/LSTM/GRU 与门控、Transformer 机制点(注意力/KV cache/RoPE)、训练工程(AMP/梯度累积/复现性)与 10 条踩坑;关联文献收藏 ResNet/Transformer 论文笔记) |
| PyTorch | 张量、自动求导、模型训练管线、分布式 | ✅ 已收录(pytorch.md:张量与广播规则、自动求导与计算图、nn.Module 模型搭建、Dataset/DataLoader、可直接套用的完整训练循环、AMP/早停/检查点、DDP 多卡与 FSDP 路线、torch.compile 与 ONNX 部署、10 条踩坑;示例按 torch 2.4 API 编写) |
| LLM 原理 | 注意力机制、预训练与对齐(RLHF/DPO) | ✅ 已收录(llm-fundamentals.md:语言建模与 BPE 分词、Decoder-only Transformer(因果掩码/KV cache/RoPE)、预训练与 Scaling Laws/Chinchilla、SFT 与 RLHF/DPO 对齐、解码策略表(temperature/top-k/top-p/beam)、幻觉成因与缓解、推理显存与成本估算、术语速查与 10 条踩坑;关联文献收藏 LLM 前沿论文笔记) |
| Prompt 工程 | 提示词模式、结构化输出、评测方法 | ✅ 已收录(prompt-engineering.md:工作原理与五条原则表、模式库(角色/few-shot/CoT/自洽性/ReAct/拆解委托)、结构化输出与约束解码、上下文工程与系统提示、金标评测与 LLM-as-judge、提示注入防线、10 条踩坑) |
| RAG 与 Agent | 向量检索、工具调用、多智能体框架(LangChain/LlamaIndex) | ✅ 已收录(rag-agent.md:RAG/长上下文/微调选型决策表、管线五环(加载→切分→嵌入→检索→生成带引用)、BM25/稠密/混合 RRF 与 query 改写、向量库选型梯度(FAISS/pgvector/Milvus)、RAGAS 评测四层、ReAct 工具循环与框架对比(LangChain/LangGraph/CrewAI/MCP)、最小 ReAct 循环实测(deepseek-chat,2026-09-04)、失败模式调试表与 10 条踩坑;关联文献收藏 RAG/ReAct 论文笔记) |
| 模型微调 | LoRA/QLoRA、数据构造、评估与部署 | ✅ 已收录(fine-tuning.md:微调 vs Prompt/RAG 决策表、数据工程(格式/质量/负例/评测集隔离)、全参/LoRA/QLoRA 对比与超参起点表、TRL/LLaMA-Factory 训练实践与观测、评估上线闭环、11 条踩坑;关联文献收藏 LoRA 论文笔记) |
| AI 工程化 | 推理优化、量化、服务化(vLLM/Ollama) | ✅ 已收录(ai-engineering.md:推理框架选型(vLLM/TGI/Ollama/TensorRT-LLM)与 continuous batching/PagedAttention、显存估算与量化路线(GPTQ/AWQ/GGUF)、KV cache 与长上下文工程、成本优化工具箱与 token 计量、OpenTelemetry GenAI 可观测与评测门禁、安全合规六项清单、GPU 部署拓扑与降级预案、11 条踩坑) |
| MCP(模型上下文协议) | 连接模型与外部工具/数据的开放协议 | ✅ 已收录(mcp.md:N×M 集成问题与通用插座解法、Host/Client/Server 角色与 Tools/Resources/Prompts 三大原语、stdio 与 Streamable HTTP 传输与 JSON-RPC 消息、最小 Server 示例(fastmcp 4.0.2 + stdio 客户端实测,2026-09-04)、2026-07-28 新版规范全景(无状态化移除 initialize/session、OAuth 2.1+PKCE 强制、SSE→Streamable HTTP、原语并入扩展机制、认证错误码)、客户端接入与调试、生产化安全红线(工具=任意代码执行、注入回灌、凭据与审计)、与 Function Calling/A2A 边界辨析、10 条踩坑与检查清单;关联 RAG 与 Agent / Prompt 工程 / AI 工程化) |
| Agent 架构通论 | 形态谱系与五要素、控制循环类型学、记忆与上下文、多智能体编排 | ✅ 已收录(agent-architecture.md:Workflow→Agent 形态谱系与判定四问、五要素架构图、控制循环类型学(反应式/规划-执行/反思/分层)与选型表、终止条件四信号、记忆四层与上下文预算/工具输出治理铁律、工具 schema 与执行语义、多智能体拓扑与成本真相、架构到框架落地分层、失败模式表、plan-execute 最小骨架(可运行版,2026-09-04 用 deepseek-chat 实测闭环通过)与 11 条踩坑;联动 rag-agent / mcp / prompt-engineering / llm-fundamentals / ai-engineering) |
| Agent 评测与可观测 | 轨迹级评测、评测集搭建、Trace 设计与门禁闭环 | ✅ 已收录(agent-evaluation.md:Agent vs 单轮评测差异表、结果/过程/安全/效率四层指标、模板化任务+验证器+沙箱重置+参考轨迹的评测集方法论、LLM-as-judge 证据抽取与 rubric、GAIA/SWE-bench/tau-bench/WebArena 基准定位与借鉴、task/plan/llm/tool span 设计、失败分析回流与发布门禁闭环、11 条踩坑;联动 agent-architecture / prompt-engineering / ai-engineering / llm-fundamentals) |
| Agent 记忆与状态 | 记忆分级、存取管系统、状态持久化、记忆安全 | ✅ 已收录(agent-memory.md:记忆≠上下文/会话历史/缓存三误区、L0-L3 记忆需求分级表、写入→存储→检索→更新四环节参考架构、显式状态结构示例与上下文预算、checkpoint 与跨实例恢复、长存形态选型(KV/向量/图谱/组合)、写读要点(触发时机/提炼质量/按需检索/用户纠正优先)、过期与冲突治理、托管服务与自建边界(标注以官方文档为准)、记忆评测三面、11 条踩坑;联动 rag-agent / mcp / ai-engineering / agent-security) |
| Code Agent 与计算机使用 | 仓库内写码循环、浏览器/桌面操作、沙箱与失败模式 | ✅ 已收录(code-agent.md:两类场景主干与风险对比、repo 理解≠全量塞上下文、验证循环铁律(完成=相关测试实跑)、自修复预算、测试质量独立评审、页面状态化与幂等、真实副作用人工审批、Code Agent 与 Computer Use 各自失败模式表、测试驱动真实修复演示(deepseek-chat 实测 2026-09-04)、双保险原则、11 条踩坑;联动 agent-architecture / agent-security / agent-evaluation / rag-agent) |
| Agent 安全与治理 | 威胁模型、纵深防御、审批闸门、治理清单 | ✅ 已收录(agent-security.md:Agent 威胁模型全景表(直接/间接注入、工具滥用、记忆中毒、数据外渗、供应链、资源耗尽、越权)、间接注入为何是头号风险、输入/决策/执行/输出四层纵深防御、动作分类表(允许/需审批/禁止)与参数白名单、沙箱与最小权限、输出防外渗与审计、记忆中毒与多租户隔离、红队评测入回归集、治理九项清单、11 条踩坑;联动 prompt-engineering / mcp / ai-engineering / code-agent / agent-memory / agent-evaluation) |
| RAG 进阶 | 索引结构与检索策略进阶、重排与上下文压缩、GraphRAG / Agentic RAG、检索评测与生产化 | ✅ 已收录(rag-advanced.md:与 rag-agent 的分工与「先量后改」原则、性价比阶梯;索引四改(结构块 / 句子窗口 / 父子块自动合并 / 摘要分层);混合检索工程细节(为何用 RRF 而非加权求和、k=60 的语义、两路召回上限)与 RRF 融合本地实测(python3 标准库,语料 8 条 / 查询 6 条:稀疏 0.83、稠密 0.67、融合 0.83,并如实记录「融合救不了两路都错」与「无分数的伪排序会污染融合」两个真实坑);query 变换组合与成本表、自适应检索(Self-RAG / CRAG / FLARE)、Agentic RAG 与 GraphRAG 的适用边界;重排三档与上下文压缩 / 去冗余 / 位置效应 / 引用锚定;检索评测四层指标与六步消融顺序;生产化六面(增量更新、多租户、ACL 前置、三处缓存、成本结构、可观测);11 条踩坑与检查清单;关联 langgraph / agent-architecture / agent-evaluation / ai-engineering) | | LangGraph 编排 | 图式编排、持久化与 Checkpointer、interrupt 人机协同、生产化 | ✅ 已收录(langgraph.md:为什么 while 循环不够(持久化 / 中断恢复 / 时间旅行 / 并行汇合 / 可观测 / 长任务六项对照表);官方四层生态定位(Deep Agents / LangChain / LangGraph / LangSmith)与「不抽象提示词、也不替你决定架构」;State / Node / Edge / START-END / Checkpointer 五概念与 reducer 语义(最常见的坑是漏声明 reducer 导致消息被覆盖);Checkpointer vs Store 两套持久化对照(线程级快照 vs 跨线程长期记忆、thread_id 即游标、InMemory / Sqlite / Postgres 后端选择、官方点名的四个坑:thread_id 限 255 字符、内存型重启即丢、checkpoint 无界增长、子图独立命名空间);interrupt / Command 人机协同(暂停靠抛异常、恢复时节点从开头重跑,由此推出四条官方规则:勿用裸 try/except 包裹、勿条件跳过或循环调用、勿传不可序列化对象、interrupt 之前的副作用必须幂等;审批 / 审阅并编辑 / 工具内中断三模式、并行多中断用 id 映射一次性恢复、静态断点只用于调试);七种常见图模式与生产化六要点;11 条踩坑与检查清单;API 形态取自 LangChain 官方文档,示例未在本地实跑) | | GUI Agent(界面操作) | 界面自动化的感知、动作空间、循环校验、安全与评测 | ✅ 已收录(gui-agent.md:脚本自动化 / GUI Agent / RPA 三类对照与「先问能不能写脚本」的判断口径;感知四方式(截图视觉定位 / a11y 树与 DOM / Set-of-Mark / 混合感知)与「优先结构化信息」纪律;动作粒度三级(控件 ID / 归一化坐标 / 高层动作)与动作集设计原则;循环与校验铁律——终态必须由程序化断言验证,不依赖模型自报(呼应 code-agent 的「完成=相关测试实跑」);安全五面(真实系统副作用、沙箱与快照回滚、凭据绝不进上下文、提示注入是头号威胁因为观测内容来自不可信来源、动作四级分类表)与审计三件套(录屏 + 动作日志 + 状态快照);评测基准(WebArena / OSWorld 含 OSWorld-Verified / AndroidWorld,注明具体分数以官方榜单为准)与「成功率 + 步数效率 + 失败分布 + 安全违规率」四指标、自建评测集必须可程序化验证终态;能力边界诚实版(能做 / 难做 / 慢贵不稳三约束 / 人在回路的现实定位)与上线前三问;12 条踩坑与检查清单) | | 平台与框架选型 | 技术栈分层、五类路线对比、决策框架、TCO 与避免锁定 | ✅ 已收录(platform-selection.md:六层拆解(模型 / 编排 / 工具 / 数据 / 可观测 / 交付)与「分层选型可混搭、别搞全家桶式站队」的核心观点;五条路线对照(直接调 API / 代码框架 / 低代码 Agent 平台 / 云厂商托管 / 买成品)与「越靠近核心差异化越要掌握在自己手里」;决策七问表与三组典型组合;低代码平台内部三类分工(LLM 应用平台 / Bot 对话平台 / 通用自动化工具)与对应选型口径;代码框架四选(LangChain / LangGraph / LlamaIndex / CrewAI 类)与「先裸跑再引入框架」建议;避免锁定五条纪律(提示词与流程进 Git、业务逻辑不写进平台专属节点、模型调用收敛到适配层、数据自有、评测集自维护);TCO 六项成本表与「隐形大头是维护人力」;7 条常见失败模式与 10 条踩坑、检查清单) |
写作规范
- 理论笔记附公式与直觉解释,避免只有公式没有例子;
- 实践笔记给出可运行的 Notebook 或命令行示例,注明依赖版本;
- 涉及论文的概念,关联到 文献收藏 中的论文笔记;
- 文件名用短横线命名,新增后登记到
config.mjs侧边栏。