Skip to content

LLM 前沿

大模型技术栈的「当代经典」精读,按 对齐 → 微调 → 检索增强 → 智能体 的主线组织,每篇结构遵循 论文笔记模板。基础架构(Transformer/BERT)见 经典论文

InstructGPT:Training Language Models to Follow Instructions with Human Feedback

一句话贡献:用「人类示范微调 + 奖励模型 + PPO」三步把 GPT-3 从「接着上文生成」对齐到「听指令完成任务」——RLHF 的开山之作,也是对齐(alignment)研究的教科书范式。

信息:Long Ouyang et al.(OpenAI)· arXiv 2022-03 / NeurIPS 2022 · 论文

背景与问题

  • GPT-3 能续写、却「不听话」:问它问题它可能编故事,因为训练目标是语言建模而非完成用户指令;
  • 语言建模的下一词预测与「有用/诚实/无害」并不等价——需要一个把人类偏好注入模型的方法;
  • 本文问题:如何在不动用人类逐字重写(成本高)的前提下,让 1.3B 的小模型都比 175B 的 GPT-3 更令用户满意?

方法

  • 第一步 SFT:雇标注员写「示范回答」微调 GPT-3(约 1.3 万条指令/示范);
  • 第二步 RM:让模型对同一提示生成多个回答,标注员排序,训练奖励模型(RM)预测「哪个回答更好」;
  • 第三步 PPO:把 RM 当「自动裁判」,用强化学习(近端策略优化)最大化奖励,同时加 KL 惩罚防止模型为了高分脱离自然语言;
  • 三个模型大小对应三档(1.3B/6B/175B),本文主角是 1.3B——证明对齐比规模更重要

关键实验

实验设置结果
人类偏好用户盲评 InstructGPT 1.3B vs GPT-3 175B约 85% 偏好 1.3B 输出(更强的有用性)
真实性TruthfulQA 等编造(幻觉)率显著下降
分布外泛化未见过的指令类型表现不降反升

局限与展望

  • 标注是瓶颈:排序标注贵且存在标注员偏见;监督信号上限是「标注员能识别的好坏」;
  • 模型学会的是「讨好」而非「正确」:谄媚(sycophancy)、迎合用户错误前提的问题在后续被反复讨论;
  • 对齐税(alignment tax):部分基准分数略降;PPO 训练复杂不稳定;
  • 后代:GPT-4 把 RLHF 规模化,DPO(见下)与 GRPO 等简化了 RL 环节,OpenAI o1/DeepSeek-R1 用 RL 强化推理。

我的思考

  • 「让模型说人话」是目标函数问题,不是 prompt 技巧问题——所有 Agent 产品调不动大模型时,先检查它缺的是不是「对齐信号」;
  • RLHF 三步(示范→排序→强化)是通用配方:同样可用于代码生成偏好、UI 文案风格等自有场景。

LoRA:Low-Rank Adaptation of Large Language Models

一句话贡献:冻结预训练权重,只在旁路注入两个低秩小矩阵来学习任务增量(ΔW ≈ BA),全参微调的效果、1/10000 的可训练参数——大模型微调的事实标准。

信息:Edward J. Hu et al.(Microsoft)· arXiv 2021-06 / ICLR 2022(Oral)· 论文

背景与问题

  • 全参数微调(full fine-tuning)每个任务产出一整套完整权重:存储/分发成本高(175B 模型每任务数百 GB),且大模型微调易过拟合小数据集;
  • adapter/prefix 等参数高效微调(PEFT)方案带来额外推理延迟或压缩序列长度;
  • 本文问题:任务增量 ΔW 的「有效秩」是否远小于模型维数?若是,能否用低秩矩阵近似?

方法

  • 假设:微调导致的权重变化 ΔW 处于低秩子空间,即 ΔW ≈ B·A(shape: d×r 与 r×d,r ≪ d);
  • 前向:h = W₀x + (B A)x;初始化 A 取高斯、B 为零(开始时增量恒为零,不破坏预训练分布);
  • 推理零开销:训练后把 W′ = W₀ + α·BA 合并回原权重,不需要额外前向分支;
  • 设计要点:rank r(默认 8-16)与缩放因子 α;只训练低秩矩阵,优化器状态也同步缩小。

关键实验

实验设置结果
效果对比GPT-3 175B 各下游任务与全参微调相当或更优,可训练参数仅 0.01%
rank 敏感性r 从 1 到 64低 r 已接近上限,支持「低秩增量」假设
存储每任务 delta从数百 GB 降到约数 MB-数十 MB

局限与展望

  • r 的选择与任务相关;冻结底模的分布缺陷无法被低秩增量完全修正(仍需选对基座);
  • 合并后权重与低秩假设的边界会漂移(多任务连续学习时基座权重被覆盖,促生增量合并研究);
  • 生态后继:QLoRA(4bit 量化基座 + LoRA,单卡微调 65B)、AdaLoRA(按重要性分配秩)、DoRA(权重分解);PEFT 泛化为参数高效迁移学习的通用工具。

我的思考

  • LoRA 的经济学意义 = 让微调从「养模型」变成「装插件」:多租户场景一个基座 + N 个低秩 delta,与「瘦客户端 + 增量」的软件架构同构;
  • 工程踩坑提醒:合并权重后的量化、多 LoRA 并发服务(按需加回 delta)是生产落地的两个常见痛点。

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(RAG)

一句话贡献:把参数化生成器与非参数检索器拼接——先从语料检索 top-k 文档、再让 seq2seq 生成——知识密集型问答显著超当时 SOTA,首次系统化证明「检索 + 生成」的有效性。

信息:Patrick Lewis et al.(Meta AI)· arXiv 2020-05 / NeurIPS 2020 · 论文

背景与问题

  • 纯参数化模型的知识冻结在训练时:知识更新要重训、长尾事实记不住(检索型任务精确匹配要求高);
  • 知识密集型任务(开放域问答、事实验证)要求引用外部证据,只靠参数记忆天然吃亏;
  • 本文问题:把「记忆在参数里」换成「需要时去查」,生成模型能否吃得下检索噪声并产出可溯源答案?

方法

  • 两件套:检索器 DPR(双塔稠密检索,query 与 document 分别编码取内积 top-k)+ 生成器 BART seq2seq;
  • 端到端训练:检索器与生成器联合微调,让生成器的损失信号反向改进检索质量(关键差异:不是两段式管线);
  • 两种解码策略:RAG-Sequence(同一文档集生成整句再边际化)与 RAG-Token(每步 token 对文档集合取期望);
  • 可溯源:输出能指回检索到的文档——顺带带来「引用」属性。

关键实验

实验设置结果
开放域问答Natural Questions / WebQuestions / CuratedTrec三个基准全面超过当时 SOTA(含闭卷模型)
事实验证FEVER提升明显,证据可回查
知识更新更换语料库不改模型答案随新语料变化(无重训)

局限与展望

  • 检索质量决定上限:top-k 漏检则必错;噪声文档会带偏生成(RAG 后期研究多在修这个);
  • 每次回答都要检索,端到端延迟与工程复杂度上升;索引需持续维护;
  • 后继演化:Self-RAG(自我反思决定检索时机)、Atlas、RAVEN;2024 年后与「长上下文」路线并存争论——检索是省 token 的理性选择,长上下文是兜底的简单选择;
  • 检索增强的思想独立于 LLM:搜索引擎式 RAG、SQL/代码检索 RAG 都是同一配方。

我的思考

  • RAG 给工程人的启示:别让模型硬记会发生的事实(价格、权限、时效),把「记忆外置 + 引用可查」做进系统——这与本站 RAG 与 Agent 应用笔记互补;
  • 判断某场景该用 RAG 还是长上下文:问「答案的权威源是否外部且会变」,是则 RAG。

ReAct:Synergizing Reasoning and Acting in Language Models

一句话贡献:让 LLM 在「思考(thought) → 行动(action) → 观察(observation)」间循环,推理与工具调用交错进行——用外部环境的反馈给推理兜底,同时让决策过程可见。

信息:Shunyu Yao et al. · arXiv 2022-10 / ICLR 2023(Oral)· 论文

背景与问题

  • 纯推理(CoT):能想但算不出(不查表、不算数、不知道事实),还可能在没把握时一本正经地编;
  • 纯行动(Act):会调工具但没有规划,遇到失败不知道换路;
  • 本文问题:让「想」和「做」互相利用——推理产出行动、行动反馈修正推理,能否同时提升正确率与可信度?

方法

  • 交互格式:让模型输出交错的三类 token:Thought:…(内部推理)Action:…(调用工具,如 Search[query])Observation:…(工具返回),如此循环直至给出 Answer 或环境判定完成;
  • 零样本/少样本提示即可启动,无需额外训练;
  • 三类任务验证:多跳问答(HotpotQA,配 Wikipedia 检索 API)、事实验证(FEVER)、决策/交互任务(ALFWorld 具身 + WebShop 网页购物)。

关键实验

实验设置结果
多跳问答HotpotQA显著优于纯 CoT 与纯 Act,接近监督方法
事实验证FEVER幻觉率下降,证据路径可解释
交互任务ALFWorld / WebShop成功率大幅超过推理/行动单独使用
可控性干扰/误导环境可从轨迹回看是哪步推理被环境纠正

局限与展望

  • token 开销大(推理轨迹长);Thought 格式解析脆弱,工具输出超长会撑爆上下文;
  • 依赖环境质量:检索 API/工具的返回噪声直接影响决策;
  • 后代:Toolformer(教模型自己学会调 API)、OpenAI function calling 把 Action 结构化、AutoGPT 类 Agent 框架把 ReAct 做成默认循环,2024+ 的「规划 + 工具 + 反思」Agent 都是 ReAct 的规模化变体。

我的思考

  • ReAct 是 Agent 的最小可工作循环,理解它之后再学 LangGraph/CrewAI 等框架才不会迷失;
  • 「可解释 = 可调试」:生产 Agent 优先保留 thought 轨迹做审计,与本站 RAG 与 Agent 的应用实践联动。

DPO:Direct Preference Optimization

一句话贡献:把 RLHF 的「奖励模型 + 强化学习」两步化简为直接用偏好数据做分类式损失——不训奖励模型、不跑在线 RL,对齐效果与 RLHF 相当且稳定得多。

信息:Rafael Rafailov et al.(Stanford)· arXiv 2023-05 / NeurIPS 2023(Spotlight)· 论文

背景与问题

  • RLHF(见 InstructGPT)表现强但系统复杂:奖励模型需要额外训练,PPO 需要在线采样、调参敏感、训练不稳定;
  • 如果最终目标只是「让模型倾向人类偏好的回答」,能否绕过奖励建模与 RL 两个阶段,直接优化?
  • 本文洞察:对任意奖励函数 r,RLHF 的最优策略 π* 有闭式解——把 r 隐式地从 π* 反解出来,偏好损失就能直接用 π 表达。

方法

  • 关键推导:最优策略与奖励满足 π*(y|x) ∝ π_ref(y|x)·exp(r(x,y)/β);反解出 r(x,y) = β·log(πθ/πref) + 常数——奖励是「当前策略相对参考策略的对数概率比」;
  • 损失:把隐式奖励代入 Bradley-Terry 偏好模型,得到二分类式损失:让「被偏好的回答」在 πθ/πref 下概率更高;θ 直接对损失求梯度,全程只有一次前向-反向;
  • 参考策略 π_ref:通常是 SFT 后的模型并冻结,起「别跑偏太远」的锚点作用;
  • 无需采样、无需奖励模型,数据 = (prompt, chosen, rejected) 三元组。

关键实验

实验设置结果
对齐效果摘要 / 对话 / 指令跟随多项指标与 RLHF 相当或更好
稳定性多种实现与随机种子比 PPO 显著稳定,调参面小
可控性显式奖励函数测试可近似最优策略(验证理论正确)

局限与展望

  • 对偏好数据质量敏感:chosen/rejected 构造不当会放大偏差(长度偏好、风格偏好);
  • 静态偏好数据无在线探索,新场景适配需持续采数;分布漂移时可能「奖励 hack」;
  • 本质是隐式 reward 建模,后续 IPO/KTO/SimPO 换损失函数、GRPO 去掉价值网络——2025 年 DeepSeek-R1 等用 GRPO 把 RL 推理训练重新带火;
  • 「偏好 → 直接优化」范式已渗透到指令数据构造与评测选型。

我的思考

  • DPO 的数学巧妙在「把 RL 问题翻译成监督问题」——工程上省掉在线 RL 的复杂度,适合团队自建对齐数据闭环;
  • 给实践者的提醒:偏好数据的信噪比决定 DPO 上限,先保证 chosen 明显优于 rejected,再谈算法细节。

总结:一条读懂 LLM 技术栈的论文链

  1. Attention Is All You Need:架构骨架;
  2. BERT / GPT:预训练范式(encoder 双向 vs decoder 自回归);
  3. InstructGPT:对齐(让模型听话);
  4. LoRA:高效适配(改造成本可控);
  5. RAG:知识外置(回答可查证、可更新);
  6. ReAct / DPO:智能体循环与更稳的对齐替代方案。

每读一篇都对照 论文笔记模板 留档,新发现的前沿文献按 文献追踪方法 的漏斗流程入库。

基于 VitePress 构建 · 内容以知识共享方式沉淀