Skip to content

文献追踪方法

追文献最大的敌人不是「看不到」,而是信息过载:arXiv 每天上千篇新提交,只靠「刷」会淹没在噪声里。本页定义一套可重复的流程——渠道分层 → 漏斗筛选 → 模板入库,让读过的每篇论文沉淀为本站的笔记节点。

一、渠道矩阵:按「信噪比」分层

层级渠道用途频率
主动订阅arXiv 定制(按分类/关键词)、Google Scholar Alerts、Semantic Scholar Alerts不漏掉追踪主题的新论文每日/每周 digest
社区信号Hugging Face Daily Papers、Papers with Code Leaderboard、GitHub Trending发现「被讨论」的热点每周 1 次
权威窗口会议录用榜(ACL / NeurIPS / ICML / ICLR / CVPR 等)、知名组主页校准「重要」标准每季度
人脉与笔记引用追踪(谁引用了我在读的论文)、论文最后「related work」参考文献顺着引用链深挖按需

原则:把推送交给订阅,把注意力留给筛选。不把时间花在「看推送」上,而是花在「筛掉」上。

二、筛选漏斗:层层加码,随时可弃

阶段时间动作产出
1 标题/作者≤30 秒相关主题?重要组?保留/丢弃
2 摘要≤2 分钟贡献是否解决我关心的问题三问过滤(见下)
3 图表与结论≤10 分钟看方法图、主实验表、conclusion「值得精读」或放弃
4 全文精读≤60 分钟论文笔记模板 填卡本站新笔记

三问过滤法(阶段 2 必答):

  1. 它解决的问题我是否遇到过 / 即将遇到?
  2. 它的方法是否可能迁移到我的场景?
  3. 若不读,三个月后我会不会后悔?

三问全否 → 直接丢弃,不用愧疚。收藏≠阅读,阅读≠理解,理解才算入库。

三、入库流程:让笔记连成网

  1. 命名:按写作规范用「年份-简称」创建页面,如 2017-attention.md,放在 docs/papers/ 下;
  2. 填卡:用 论文笔记模板 的六段结构,方法/实验用自己话复述;
  3. 登记:把新页加入 文献收藏首页「已收录」列表,并在 config.mjs 侧边栏登记(多语言标题同步);
  4. 互链:在笔记中链接相关旧笔记(引用链、方法相似性、时间线),也让旧笔记回链新页——形成文献网络;
  5. 维护:同一主题的后续论文(改进/反驳/取代)更新到原笔记的「局限与展望」小节,而不是开重复页面。

四、工具链(2026 语境)

  • 订阅:arXiv 支持按分类 + 关键词定制邮件;Google Scholar Alerts / Semantic Scholar Alerts 按作者或论文关键词监控;
  • API 脚本化:arXiv API 无需 key,可把「本周 cs.CL 与我的主题词匹配的新论文」拉成清单:
bash
# 例:查最近 7 天 cs.CL 分类中含 "retrieval augmented" 的论文(取前 10)
curl -s "http://export.arxiv.org/api/query?search_query=cat:cs.CL+AND+abs:%22retrieval+augmented%22&sortBy=submittedDate&sortOrder=descending&max_results=10" \
  | grep -E "<title>|<published>|<id>" | head -40
  • 快速判断:Hugging Face Daily Papers 每天精选 + AI 摘要,适合第一遍粗筛;Semantic Scholar API / Connected Papers 做引文图;
  • 管理:Zotero(免费,存条目 + DOI + PDF),笔记本体放本站,两者用标题/链接对应;
  • 存档纪律:入库论文保留 arXiv 链接与版本号(同一论文有 v1/vN,结论以最新版为准)。

五、踩坑清单

  1. 收藏夹幻觉:读 5 篇不如精读 1 篇,漏斗第 3 阶段筛掉的论文直接删除收藏,不留「以后看」;
  2. 追热点疲劳:只读「被讨论」的会错过慢热真贡献——每周留固定额度给引用链深挖;
  3. 论文雪崩:arXiv 每天上千篇,不设主题边界就会失控;单日精读上限 1-2 篇;
  4. 只看 Abstract:对方法细节的复述失真——「我的思考」字段写不出来就说明还没读懂,回到全文;
  5. 重复收录:同主题改进论文应在原笔记追加,而不是另起炉灶导致知识割裂;
  6. 版本错觉:生成式摘要工具会混淆版本或编造结论,关键数字以原文为准;
  7. 断了引用链:互链是文献网络的生命,新页入库后记得回链旧笔记与 文献收藏首页 规划清单状态同步。

六、把追踪嵌入日常

  • 每周固定 30 分钟做「漏斗 1-2 阶段」批量筛选,产出至多 3 篇精读候选;
  • 每月检查一次追踪清单:主题是否仍相关、订阅关键词是否过时;
  • 精读论文无论结论好坏都入库——失败的方案是未来回看时的路标

基于 VitePress 构建 · 内容以知识共享方式沉淀