文献追踪方法
追文献最大的敌人不是「看不到」,而是信息过载:arXiv 每天上千篇新提交,只靠「刷」会淹没在噪声里。本页定义一套可重复的流程——渠道分层 → 漏斗筛选 → 模板入库,让读过的每篇论文沉淀为本站的笔记节点。
一、渠道矩阵:按「信噪比」分层
| 层级 | 渠道 | 用途 | 频率 |
|---|---|---|---|
| 主动订阅 | arXiv 定制(按分类/关键词)、Google Scholar Alerts、Semantic Scholar Alerts | 不漏掉追踪主题的新论文 | 每日/每周 digest |
| 社区信号 | Hugging Face Daily Papers、Papers with Code Leaderboard、GitHub Trending | 发现「被讨论」的热点 | 每周 1 次 |
| 权威窗口 | 会议录用榜(ACL / NeurIPS / ICML / ICLR / CVPR 等)、知名组主页 | 校准「重要」标准 | 每季度 |
| 人脉与笔记 | 引用追踪(谁引用了我在读的论文)、论文最后「related work」参考文献 | 顺着引用链深挖 | 按需 |
原则:把推送交给订阅,把注意力留给筛选。不把时间花在「看推送」上,而是花在「筛掉」上。
二、筛选漏斗:层层加码,随时可弃
| 阶段 | 时间 | 动作 | 产出 |
|---|---|---|---|
| 1 标题/作者 | ≤30 秒 | 相关主题?重要组? | 保留/丢弃 |
| 2 摘要 | ≤2 分钟 | 贡献是否解决我关心的问题 | 三问过滤(见下) |
| 3 图表与结论 | ≤10 分钟 | 看方法图、主实验表、conclusion | 「值得精读」或放弃 |
| 4 全文精读 | ≤60 分钟 | 按 论文笔记模板 填卡 | 本站新笔记 |
三问过滤法(阶段 2 必答):
- 它解决的问题我是否遇到过 / 即将遇到?
- 它的方法是否可能迁移到我的场景?
- 若不读,三个月后我会不会后悔?
三问全否 → 直接丢弃,不用愧疚。收藏≠阅读,阅读≠理解,理解才算入库。
三、入库流程:让笔记连成网
- 命名:按写作规范用「年份-简称」创建页面,如
2017-attention.md,放在docs/papers/下; - 填卡:用 论文笔记模板 的六段结构,方法/实验用自己话复述;
- 登记:把新页加入 文献收藏首页「已收录」列表,并在
config.mjs侧边栏登记(多语言标题同步); - 互链:在笔记中链接相关旧笔记(引用链、方法相似性、时间线),也让旧笔记回链新页——形成文献网络;
- 维护:同一主题的后续论文(改进/反驳/取代)更新到原笔记的「局限与展望」小节,而不是开重复页面。
四、工具链(2026 语境)
- 订阅:arXiv 支持按分类 + 关键词定制邮件;Google Scholar Alerts / Semantic Scholar Alerts 按作者或论文关键词监控;
- API 脚本化:arXiv API 无需 key,可把「本周 cs.CL 与我的主题词匹配的新论文」拉成清单:
bash
# 例:查最近 7 天 cs.CL 分类中含 "retrieval augmented" 的论文(取前 10)
curl -s "http://export.arxiv.org/api/query?search_query=cat:cs.CL+AND+abs:%22retrieval+augmented%22&sortBy=submittedDate&sortOrder=descending&max_results=10" \
| grep -E "<title>|<published>|<id>" | head -40- 快速判断:Hugging Face Daily Papers 每天精选 + AI 摘要,适合第一遍粗筛;Semantic Scholar API / Connected Papers 做引文图;
- 管理:Zotero(免费,存条目 + DOI + PDF),笔记本体放本站,两者用标题/链接对应;
- 存档纪律:入库论文保留 arXiv 链接与版本号(同一论文有 v1/vN,结论以最新版为准)。
五、踩坑清单
- 收藏夹幻觉:读 5 篇不如精读 1 篇,漏斗第 3 阶段筛掉的论文直接删除收藏,不留「以后看」;
- 追热点疲劳:只读「被讨论」的会错过慢热真贡献——每周留固定额度给引用链深挖;
- 论文雪崩:arXiv 每天上千篇,不设主题边界就会失控;单日精读上限 1-2 篇;
- 只看 Abstract:对方法细节的复述失真——「我的思考」字段写不出来就说明还没读懂,回到全文;
- 重复收录:同主题改进论文应在原笔记追加,而不是另起炉灶导致知识割裂;
- 版本错觉:生成式摘要工具会混淆版本或编造结论,关键数字以原文为准;
- 断了引用链:互链是文献网络的生命,新页入库后记得回链旧笔记与 文献收藏首页 规划清单状态同步。
六、把追踪嵌入日常
- 每周固定 30 分钟做「漏斗 1-2 阶段」批量筛选,产出至多 3 篇精读候选;
- 每月检查一次追踪清单:主题是否仍相关、订阅关键词是否过时;
- 精读论文无论结论好坏都入库——失败的方案是未来回看时的路标。