【跟李沐学AI】手把手教你读论文! #论文 #教程 #干货
- UP 主:YouTube 科技 AI 精选
- 源链接:https://www.douyin.com/video/7624087988149964047
- 时长:6:38
《手把手教你读论文》视频全解:李沐的「三遍读论文法」
先给判断:这是李沐「AI 论文精读」系列的开篇方法论视频,6 分半只干一件事——教你一套可立即执行的论文筛选与精读流程,信息密度高、几乎没有寒暄水分,对需要大量读论文的学生和工程师值得完整看一遍。但要纠正标题的一个预期:正片只有方法、没有实例,"手把手"的兑现不在本片,而在下一期 AlexNet 精读。另外,你看到的抖音版转写错字密集(下文附勘误表),做笔记请以本文修正后的术语为准。
1. 这条视频是什么、谁在讲
出处考证【事实】:抖音上这条《【跟李沐学AI】手把手教你读论文!》(UP 主"YouTube 科技 AI 精选",6:38)是搬运。原片为 B 站账号「跟李沐学AI」2021 年 10 月 6 日发布的《如何读论文【论文精读·1】》,时长 6:39 [1][2](检索快照显示原片播放量约 64.7 万,此数字未单独核验)。逐句比对转写稿与系列时间线可以确认就是同一期:视频结尾说"10 天之后会给大家读这一篇文章",而系列仓库显示 AlexNet 精读于 2021 年 10 月 14 日发布,间隔 8 天 [1]。
说话人的分量【事实】:李沐毕业于上海交大 ACM 班,在卡内基梅隆大学获博士学位(导师 Alex Smola),先后任职百度、Google Brain、亚马逊(离职时为资深首席科学家),参与创建深度学习框架 MXNet,是开源教材《动手学深度学习》(Dive into Deep Learning)的合著者——该书已被 70 个国家的 500 所大学采用 [5][6]。2023 年他离开亚马逊创办 Boson AI 并任 CTO [6]。这套读论文方法所在的「论文精读」系列由他本人逐篇讲解,配套 GitHub 仓库已有 33.8k star,截至 2025 年初录制了 30 余期、覆盖 60 余篇论文 [1]。
2. 视频内容主线【以下均为视频事实,据转写稿梳理】
缘起:上一条视频的投票里,77% 的观众选了"想花一小时详细了解一篇论文"而非"3 分钟读论文";不少留言说真正想要的不是讲某篇论文,而是"教会我下一次自己读论文"。本片就是回应这个诉求。
前提认知——论文是"八股文":绝大多数论文按"标题 → 作者 → 摘要 → 导言(Introduction)→ 相关工作 → 方法(Method)→ 实验(Experiments)→ 结论"的结构写成。既然论文总量巨大、真正适合你的只有一小部分,正确策略是先快速筛选、再对选中的精读,而不是每篇从头读到尾。
第一遍(海选,约十几分钟):
- 读标题和摘要,然后直接跳到结论。他给的理由:结论通常与摘要呼应,但会把摘要里提出的一两个问题用实际的结论、实际的数字证实一遍;
- 再扫一眼方法和实验部分的关键图表;
- 产出是一个决定:继续读,还是放一边(质量不高 / 与己无关 / 不感兴趣)。
第二遍(精选,通读全文一遍):
- 从头到尾过一遍,但跳过公式、证明等细节;
- 重要图表要"每一个字"都搞懂:方法的流程图长什么样;实验图的 X 轴、Y 轴各是什么、每个点什么意思、作者方法与别人怎么比、差距多大;
- 把没读过的重要引用文献圈出来;
- 读完再做决定。这遍之后有两个常见出口:觉得太难 → 去读它引用的前置工作(门槛更低),读完再回头;觉得不需要那么深 → 到此为止也算合格。
第三遍(研读,最详细):
- 搞清每句话、每段在干什么;
- 核心动作是在脑中不断"重复实现"这篇论文:作者提出什么问题、用什么方法解决——**如果换成我来做,我会怎么做?能不能做得更好?**作者没往下走的地方,我能不能往前推?
- 检验标准:合上文章后仍能回忆起大量细节,之后能向别人详细复述。
结尾预告:下一期以 AlexNet——他口中的"深度学习浪潮的奠基之作,将近 10 年前"——做示范,论文链接放在评论区,请观众先自己用三遍法读一遍,再看他怎么读。
转写稿勘误表(语音识别错误 → 正确术语):
| 转写稿 |
应为 |
| obstract |
abstract(摘要) |
| 因tro导研 |
introduction(导言) |
| me |
method(方法) |
| exXB |
experiments(实验) |
| 佐织 alexnet |
之作 AlexNet |
3. 补全:这套方法的源头、术语与 AlexNet 背景
3.1 「三遍法」有一个更早的学术出处
【外部参考】滑铁卢大学 S. Keshav 2007 年发表在 ACM SIGCOMM Computer Communication Review 上的短文《How to Read a Paper》,正式提出并命名了 three-pass approach,该文至今被多所大学课程列为必读 [3][9]。把李沐版本与 Keshav 原文逐条对照:
|
Keshav 原文 [3] |
李沐版(本视频) |
| 第一遍 |
5–10 分钟:读标题、摘要、导言、节标题、结论,扫参考文献;能回答"五个 C"——类型、背景、假设是否成立、贡献、写得清不清楚 |
十几分钟:标题、摘要、结论,再扫方法与实验图表;判断是否适合自己 |
| 第二遍 |
≤1 小时:细读但忽略证明;重点看图(轴标签、误差棒是否齐全);标记未读引用 |
通读但跳过公式证明;每张图每个字搞懂、看清与他人的差距;圈出未读引用 |
| 第三遍 |
虚拟复现:用与作者相同的假设重建这项工作;新手 4–5 小时、熟练者约 1 小时;检验标准是"能凭记忆重建全文结构" |
脑内重做:换我来做会怎么做;检验标准是"合上文章能复述细节" |
【推断】两者高度同源——"虚拟复现/脑内重做""圈引用""图表优先""逐级过滤"几乎一一对应,李沐的版本很可能承自或至少暗合 Keshav 的三遍法;但转写稿中李沐没有提到 Keshav,无法确认是直接引用还是自己的总结,这点只能存疑。李沐版有两处个人化差异:一是第一遍不读导言(Keshav 要求读),二是明确给出"卡壳就退回去读引用的前置文献"这条退路,后者对新手相当实用。
3.2 「八股文结构」的学名
【外部参考】李沐列出的结构就是实验科学论文的标准骨架,学术界通称 IMRaD(Introduction, Methods, Results, and Discussion),是原创研究型期刊论文最主流的组织规范 [10]。需要说明:此术语的出处(Wikipedia/威斯康星大学写作中心等多个来源的检索摘录相互印证),但本次未能逐一抓取原文核验,定义文字以检索摘录为准。这个结构正是三遍法能"跳读"的原因——摘要是全文压缩包,结论是用数字兑现摘要,图表是实验部分的压缩包。
3.3 AlexNet:为什么它配当第一篇示范论文
【外部参考】
- 论文:《ImageNet Classification with Deep Convolutional Neural Networks》,Alex Krizhevsky、Ilya Sutskever、Geoffrey E. Hinton(多伦多大学),NeurIPS(时称 NIPS)2012 [4]。这也就是当年"评论区里的链接"。
- 战绩:在 ILSVRC-2012 图像识别竞赛中以 top-5 错误率 15.3% 夺冠,第二名 26.2% [4];在测试标签公开的 LSVRC-2010 上为 top-1 37.5% / top-5 17.0% [4]。
- 模型:6000 万参数、65 万神经元、5 个卷积层 + 3 个全连接层;关键技术是 ReLU、dropout、双 GPU(两块 GTX 580 3GB)训练 5–6 天 [4]。
- 地位:被视为第一个被广泛认可的深度卷积网络大规模视觉识别应用,Yann LeCun 称之为"计算机视觉历史上一个明确的转折点" [7]。
- 时间对账:2012 年发表,视频发布于 2021 年,相差 9 年——视频里说"将近 10 年前"准确 [1][4]。
- 引用量级:第三方聚合站 CitationMap 显示 Google Scholar 被引约 19.9 万次 [8]。该数字来自二手聚合站且未抓原文核验,仅作量级参考;我曾尝试 Semantic Scholar API 独立验证,被限流(HTTP 429)未果。
3.4 这个系列后来长成了什么样
【事实】视频预告的 AlexNet 精读分上下两期:《9年后重读深度学习奠基作之一:AlexNet》(2021-10-14,约 20 分钟)与《AlexNet 论文逐段精读》(2021-10-15,55 分钟)[1]。此后系列陆续讲过 ResNet、Transformer、GNN、GAN、BERT、ViT、MAE、CLIP、AlphaFold 2、GPT 系列、InstructGPT、Llama 3.1、Sora 等,完整清单持续更新在 GitHub 仓库 [1]。想看"三遍法实战"的读者,直接看这两期即可。
4. 可核验数据速查
- 原视频:B站《如何读论文【论文精读·1】》,2021-10-06,6:39 [1][2]
- Keshav 三遍法时间预算:第一遍 5–10 分钟;第二遍 ≤1 小时;第三遍新手 4–5 小时 [3]
- AlexNet:ILSVRC-2012 top-5 15.3%(第二名 26.2%);LSVRC-2010 top-1/top-5 为 37.5%/17.0%;60M 参数;2×GTX 580 3GB;训练 5–6 天 [4]
- 系列:AlexNet 上/下两期分别发布于 2021-10-14、10-15 [1]
5. 适用场景与局限【本节以推断为主】
- 方法的隐含前提:三遍法是为"问题→方法→实验→结论"式的实验科学论文设计的。对典型的 CS/深度学习论文成立;对综述(应改成"读分类学和时间线")、纯理论证明文(第三遍等于逐行验算)、观点立场文(没有实验图表可看),三遍的动作需要变形。Keshav 原文同样未覆盖这些特例,其"文献综述"一节讲的是用三遍法做 survey 的过程,不是怎么读 survey 本身 [3]。
- "第一遍不读导言"的取舍:李沐省掉导言换来速度,但对陌生领域,第一遍可能判断不准"与你是否相关";Keshav 把导言放进第一遍并配"五个 C"自查清单 [3]。两者可以拼接使用:第一遍加读导言首段。
- 视频本身的局限:只有方法没有示范;信息可以全部从 B 站原片获得,抖音搬运版无字幕修正、错字密集;视频是 2021 年的,但方法本身不受时效影响,配套系列和仓库至今仍在更新 [1]。
6. 值不值得看、怎么用
- 值得看的部分:三遍法的完整展开贯穿全片,几乎没有可跳过的技术内容;唯独开头约半分钟的投票回顾与寒暄可快进。
- 最大的价值是把"读论文"重新定义为筛选问题——大部分论文止步于第一、二遍是正常且正确的,这能显著缓解新手"逐字逐句读不完"的挫败感。
- 看完的下一步(视频自带的作业设计):自己先用三遍法读一遍 AlexNet 原文 [4],再对照李沐的上下两期精读 [1]。这是把方法内化最快的路径。
7. 事实 / 参考 / 推断分层说明
- 视频事实:第 2 节全部内容、投票 77%、AlexNet 预告。
- 外部核验事实(已抓原文):出处考证(第 1 节)、Keshav 三遍法细节、AlexNet 全部数据、系列时间线。
- 二手参考(仅检索摘录,未抓全文):IMRaD 定义 [10];CitationMap 被引数 [8]。
- 推断:抖音版为搬运;李沐方法与 Keshav 同源但视频未提来源;第 5 节适用性分析。
- UNVERIFIED:Semantic Scholar 口径的 AlexNet 独立引用数(API 限流未取得);抖音频道"YouTube 科技 AI 精选"与李沐方的关系(仅能从频道命名推断为搬运号)。
参考清单
- [1] mli/paper-reading:深度学习论文精读系列仓库(李沐) — https://github.com/mli/paper-reading
- [2] 如何读论文【论文精读·1】(B站原视频页) — https://www.bilibili.com/video/BV1H44y1t75x/
- [3] S. Keshav, "How to Read a Paper"(全文 PDF,斯坦福课程镜像) — https://web.stanford.edu/class/cs244/papers/HowtoReadPaper.pdf
- [4] Krizhevsky, Sutskever & Hinton, "ImageNet Classification with Deep Convolutional Neural Networks"(NeurIPS 2012 正式版) — https://proceedings.neurips.cc/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf
- [5] Dive into Deep Learning 官网(作者页列 Mu Li) — https://d2l.ai/
- [6] 21世纪经济报道:《李沐最新演讲:因"恐惧"而创业》(2024-08-26) — https://www.21jingji.com/article/20240826/herald/f65b39a8a35cdf3f3f782bb7ef8ffcdc.html
- [7] Wikipedia: AlexNet — https://en.wikipedia.org/wiki/AlexNet
- [8] CitationMap: AlexNet 被引统计(二手聚合,未核验原文) — https://citationmap.com/paper/3892-imagenet-classification-with-deep-convolutional-neural-networks
- [9] ACM Digital Library: "How to read a paper"(正式出版页,DOI 10.1145/1273445.1273458) — https://dl.acm.org/doi/10.1145/1273445.1273458
- [10] Wikipedia: IMRaD(术语定义,据检索摘录未抓全文) — https://en.wikipedia.org/wiki/IMRAD