Smart-Yuki · AI科普-FQ

技术综述 / 第 1 版

面向计算机专业研究生
阅读时长约 40 分钟
含 2 个可交互计算器

所有公式与数量级
均给出可复核口径

从感知机
推理模型

这不是一份科普。它是一张给已具备线代、概率、算法基础的人的技术地图: 发展脉络、分支体系、模型谱系、产业分层、可达检验标准的学习路径, 以及七个当前真正没有解决的问题。

34条关键节点 / 可筛选
4条正交分类轴
6层产业格局
7个开放问题
00
阅读须知 / Preface

这份文档的边界

先说清楚它不能做什么,比承诺能做什么更有用。

时间线截点 事件表停在撰写时我能确证的最新节点(约 2025 年初)。此后进展请自行补充 —— 我不会为凑数而编造后续事件。
数量级而非精确值 参数量、算力、显存均给出计算口径与假设,你可以改参数复算。文中的具体数字用于建立量级感,不作为引用来源。
产业信息半衰期短 公司格局一节描述的是结构(谁在哪一层、因何有护城河),具体名单会快速过时。
不替代论文 每节末尾指向该方向应读的原始文献。本页的作用是让你知道「该读什么、为什么读、读到什么程度算够」。
01
发展脉络 / Timeline

三次浪潮,两次寒冬

值得注意的不是年份,而是每次兴起与崩塌的机制几乎相同: 方法在窄领域取得突破 → 承诺被外推到通用智能 → 落地成本与预期落差暴露 → 经费收缩。 判断一轮热潮是否可持续,看的是它能否把成本压到商业闭环以内。

34 条全部显示
1943

McCulloch–Pitts 神经元

连接主义

用阈值逻辑单元刻画神经活动,给出第一个可计算的神经元模型。今天每一个 nn.Linear 加激活函数,仍是它的直系后裔。

1949

Hebb 学习规则

连接主义

「一起激发的神经元会连在一起」—— 第一个可学习的突触更新规则,把「学习」从哲学问题变成了权重调整问题。

1950

图灵测试

奠基

Turing 在《Computing Machinery and Intelligence》中把「机器能思考吗」替换为一个可操作的判据。这个替换本身就是方法论示范:把不可判定问题改写成可观测问题

1956

Dartmouth 会议

奠基

McCarthy 在会议提案中首次使用 "Artificial Intelligence",AI 成为独立学科分支。当时的乐观估计是「十个人两个月就能取得实质性进展」。

1958

Rosenblatt 感知机

连接主义

带可学习权重的线性分类器与感知机学习算法,并给出收敛性证明。第一次让「机器从数据中学习」有了可运行的实体。

1959

Samuel 跳棋程序

统计学习

用自我对弈与搜索让程序超过自己,并首次提出 machine learning 一词。注意它的路径是「搜索 + 自举」,而非今天的梯度下降。

1966

ELIZA

符号主义

基于模式匹配的对话程序,却让使用者产生「它理解了」的错觉,即后来的 ELIZA 效应。这一现象在今天的对话模型上以更强形式重现,是评估人类判断可靠性的经典案例。

1969

《Perceptrons》

连接主义符号主义

Minsky 与 Papert 严格证明单层感知机无法表示 XOR。结论本身正确,但被广泛误读为「多层网络也没前途」,直接导致连接主义研究经费断裂十余年。

1973–1980

第一次 AI 寒冬

奠基

Lighthill 报告打击英国资助,DARPA 收缩通用问题求解与机器翻译项目。承诺未兑现的原因很具体:组合爆炸常识知识的规模都被严重低估。

1980

专家系统商业化

符号主义

XCON/R1 在 DEC 投入生产,规则库 + 推理机的路线首次形成商业闭环;日本启动第五代计算机计划。局限也很明确:规则库维护成本随规模非线性增长。

1986

反向传播的推广

连接主义

Rumelhart、Hinton、Williams 在 Nature 发表 BP 算法,使多层网络可训练(Werbos 已于 1974 年提出)。同期仍缺两件东西:足够的数据与足够的算力。

1989

LeNet 与卷积网络

连接主义

LeCun 把卷积结构与 BP 结合用于手写邮编识别,在真实业务中运行。局部连接 + 权重共享这一归纳偏置从此成为视觉领域的基本假设。

1987–1993

第二次 AI 寒冬

奠基

LISP 机市场崩溃,专家系统的维护成本超过收益。一个值得记住的后果:研究者开始回避 "AI" 这个词,转用「机器学习」「模式识别」「智能系统」等标签。

1995

SVM 与核方法

统计学习

Cortes 与 Vapnik 提出软间隔 SVM;配合 VC 维与结构风险最小化,统计学习理论第一次为「小样本为什么能泛化」提供了定量框架。这一支的遗产是今天的泛化界与理论分析

1997

LSTM

连接主义

Hochreiter 与 Schmidhuber 用门控与常量误差流解决长程依赖,此后约十五年里是序列建模的主力,也是「用结构设计对抗梯度问题」的范例。

1997

Deep Blue 战胜 Kasparov

符号主义

以大规模搜索 + 人工评估函数取胜,核心不是学习。它的意义主要在公众预期与「专用系统可在限定域超越人类」的证明。

2006

深度学习复兴

深度学习

Hinton 用逐层无监督预训练训练深度信念网络,让「深层网络可训练」重新成立,并以 representation learning 重构了叙事。

2009

ImageNet

深度学习

千万级人工标注图像数据集发布,并配套统一的评测任务。它同时提供了燃料(数据)与标尺(榜单),这两者缺一不可。

2012

AlexNet

深度学习

GPU + ReLU + Dropout 在 ImageNet 上大幅刷新纪录,误差下降幅度远超此前任何单篇工作。深度学习的产业拐点由此开始 —— 真正起作用的是算力可及性的改变。

2014

seq2seq / Attention / GAN

深度学习

编码器-解码器统一了翻译等序列到序列任务;Bahdanau 注意力缓解了定长瓶颈;GAN 提出对抗式生成。三条线都指向同一件事:用可微结构替代手工对齐

2015

ResNet

深度学习

残差连接让上百层网络可稳定训练。它与 BatchNorm 一起说明:深度不是被梯度消失限制的,而是被优化条件限制的,而结构设计可以直接改善优化条件。

2016

AlphaGo

连接主义

策略网络 + 价值网络 + 蒙特卡洛树搜索击败李世石。关键贡献是把深度网络的直觉与搜索的严谨结合起来,解决搜索空间无法枚举的问题。

2017

Transformer

深度学习

《Attention Is All You Need》用自注意力取代循环结构,把序列建模的计算从串行变为可并行。此后几乎所有大模型都以此为骨架 —— 这一条是整个现代 AI 的分界线。

2018

BERT 与 GPT

大模型

「预训练 + 微调」范式确立:先在无标注语料上做自监督预训练,再用少量标注数据适配下游任务。这解决了长期制约的标注瓶颈

2020

GPT-3(175B)

大模型

规模带来上下文学习(in-context learning)与 few-shot 能力,提示开始部分取代微调。能力随规模出现而不需专门设计,是这一阶段最反直觉的观察。

2020

AlphaFold2

深度学习

在 CASP14 上达到接近实验精度的蛋白质结构预测,成为 AI for Science 的标志性成果。它示范了把领域先验(几何、对称性)编进网络结构的价值。

2020

DDPM 与扩散模型

生成式

去噪扩散概率模型逐步取代 GAN 成为图像生成主流:训练目标稳定(回归噪声)、模式覆盖好,代价是采样需要多步迭代 —— 训练稳定性换采样速度的典型取舍。

2022

Chinchilla 缩放律

大模型

在固定算力预算下,模型规模与数据量应等比例增长(约 20 token / 参数),而非只堆参数。它修正了一整代「大而欠训」的做法,也解释了此后训练数据需求的暴涨。

2022

InstructGPT / RLHF

生成式大模型

用人类偏好数据做强化学习微调,把「会续写」变成「会听指令」。同年 Stable Diffusion 开源,生成模型进入大众可用阶段。对齐从研究问题变成了产品必需环节

2022

ChatGPT

生成式

把对齐后的大模型包装成对话产品,两个月内用户过亿,AI 进入大众阶段。技术并未在此时突变,变的是交互形态与可及性。

2023

GPT-4 / Llama 2 / Mixtral

大模型

三条线同时推进:多模态与更强的推理、可商用的开放权重(Llama 2)、稀疏混合专家(Mixtral 8×7B)。此后「开源权重 + 闭源前沿」成为稳定的双轨格局。

2024

推理时计算(o1 系列)

推理与测试时计算

用强化学习训练长思维链,把算力从训练阶段搬到推理阶段:面对难题时投入更多 token 与采样换取更高正确率。这打破了「模型已训练完、推理成本固定」的旧假设。

2025

DeepSeek-R1

推理与测试时计算

证明仅用可验证奖励的强化学习(答案对错可由规则判定)即可激发长链推理能力,且权重开放。它把推理模型从少数实验室的专有技术推向普遍可得,并显著压低成本预期。

此后

待补充

奠基

上面最后一站是我能确证的时间线终点。请在此处自行接续:判断新事件是否值得写入的标准是它是否改变了成本结构能力边界,而不是它是否上了新闻。

共 34 条

02
分支体系 / Taxonomy

四种正交的切法

大多数人描述 AI 分支时把不同维度的东西混在一句话里(「深度学习和计算机视觉」——一个是方法,一个是任务)。 下面四条轴彼此正交,任何一项具体工作都可以在其中定位。建立这个坐标系,比背下分支名单有用得多。

轴 A · 方法论范式

METHODOLOGY
范式核心假设优势代价今天的角色
符号主义智能 = 符号操作与逻辑推理可解释、可验证、可组合知识获取瓶颈;对噪声脆弱与神经方法结合:工具调用、形式化验证、知识图谱
连接主义智能 = 大量简单单元的加权连接免手工特征;可随规模扩展数据与算力饥渴;可解释性弱当前主流:一切大模型的底座
统计学习从有限样本推断泛化能力小样本可用;有理论保证依赖特征工程;难处理非结构化数据核方法、概率模型、泛化理论、不确定性量化
贝叶斯方法用概率分布表达全部不确定性校准良好;可做决策与实验设计推断常不可解,需近似变分推断、贝叶斯优化、概率编程
因果推断区分相关与干预,建模机制支持反事实与策略评估需强假设;难从观测数据识别鲁棒性、公平性、科学发现

轴 B · 监督信号

LEARNING SIGNAL
类型信号来源目标典型规模与代表
监督人工标注 (x, y)拟合条件分布 p(y|x)10³–10⁶ 样本;分类、检测
无监督仅有 x发现结构:聚类、降维、密度无标注上限;K-means、PCA、密度估计
自监督从数据自身构造监督信号学可迁移表示10¹²–10¹³ token;掩码预测、对比学习、下一 token 预测
强化学习环境奖励最大化累积回报交互成本高;策略梯度、Q-learning、MCTS
从人类反馈中学习人类偏好比较对齐到人类偏好RLHF、DPO —— 现代模型训练的标准收尾阶段
可验证奖励 RL规则/单元测试判定对错激发长链推理与自我检查数学、代码等有客观判据的领域
上下文学习提示中的示例无需更新参数即适配任务推理时生效;能力随规模涌现

关键脉络:自监督 + 上下文学习这两项的成熟,是把标注成本从瓶颈位置上挪开的原因。理解这两条,就理解了 2018 年后的整段历史。

轴 C · 数据模态与任务域

MODALITY & DOMAIN
方向核心任务代表方法 / 模型当前主要开放难点
计算机视觉分类、检测、分割、深度估计、三维重建、生成ResNet、ViT、DETR、SAM、NeRF/3DGS三维与物理一致性;长视频时序理解
自然语言处理分类、抽取、翻译、问答、检索、生成BERT、GPT 系列、T5、RAG 架构事实性;长文档推理;多语言一致性
语音识别、合成、说话人、语音翻译Conformer、Whisper、TTS 声码器噪声与口音鲁棒性;低延迟流式
多模态图文对齐、视觉问答、视频理解、文档理解CLIP、LLaVA 类 VLM、原生多模态模型细粒度空间推理;模态间幻觉
图与关系数据节点/边预测、图生成、分子性质GCN、GAT、Graph Transformer异质图与动态图;可扩展性
时序与信号预测、异常检测、分类TFT、Informer、时序基础模型分布漂移;长期预测的理论界
推荐与搜索召回、排序、重排、查询理解双塔、DIN、生成式推荐、LLM 重排冷启动;反馈回路导致偏见放大
决策与控制规划、操作、自动驾驶、具身MuZero、扩散策略、VLA 模型仿真到现实迁移;长程任务组合
AI for Science蛋白质、材料、天气、数学定理AlphaFold2、GNoME、GraphCast、神经算子数据稀缺;外推与守恒律保证

轴 D · 生成式模型族

GENERATIVE FAMILIES

判别式模型输出标签或分数;生成式模型建模数据分布本身。五类生成模型可以按「训练稳定性 vs 采样速度」排开 —— 这是一个非常清晰的取舍轴,也是理解生成模型演进的钥匙。

核心思想训练稳定性采样速度代表
自回归按序分解联合分布,逐项预测高(似然目标)慢(串行,每步一次前向)GPT 系列、PixelCNN
扩散 / 流匹配学去噪或速度场,逐步还原高(回归目标)中(需多步;蒸馏后可 1–4 步)DDPM、Stable Diffusion、DiT
GAN生成器与判别器对抗博弈低(易崩、需精细调参)快(单次前向)StyleGAN、pix2pix
VAE变分下界优化的隐变量模型β-VAE、VQ-VAE
归一化流可逆变换,精确似然RealNVP、Glow

趋势读法:GAN 采样快但训练难,扩散训练稳但采样慢,自回归统一了文本与代码却受串行限制。2024 年后的推理模型把自回归的串行劣势重构成了优势 —— 串行 = 可以边想边算。

03
模型谱系 / Models

架构、训练范式与推理优化

看模型不要只记名字。先问它的归纳偏置是什么、复杂度随序列长度如何增长、训练时能否并行 —— 这三个维度基本决定了一个架构能用在什么场景、卡在哪里。

3.1 架构谱系与归纳偏置

ARCHITECTURES
架构归纳偏置复杂度(n = 序列长度)训练并行性代表适合场景
MLP无结构先验,全连接参数 O(n·m)早期网络表格数据、小规模
CNN局部性 + 平移等变O(n·k),k 为核宽ResNet、ConvNeXt图像、局部纹理、时序
RNN / LSTM / GRU递归 + 权重时间共享O(n),但串行低(时间步串行)LSTM、GRU流式、短序列、低资源
Transformer全局注意力、内容寻址注意力 O(n²)高(训练)GPT、BERT、ViT通用主力;长文本需专门优化
SSM / 选择性状态空间线性递归 + 输入相关选择O(n)高(可并行扫描)S4、Mamba超长序列、高效推理
GNN图结构上的消息传递O(E),E 为边数GCN、GAT分子、社交、知识图
MoE(稀疏专家)条件计算,按输入激活部分参数激活 O(k/N · FFN)高(需专家并行)Mixtral、DeepSeek-V3用较低推理成本换更大容量
扩散 / 流匹配迭代去噪,时间步共享权重采样 O(T) 步Stable Diffusion、DiT图像、视频、三维、动作

注意 混合架构已成为常规做法:MoE + 注意力、SSM + 注意力层交替、扩散 + Transformer 骨干。 不要用「哪一个更好」的方式提问,要问「在什么约束下哪个更划算」。

3.2 训练与适配范式

TRAINING PIPELINE
阶段数据目标函数作用
预训练海量无标注语料下一 token 预测(交叉熵)获得通用表示与世界知识
监督微调 SFT指令-回答对(10⁴–10⁶)同样是交叉熵,但只在回答段计损失学会遵循指令的格式与风格
RLHF人类偏好比较对奖励模型 + PPO对齐到人类偏好,降低有害输出
DPO偏好比较对直接在偏好上做类监督优化省掉奖励模型与 RL 循环,更易复现
可验证奖励 RL有客观判定的题目 + 答案校验器按最终正确性给奖励激发长链推理与自我纠错
参数高效微调小规模领域数据LoRA / 前缀 / 适配器单卡即可把大模型适配到垂直域
蒸馏教师模型的输出分布KL 散度对齐软标签把能力压缩到小模型

3.3 推理侧优化

INFERENCE

训练是资本支出,推理是运营支出。当服务量足够大,推理优化带来的收益往往超过换更大的模型。

技术解决什么
KV cache缓存历史键值,避免每步重算 —— 代价是显存随上下文线性增长
MQA / GQA多个查询头共享少数键值头,把 KV cache 缩小数倍
RoPE 与外推旋转位置编码,配合插值/缩放可扩展有效上下文
FlashAttention分块计算注意力,避免物化 n×n 矩阵,显存从 O(n²) 降到 O(n)
推测解码小模型起草、大模型并行校验,打破串行生成的吞吐瓶颈
量化权重/激活降到 8/4 bit,PTQ 或 QAT,换显存与带宽
并行策略数据/张量/流水/专家并行,决定能否在集群上高效扩展

3.4 训练算力估算器

C ≈ 6 · P · D  |  CHINCHILLA D* ≈ 20P
70 B
稠密参数量。MoE 请填激活参数量用于估算实际算力。
15.0 T
总训练数据量(token)。
H100
峰值按 FP16/BF16 Tensor Core 稠密算力计(TFLOPS)。相邻代际约差 8 倍,这正是训练成本曲线的来源。
40%
大模型训练典型 35%–55%。
训练总算力 C = 6PD
折算 GPU-hours
折算单卡年数
Chinchilla 最优数据量 D* = 20P
你设定的 D / D*

口径说明:C ≈ 6PD 来自「前向 2PD + 反向 4PD」的标准估计,仅计稠密矩阵乘, 不含注意力随序列长度的二次项与通信开销;因此实际所需算力通常高于此估算。 用 Llama-2 70B(70B 参数 / 2T token / 报告约 1.72M A100-hours)反查:本口径在 MFU 50% 时给出 1.5M A100-hours, 量级吻合 —— 说明用它做预算规划是站得住的。

3.5 KV cache 显存计算器

2 · L · Hkv · dhead · S · B · bytes
Llama-3-70B
区别只在键值头数 Hkv:GQA 用 8,MHA 用全部头数。
8 K
1
FP16 / BF16
每 token 的 KV cache
单条序列总占用
当前并发下合计
若改用全头数 MHA(对比)

口径说明:只计 KV cache,不含权重与激活。权重占用可用 参数量 × 精度字节数 单独估算 (如 70B 在 FP16 下约 140 GB)。长上下文推理的真实瓶颈常常就是这张表里最后一行: KV cache 随序列线性增长,而显存是固定的,这直接决定了你能开多大的并发。

3.6 评测:比基准分数更容易出错的地方

EVALUATION
基准类别测什么代表
知识多学科选择题MMLU、CMMLU
推理竞赛级理工题GPQA、AIME、MATH
代码函数级生成、真实仓库修复HumanEval、MBPP、SWE-bench
对话偏好成对比较、人工或模型裁判MT-Bench、Chatbot Arena
长上下文haystack 检索、多文档推理RULER、LongBench
智能体多步工具使用与规划AgentBench、WebArena

四个反复出现的陷阱:
① 数据污染 —— 测试集进了训练语料,分数不可比。看论文时先去找它的污染检测部分。
② 基准饱和 —— 接近满分后区分度消失,于是不断有新基准,导致跨代不可比。
③ 基准 ≠ 能力 —— 高分不等于在你关心的分布上可用;一定要在自己的数据上做小规模评测。
④ 裁判偏差 —— 用模型当裁判时,裁判自身有位置偏差、长度偏差与自我偏好。

04
产业格局 / Landscape

六层结构,以及每层的护城河

记公司名单没有意义,名单会变。有意义的是结构:AI 产业是分层堆叠的, 每一层的壁垒来源完全不同,这决定了一家公司能守住什么、又会被什么颠覆。

做什么壁垒来源代表
① 芯片与算力 训练/推理加速器、互联、制造 制程 + 软件生态(CUDA 的历史积累)+ 产能 NVIDIA、AMD、Google TPU、AWS Trainium、华为昇腾、寒武纪;新架构路线 Groq、Cerebras
② 云与集群 提供算力租用、调度、数据服务 资本开支规模 + 网络与电力 + 企业客户关系 AWS、Azure、Google Cloud、阿里云、腾讯云、火山引擎
③ 基础模型 训练通用/多模态大模型并对外提供 人才密度 + 训练配方(含数据配比)+ 算力可得性 OpenAI、Anthropic、Google DeepMind、Meta、xAI、Mistral、Cohere;国内 DeepSeek、阿里通义、字节豆包、月之暗面、智谱、MiniMax、阶跃、百川、腾讯混元、百度文心
④ 工具与中间件 模型托管、微调、推理服务、评测、数据标注 社区网络效应 + 与模型的适配深度 Hugging Face、vLLM/开源栈、Scale AI、LangChain 类框架
⑤ 垂直应用 把模型封装成可交付的工作流 领域数据 + 合规资质 + 用户习惯 Cursor/Anysphere、Perplexity、Midjourney、Runway、ElevenLabs、Harvey;国内讯飞、商汤、旷视
⑥ 机器人与具身 把模型接到物理世界 硬件供应链 + 真实数据闭环 Figure、1X、Physical Intelligence、宇树、智元、Waymo

读这张表要抓住三个不对称。

模型层的护城河最浅 权重可以开源、配方会被追平、人才会流动。因此模型层公司必须不断把领先转化为产品、分发渠道或数据闭环,否则领先会被时间抹平。
越靠下越像基础设施 芯片与云的壁垒来自资本与生态,一旦形成极难替代,但增长也会随行业周期波动。
垂直应用的壁垒不在模型 它在于领域数据、合规资质和已经嵌入的用户流程。这也意味着做应用的人不应该把精力放在追最新模型上,而应放在数据与交付上。

同样的分层逻辑适用于任何一个国家的 AI 产业 —— 你可以用这六层把本地生态重新填一遍,这比记住任何一份公司榜单都更耐用。

05
学习路径 / Roadmap

带检验标准的分阶段路线

大多数「学习路线」只列书单,问题在于你无法判断自己是否真的学完了。 下面每一阶段都给出可验证的产出物自我检验问题 —— 答不上来就说明还没到位,不管书读了几遍。

阶段内容可验证产出物自我检验(答不上就是没懂)
0 · 数学与工程底座 线性代数(SVD、特征分解、矩阵求导)、概率统计(贝叶斯、假设检验、期望与方差)、微积分(多元、链式法则、雅可比与 Hessian)、凸优化基础(梯度、拉格朗日、KKT)、信息论(熵、KL 散度、互信息);Python + NumPy + PyTorch + Git + GPU 使用 手推线性回归的闭式解与梯度解;手写 NumPy 版两层网络并与 PyTorch 对拍同一组权重 为什么 L2 正则在贝叶斯视角下等价于高斯先验?为什么 KL 散度不对称,又在哪一侧更容易出问题?
1 · 机器学习基础 偏差-方差分解、正则化、交叉验证、核方法与 SVM、集成方法(随机森林、GBDT)、EM 算法、概率图模型入门 从零实现一个 GBDT 或逻辑回归,并在一个真实表格数据集上跑出与 sklearn 可比的指标 为什么随机森林不需要交叉验证来选树的数量,而 GBDT 需要?
2 · 深度学习 反向传播的手工推导、优化器(SGD 动量 / Adam 及其变体)、归一化层、正则化与初始化、训练技巧与调试、PyTorch 工程化(数据管道、混合精度、分布式) 不用 autograd 实现一个含卷积与注意力的可训练模块;复现一个小论文或一个 Kaggle 基线 BatchNorm 在训练与推理时的行为差异是什么?为什么它对小 batch 不友好?
3 · 方向深入(择一至二) NLP(词表示、Transformer 细节、预训练与对齐、评测)/CV(检测分割、自监督、三维与生成)/RL(MDP、策略梯度、值方法、离线 RL)/系统(并行策略、显存优化、编译与算子)/理论(泛化、优化理论、缩放律) 在选定方向上精读 15–25 篇核心论文并写出结构化笔记;能画出该方向的技术演进图并对每个转折给出因果解释 该方向三年前的主流方法与今天的方法,差异的根本原因是什么?是结构、数据还是算力?
4 · 研究能力 读论文(多轮法:先结论与图表,再方法,最后细节)、复现规范、实验设计与消融、日志与可复现性、学术写作、审稿视角 完成一次可被他人复现的改进实验;写出一份含消融与误差分析的实验报告;给一篇投稿写出审稿意见 你的改进在所有随机种子下都稳定吗?删掉你最主要的模块后,性能下降了多少?
5 · 选题与产出 识别真问题、界定贡献边界、构建 baseline、控制实验规模、论文与代码的同步发布 一篇可投稿的工作;或一个被他人实际使用的开源实现 如果把你论文中的新方法替换掉,问题还能被解决吗?如果能,你的贡献到底是什么?

5.1 核心书目

BOOKS
定位怎么读
Bishop《Pattern Recognition and Machine Learning》贝叶斯视角的 ML 全景精读前四章与图模型两章;其余按需
Hastie 等《The Elements of Statistical Learning》频率派视角 + 大量方法当工具书查,重点读第 3、7、12 章
Goodfellow 等《Deep Learning》深度学习体系化教材第 6–11 章是地基,其余可跳
Sutton & Barto《Reinforcement Learning》RL 的规范定义与算法读完 Part I–II;第三部分按方向取舍
Prince《Understanding Deep Learning》较新的 DL 教材,图示好与 Goodfellow 互补,适合先建立直觉
Boyd《Convex Optimization》优化基础前五章足够支撑大部分阅读需求

5.2 建议精读的论文

PAPERS
主题起点
卷积网络LeCun 1989;AlexNet 2012;ResNet 2015
序列与注意力LSTM 1997;Bahdanau 注意力 2014;Transformer 2017
预训练范式word2vec 2013;GPT-1/BERT 2018;GPT-3 2020
缩放律与数据Kaplan 2020;Chinchilla 2022
对齐InstructGPT/RLHF 2022;DPO 2023;Constitutional AI 2022
生成模型GAN 2014;VAE 2013;DDPM 2020;Latent Diffusion 2022
强化学习DQN 2015;PPO 2017;AlphaZero 2017;MuZero 2019
推理模型CoT 2022;自洽性 2022;o1 与 DeepSeek-R1 2025
高效架构FlashAttention 2022;GQA 2023;Mamba 2023

读法:先读摘要与图表 → 用自己的话写出它解决的问题与做法 → 再核对方法细节 → 最后问「它的假设在我的场景里成立吗」。

5.3 进度清单

进度保存在本机浏览器
已完成 0 / 8 本地保存:—
06
读研实操 / Practice

七个能省下一年时间的习惯

这一节不含新知识,全是可操作的规范。它们不提升你的智力上限,但直接决定你的有效产出。

01 · 先建 baseline在动新方法之前,把最简单的 baseline 跑到可复现。90% 的「新方法有效」最终被证明是 baseline 没调好。
02 · 一切可复现固定随机种子、记录环境与数据版本、把超参写进配置文件而不是命令行历史。你自己的复现是最容易被忽略的坑。
03 · 实验日志当天写记录「为什么做这个实验、结果是什么、下一步」。三周后你只会记得结论,而丢失全部推理过程。
04 · 小规模先验证在能训完的尺度上把流程跑通、把指标对齐,再放大。不要用一次昂贵的训练去验证一个本可以在十分钟内证伪的假设。
05 · 用多种子说话单次运行的差距大多落在噪声内。至少三个种子,并报告均值与方差。
06 · 主动问「为什么」指标涨了要能解释机制。如果只是「试出来有效」,那你还没有可以写进论文的贡献。
07 · 控制选题范围把「我想解决什么」压缩到能在一学期内做完的程度。范围失控是研究生阶段最常见的失败模式,而不是能力不足。

常见误区

ANTI-PATTERNS
误区后果与纠正
跳过数学直接调库能跑通别人的代码,但无法诊断失败原因。纠正:对自己常用的每个算子,至少手推一次它的梯度。
只追最新模型三年后你会的工具全部换掉,但方法论的折旧慢得多。投资于可迁移的判断力
把榜单分数当能力基准饱和与数据污染使跨代比较常常无效。纠正:在你自己关心的分布上做小评测。
论文复现失败就放弃复现失败本身是信息。先怀疑自己的工程细节(数据划分、学习率调度、评测口径),再去怀疑论文。
过早追求创新点没有可靠 baseline 的「创新」无法被证明。纠正:把 baseline 做到自己都难以超越,再谈改进。
07
开放问题 / Open Problems

七个真正没有答案的问题

选题的最佳来源不是「哪个方向热」,而是「哪个问题被公认为重要但没人解决」。 下面每一条都附上为什么它难,而不只是它重要。

问题现状为什么难
① 样本效率 人类看几张图就能学会一个新类别,模型常需成千上万 缺少对「先验从何而来」的统一解释;元学习与贝叶斯方法只在窄设定下有效
② 长程推理的可靠性 多步推理中一步出错会传播,且模型难以察觉自身错误 缺乏对自身状态的不确定性建模;错误检测需要模型具有「知道自己不知道」的能力,而这与训练目标并不直接相关
③ 可解释性与机制 有电路级分析等进展,但离「能预测行为」还很远 高维非凸系统的表征难以定位到语义单元;可解释的粒度与实用性之间存在取舍
④ 评测的可信度 基准快速饱和与污染,静态基准难以刻画真实能力 能力边界本身是移动的;任何固定测试集都会随时间失效,而动态评测又引入不可复现性
⑤ 对齐与可控性 RLHF 类方法有效但脆弱,代理目标与真实意图之间存在偏差 人类偏好难以完整表述;奖励黑客(reward hacking)是优化过程的内生现象,而非实现缺陷
⑥ 成本、能耗与数据枯竭 训练成本以千万美元计;高质量公开语料接近用尽 规模增长与数据供给之间存在结构性矛盾;合成数据能否替代真实数据尚无定论,且存在模型坍缩风险
⑦ 因果与泛化 模型擅长分布内插值,分布外与反事实表现明显下降 观测数据只能识别相关;要从数据中恢复因果机制需要额外假设或干预实验,而干预往往代价高昂
把不可判定问题改写成可观测问题

—— Turing 在 1950 年所做的那个替换,仍然是这个领域最值得学习的方法论。
本页所有公式与数量级都可以被你改参数复算,这正是它想示范的态度。