从感知机
到推理模型
这不是一份科普。它是一张给已具备线代、概率、算法基础的人的技术地图: 发展脉络、分支体系、模型谱系、产业分层、可达检验标准的学习路径, 以及七个当前真正没有解决的问题。
这份文档的边界
先说清楚它不能做什么,比承诺能做什么更有用。
| 时间线截点 | 事件表停在撰写时我能确证的最新节点(约 2025 年初)。此后进展请自行补充 —— 我不会为凑数而编造后续事件。 |
| 数量级而非精确值 | 参数量、算力、显存均给出计算口径与假设,你可以改参数复算。文中的具体数字用于建立量级感,不作为引用来源。 |
| 产业信息半衰期短 | 公司格局一节描述的是结构(谁在哪一层、因何有护城河),具体名单会快速过时。 |
| 不替代论文 | 每节末尾指向该方向应读的原始文献。本页的作用是让你知道「该读什么、为什么读、读到什么程度算够」。 |
三次浪潮,两次寒冬
值得注意的不是年份,而是每次兴起与崩塌的机制几乎相同: 方法在窄领域取得突破 → 承诺被外推到通用智能 → 落地成本与预期落差暴露 → 经费收缩。 判断一轮热潮是否可持续,看的是它能否把成本压到商业闭环以内。
McCulloch–Pitts 神经元
用阈值逻辑单元刻画神经活动,给出第一个可计算的神经元模型。今天每一个 nn.Linear 加激活函数,仍是它的直系后裔。
Hebb 学习规则
「一起激发的神经元会连在一起」—— 第一个可学习的突触更新规则,把「学习」从哲学问题变成了权重调整问题。
图灵测试
Turing 在《Computing Machinery and Intelligence》中把「机器能思考吗」替换为一个可操作的判据。这个替换本身就是方法论示范:把不可判定问题改写成可观测问题。
Dartmouth 会议
McCarthy 在会议提案中首次使用 "Artificial Intelligence",AI 成为独立学科分支。当时的乐观估计是「十个人两个月就能取得实质性进展」。
Rosenblatt 感知机
带可学习权重的线性分类器与感知机学习算法,并给出收敛性证明。第一次让「机器从数据中学习」有了可运行的实体。
Samuel 跳棋程序
用自我对弈与搜索让程序超过自己,并首次提出 machine learning 一词。注意它的路径是「搜索 + 自举」,而非今天的梯度下降。
ELIZA
基于模式匹配的对话程序,却让使用者产生「它理解了」的错觉,即后来的 ELIZA 效应。这一现象在今天的对话模型上以更强形式重现,是评估人类判断可靠性的经典案例。
《Perceptrons》
Minsky 与 Papert 严格证明单层感知机无法表示 XOR。结论本身正确,但被广泛误读为「多层网络也没前途」,直接导致连接主义研究经费断裂十余年。
第一次 AI 寒冬
Lighthill 报告打击英国资助,DARPA 收缩通用问题求解与机器翻译项目。承诺未兑现的原因很具体:组合爆炸与常识知识的规模都被严重低估。
专家系统商业化
XCON/R1 在 DEC 投入生产,规则库 + 推理机的路线首次形成商业闭环;日本启动第五代计算机计划。局限也很明确:规则库维护成本随规模非线性增长。
反向传播的推广
Rumelhart、Hinton、Williams 在 Nature 发表 BP 算法,使多层网络可训练(Werbos 已于 1974 年提出)。同期仍缺两件东西:足够的数据与足够的算力。
LeNet 与卷积网络
LeCun 把卷积结构与 BP 结合用于手写邮编识别,在真实业务中运行。局部连接 + 权重共享这一归纳偏置从此成为视觉领域的基本假设。
第二次 AI 寒冬
LISP 机市场崩溃,专家系统的维护成本超过收益。一个值得记住的后果:研究者开始回避 "AI" 这个词,转用「机器学习」「模式识别」「智能系统」等标签。
SVM 与核方法
Cortes 与 Vapnik 提出软间隔 SVM;配合 VC 维与结构风险最小化,统计学习理论第一次为「小样本为什么能泛化」提供了定量框架。这一支的遗产是今天的泛化界与理论分析。
LSTM
Hochreiter 与 Schmidhuber 用门控与常量误差流解决长程依赖,此后约十五年里是序列建模的主力,也是「用结构设计对抗梯度问题」的范例。
Deep Blue 战胜 Kasparov
以大规模搜索 + 人工评估函数取胜,核心不是学习。它的意义主要在公众预期与「专用系统可在限定域超越人类」的证明。
深度学习复兴
Hinton 用逐层无监督预训练训练深度信念网络,让「深层网络可训练」重新成立,并以 representation learning 重构了叙事。
ImageNet
千万级人工标注图像数据集发布,并配套统一的评测任务。它同时提供了燃料(数据)与标尺(榜单),这两者缺一不可。
AlexNet
GPU + ReLU + Dropout 在 ImageNet 上大幅刷新纪录,误差下降幅度远超此前任何单篇工作。深度学习的产业拐点由此开始 —— 真正起作用的是算力可及性的改变。
seq2seq / Attention / GAN
编码器-解码器统一了翻译等序列到序列任务;Bahdanau 注意力缓解了定长瓶颈;GAN 提出对抗式生成。三条线都指向同一件事:用可微结构替代手工对齐。
ResNet
残差连接让上百层网络可稳定训练。它与 BatchNorm 一起说明:深度不是被梯度消失限制的,而是被优化条件限制的,而结构设计可以直接改善优化条件。
AlphaGo
策略网络 + 价值网络 + 蒙特卡洛树搜索击败李世石。关键贡献是把深度网络的直觉与搜索的严谨结合起来,解决搜索空间无法枚举的问题。
Transformer
《Attention Is All You Need》用自注意力取代循环结构,把序列建模的计算从串行变为可并行。此后几乎所有大模型都以此为骨架 —— 这一条是整个现代 AI 的分界线。
BERT 与 GPT
「预训练 + 微调」范式确立:先在无标注语料上做自监督预训练,再用少量标注数据适配下游任务。这解决了长期制约的标注瓶颈。
GPT-3(175B)
规模带来上下文学习(in-context learning)与 few-shot 能力,提示开始部分取代微调。能力随规模出现而不需专门设计,是这一阶段最反直觉的观察。
AlphaFold2
在 CASP14 上达到接近实验精度的蛋白质结构预测,成为 AI for Science 的标志性成果。它示范了把领域先验(几何、对称性)编进网络结构的价值。
DDPM 与扩散模型
去噪扩散概率模型逐步取代 GAN 成为图像生成主流:训练目标稳定(回归噪声)、模式覆盖好,代价是采样需要多步迭代 —— 训练稳定性换采样速度的典型取舍。
Chinchilla 缩放律
在固定算力预算下,模型规模与数据量应等比例增长(约 20 token / 参数),而非只堆参数。它修正了一整代「大而欠训」的做法,也解释了此后训练数据需求的暴涨。
InstructGPT / RLHF
用人类偏好数据做强化学习微调,把「会续写」变成「会听指令」。同年 Stable Diffusion 开源,生成模型进入大众可用阶段。对齐从研究问题变成了产品必需环节。
ChatGPT
把对齐后的大模型包装成对话产品,两个月内用户过亿,AI 进入大众阶段。技术并未在此时突变,变的是交互形态与可及性。
GPT-4 / Llama 2 / Mixtral
三条线同时推进:多模态与更强的推理、可商用的开放权重(Llama 2)、稀疏混合专家(Mixtral 8×7B)。此后「开源权重 + 闭源前沿」成为稳定的双轨格局。
推理时计算(o1 系列)
用强化学习训练长思维链,把算力从训练阶段搬到推理阶段:面对难题时投入更多 token 与采样换取更高正确率。这打破了「模型已训练完、推理成本固定」的旧假设。
DeepSeek-R1
证明仅用可验证奖励的强化学习(答案对错可由规则判定)即可激发长链推理能力,且权重开放。它把推理模型从少数实验室的专有技术推向普遍可得,并显著压低成本预期。
待补充
上面最后一站是我能确证的时间线终点。请在此处自行接续:判断新事件是否值得写入的标准是它是否改变了成本结构或能力边界,而不是它是否上了新闻。
共 34 条
四种正交的切法
大多数人描述 AI 分支时把不同维度的东西混在一句话里(「深度学习和计算机视觉」——一个是方法,一个是任务)。 下面四条轴彼此正交,任何一项具体工作都可以在其中定位。建立这个坐标系,比背下分支名单有用得多。
轴 A · 方法论范式
METHODOLOGY| 范式 | 核心假设 | 优势 | 代价 | 今天的角色 |
|---|---|---|---|---|
| 符号主义 | 智能 = 符号操作与逻辑推理 | 可解释、可验证、可组合 | 知识获取瓶颈;对噪声脆弱 | 与神经方法结合:工具调用、形式化验证、知识图谱 |
| 连接主义 | 智能 = 大量简单单元的加权连接 | 免手工特征;可随规模扩展 | 数据与算力饥渴;可解释性弱 | 当前主流:一切大模型的底座 |
| 统计学习 | 从有限样本推断泛化能力 | 小样本可用;有理论保证 | 依赖特征工程;难处理非结构化数据 | 核方法、概率模型、泛化理论、不确定性量化 |
| 贝叶斯方法 | 用概率分布表达全部不确定性 | 校准良好;可做决策与实验设计 | 推断常不可解,需近似 | 变分推断、贝叶斯优化、概率编程 |
| 因果推断 | 区分相关与干预,建模机制 | 支持反事实与策略评估 | 需强假设;难从观测数据识别 | 鲁棒性、公平性、科学发现 |
轴 B · 监督信号
LEARNING SIGNAL| 类型 | 信号来源 | 目标 | 典型规模与代表 |
|---|---|---|---|
| 监督 | 人工标注 (x, y) | 拟合条件分布 p(y|x) | 10³–10⁶ 样本;分类、检测 |
| 无监督 | 仅有 x | 发现结构:聚类、降维、密度 | 无标注上限;K-means、PCA、密度估计 |
| 自监督 | 从数据自身构造监督信号 | 学可迁移表示 | 10¹²–10¹³ token;掩码预测、对比学习、下一 token 预测 |
| 强化学习 | 环境奖励 | 最大化累积回报 | 交互成本高;策略梯度、Q-learning、MCTS |
| 从人类反馈中学习 | 人类偏好比较 | 对齐到人类偏好 | RLHF、DPO —— 现代模型训练的标准收尾阶段 |
| 可验证奖励 RL | 规则/单元测试判定对错 | 激发长链推理与自我检查 | 数学、代码等有客观判据的领域 |
| 上下文学习 | 提示中的示例 | 无需更新参数即适配任务 | 推理时生效;能力随规模涌现 |
关键脉络:自监督 + 上下文学习这两项的成熟,是把标注成本从瓶颈位置上挪开的原因。理解这两条,就理解了 2018 年后的整段历史。
轴 C · 数据模态与任务域
MODALITY & DOMAIN| 方向 | 核心任务 | 代表方法 / 模型 | 当前主要开放难点 |
|---|---|---|---|
| 计算机视觉 | 分类、检测、分割、深度估计、三维重建、生成 | ResNet、ViT、DETR、SAM、NeRF/3DGS | 三维与物理一致性;长视频时序理解 |
| 自然语言处理 | 分类、抽取、翻译、问答、检索、生成 | BERT、GPT 系列、T5、RAG 架构 | 事实性;长文档推理;多语言一致性 |
| 语音 | 识别、合成、说话人、语音翻译 | Conformer、Whisper、TTS 声码器 | 噪声与口音鲁棒性;低延迟流式 |
| 多模态 | 图文对齐、视觉问答、视频理解、文档理解 | CLIP、LLaVA 类 VLM、原生多模态模型 | 细粒度空间推理;模态间幻觉 |
| 图与关系数据 | 节点/边预测、图生成、分子性质 | GCN、GAT、Graph Transformer | 异质图与动态图;可扩展性 |
| 时序与信号 | 预测、异常检测、分类 | TFT、Informer、时序基础模型 | 分布漂移;长期预测的理论界 |
| 推荐与搜索 | 召回、排序、重排、查询理解 | 双塔、DIN、生成式推荐、LLM 重排 | 冷启动;反馈回路导致偏见放大 |
| 决策与控制 | 规划、操作、自动驾驶、具身 | MuZero、扩散策略、VLA 模型 | 仿真到现实迁移;长程任务组合 |
| AI for Science | 蛋白质、材料、天气、数学定理 | AlphaFold2、GNoME、GraphCast、神经算子 | 数据稀缺;外推与守恒律保证 |
轴 D · 生成式模型族
GENERATIVE FAMILIES判别式模型输出标签或分数;生成式模型建模数据分布本身。五类生成模型可以按「训练稳定性 vs 采样速度」排开 —— 这是一个非常清晰的取舍轴,也是理解生成模型演进的钥匙。
| 族 | 核心思想 | 训练稳定性 | 采样速度 | 代表 |
|---|---|---|---|---|
| 自回归 | 按序分解联合分布,逐项预测 | 高(似然目标) | 慢(串行,每步一次前向) | GPT 系列、PixelCNN |
| 扩散 / 流匹配 | 学去噪或速度场,逐步还原 | 高(回归目标) | 中(需多步;蒸馏后可 1–4 步) | DDPM、Stable Diffusion、DiT |
| GAN | 生成器与判别器对抗博弈 | 低(易崩、需精细调参) | 快(单次前向) | StyleGAN、pix2pix |
| VAE | 变分下界优化的隐变量模型 | 高 | 快 | β-VAE、VQ-VAE |
| 归一化流 | 可逆变换,精确似然 | 高 | 快 | RealNVP、Glow |
趋势读法:GAN 采样快但训练难,扩散训练稳但采样慢,自回归统一了文本与代码却受串行限制。2024 年后的推理模型把自回归的串行劣势重构成了优势 —— 串行 = 可以边想边算。
架构、训练范式与推理优化
看模型不要只记名字。先问它的归纳偏置是什么、复杂度随序列长度如何增长、训练时能否并行 —— 这三个维度基本决定了一个架构能用在什么场景、卡在哪里。
3.1 架构谱系与归纳偏置
ARCHITECTURES| 架构 | 归纳偏置 | 复杂度(n = 序列长度) | 训练并行性 | 代表 | 适合场景 |
|---|---|---|---|---|---|
| MLP | 无结构先验,全连接 | 参数 O(n·m) | 高 | 早期网络 | 表格数据、小规模 |
| CNN | 局部性 + 平移等变 | O(n·k),k 为核宽 | 高 | ResNet、ConvNeXt | 图像、局部纹理、时序 |
| RNN / LSTM / GRU | 递归 + 权重时间共享 | O(n),但串行 | 低(时间步串行) | LSTM、GRU | 流式、短序列、低资源 |
| Transformer | 全局注意力、内容寻址 | 注意力 O(n²) | 高(训练) | GPT、BERT、ViT | 通用主力;长文本需专门优化 |
| SSM / 选择性状态空间 | 线性递归 + 输入相关选择 | O(n) | 高(可并行扫描) | S4、Mamba | 超长序列、高效推理 |
| GNN | 图结构上的消息传递 | O(E),E 为边数 | 中 | GCN、GAT | 分子、社交、知识图 |
| MoE(稀疏专家) | 条件计算,按输入激活部分参数 | 激活 O(k/N · FFN) | 高(需专家并行) | Mixtral、DeepSeek-V3 | 用较低推理成本换更大容量 |
| 扩散 / 流匹配 | 迭代去噪,时间步共享权重 | 采样 O(T) 步 | 高 | Stable Diffusion、DiT | 图像、视频、三维、动作 |
注意 混合架构已成为常规做法:MoE + 注意力、SSM + 注意力层交替、扩散 + Transformer 骨干。 不要用「哪一个更好」的方式提问,要问「在什么约束下哪个更划算」。
3.2 训练与适配范式
TRAINING PIPELINE| 阶段 | 数据 | 目标函数 | 作用 |
|---|---|---|---|
| 预训练 | 海量无标注语料 | 下一 token 预测(交叉熵) | 获得通用表示与世界知识 |
| 监督微调 SFT | 指令-回答对(10⁴–10⁶) | 同样是交叉熵,但只在回答段计损失 | 学会遵循指令的格式与风格 |
| RLHF | 人类偏好比较对 | 奖励模型 + PPO | 对齐到人类偏好,降低有害输出 |
| DPO | 偏好比较对 | 直接在偏好上做类监督优化 | 省掉奖励模型与 RL 循环,更易复现 |
| 可验证奖励 RL | 有客观判定的题目 + 答案校验器 | 按最终正确性给奖励 | 激发长链推理与自我纠错 |
| 参数高效微调 | 小规模领域数据 | LoRA / 前缀 / 适配器 | 单卡即可把大模型适配到垂直域 |
| 蒸馏 | 教师模型的输出分布 | KL 散度对齐软标签 | 把能力压缩到小模型 |
3.3 推理侧优化
INFERENCE训练是资本支出,推理是运营支出。当服务量足够大,推理优化带来的收益往往超过换更大的模型。
| 技术 | 解决什么 |
|---|---|
| KV cache | 缓存历史键值,避免每步重算 —— 代价是显存随上下文线性增长 |
| MQA / GQA | 多个查询头共享少数键值头,把 KV cache 缩小数倍 |
| RoPE 与外推 | 旋转位置编码,配合插值/缩放可扩展有效上下文 |
| FlashAttention | 分块计算注意力,避免物化 n×n 矩阵,显存从 O(n²) 降到 O(n) |
| 推测解码 | 小模型起草、大模型并行校验,打破串行生成的吞吐瓶颈 |
| 量化 | 权重/激活降到 8/4 bit,PTQ 或 QAT,换显存与带宽 |
| 并行策略 | 数据/张量/流水/专家并行,决定能否在集群上高效扩展 |
3.4 训练算力估算器
C ≈ 6 · P · D | CHINCHILLA D* ≈ 20P
口径说明:C ≈ 6PD 来自「前向 2PD + 反向 4PD」的标准估计,仅计稠密矩阵乘,
不含注意力随序列长度的二次项与通信开销;因此实际所需算力通常高于此估算。
用 Llama-2 70B(70B 参数 / 2T token / 报告约 1.72M A100-hours)反查:本口径在 MFU 50% 时给出 1.5M A100-hours,
量级吻合 —— 说明用它做预算规划是站得住的。
3.5 KV cache 显存计算器
2 · L · Hkv · dhead · S · B · bytes
口径说明:只计 KV cache,不含权重与激活。权重占用可用 参数量 × 精度字节数 单独估算
(如 70B 在 FP16 下约 140 GB)。长上下文推理的真实瓶颈常常就是这张表里最后一行:
KV cache 随序列线性增长,而显存是固定的,这直接决定了你能开多大的并发。
3.6 评测:比基准分数更容易出错的地方
EVALUATION| 基准类别 | 测什么 | 代表 |
|---|---|---|
| 知识 | 多学科选择题 | MMLU、CMMLU |
| 推理 | 竞赛级理工题 | GPQA、AIME、MATH |
| 代码 | 函数级生成、真实仓库修复 | HumanEval、MBPP、SWE-bench |
| 对话偏好 | 成对比较、人工或模型裁判 | MT-Bench、Chatbot Arena |
| 长上下文 | haystack 检索、多文档推理 | RULER、LongBench |
| 智能体 | 多步工具使用与规划 | AgentBench、WebArena |
四个反复出现的陷阱:
① 数据污染 —— 测试集进了训练语料,分数不可比。看论文时先去找它的污染检测部分。
② 基准饱和 —— 接近满分后区分度消失,于是不断有新基准,导致跨代不可比。
③ 基准 ≠ 能力 —— 高分不等于在你关心的分布上可用;一定要在自己的数据上做小规模评测。
④ 裁判偏差 —— 用模型当裁判时,裁判自身有位置偏差、长度偏差与自我偏好。
六层结构,以及每层的护城河
记公司名单没有意义,名单会变。有意义的是结构:AI 产业是分层堆叠的, 每一层的壁垒来源完全不同,这决定了一家公司能守住什么、又会被什么颠覆。
| 层 | 做什么 | 壁垒来源 | 代表 |
|---|---|---|---|
| ① 芯片与算力 | 训练/推理加速器、互联、制造 | 制程 + 软件生态(CUDA 的历史积累)+ 产能 | NVIDIA、AMD、Google TPU、AWS Trainium、华为昇腾、寒武纪;新架构路线 Groq、Cerebras |
| ② 云与集群 | 提供算力租用、调度、数据服务 | 资本开支规模 + 网络与电力 + 企业客户关系 | AWS、Azure、Google Cloud、阿里云、腾讯云、火山引擎 |
| ③ 基础模型 | 训练通用/多模态大模型并对外提供 | 人才密度 + 训练配方(含数据配比)+ 算力可得性 | OpenAI、Anthropic、Google DeepMind、Meta、xAI、Mistral、Cohere;国内 DeepSeek、阿里通义、字节豆包、月之暗面、智谱、MiniMax、阶跃、百川、腾讯混元、百度文心 |
| ④ 工具与中间件 | 模型托管、微调、推理服务、评测、数据标注 | 社区网络效应 + 与模型的适配深度 | Hugging Face、vLLM/开源栈、Scale AI、LangChain 类框架 |
| ⑤ 垂直应用 | 把模型封装成可交付的工作流 | 领域数据 + 合规资质 + 用户习惯 | Cursor/Anysphere、Perplexity、Midjourney、Runway、ElevenLabs、Harvey;国内讯飞、商汤、旷视 |
| ⑥ 机器人与具身 | 把模型接到物理世界 | 硬件供应链 + 真实数据闭环 | Figure、1X、Physical Intelligence、宇树、智元、Waymo |
读这张表要抓住三个不对称。
| 模型层的护城河最浅 | 权重可以开源、配方会被追平、人才会流动。因此模型层公司必须不断把领先转化为产品、分发渠道或数据闭环,否则领先会被时间抹平。 |
| 越靠下越像基础设施 | 芯片与云的壁垒来自资本与生态,一旦形成极难替代,但增长也会随行业周期波动。 |
| 垂直应用的壁垒不在模型 | 它在于领域数据、合规资质和已经嵌入的用户流程。这也意味着做应用的人不应该把精力放在追最新模型上,而应放在数据与交付上。 |
同样的分层逻辑适用于任何一个国家的 AI 产业 —— 你可以用这六层把本地生态重新填一遍,这比记住任何一份公司榜单都更耐用。
带检验标准的分阶段路线
大多数「学习路线」只列书单,问题在于你无法判断自己是否真的学完了。 下面每一阶段都给出可验证的产出物与自我检验问题 —— 答不上来就说明还没到位,不管书读了几遍。
| 阶段 | 内容 | 可验证产出物 | 自我检验(答不上就是没懂) |
|---|---|---|---|
| 0 · 数学与工程底座 | 线性代数(SVD、特征分解、矩阵求导)、概率统计(贝叶斯、假设检验、期望与方差)、微积分(多元、链式法则、雅可比与 Hessian)、凸优化基础(梯度、拉格朗日、KKT)、信息论(熵、KL 散度、互信息);Python + NumPy + PyTorch + Git + GPU 使用 | 手推线性回归的闭式解与梯度解;手写 NumPy 版两层网络并与 PyTorch 对拍同一组权重 | 为什么 L2 正则在贝叶斯视角下等价于高斯先验?为什么 KL 散度不对称,又在哪一侧更容易出问题? |
| 1 · 机器学习基础 | 偏差-方差分解、正则化、交叉验证、核方法与 SVM、集成方法(随机森林、GBDT)、EM 算法、概率图模型入门 | 从零实现一个 GBDT 或逻辑回归,并在一个真实表格数据集上跑出与 sklearn 可比的指标 | 为什么随机森林不需要交叉验证来选树的数量,而 GBDT 需要? |
| 2 · 深度学习 | 反向传播的手工推导、优化器(SGD 动量 / Adam 及其变体)、归一化层、正则化与初始化、训练技巧与调试、PyTorch 工程化(数据管道、混合精度、分布式) | 不用 autograd 实现一个含卷积与注意力的可训练模块;复现一个小论文或一个 Kaggle 基线 | BatchNorm 在训练与推理时的行为差异是什么?为什么它对小 batch 不友好? |
| 3 · 方向深入(择一至二) | NLP(词表示、Transformer 细节、预训练与对齐、评测)/CV(检测分割、自监督、三维与生成)/RL(MDP、策略梯度、值方法、离线 RL)/系统(并行策略、显存优化、编译与算子)/理论(泛化、优化理论、缩放律) | 在选定方向上精读 15–25 篇核心论文并写出结构化笔记;能画出该方向的技术演进图并对每个转折给出因果解释 | 该方向三年前的主流方法与今天的方法,差异的根本原因是什么?是结构、数据还是算力? |
| 4 · 研究能力 | 读论文(多轮法:先结论与图表,再方法,最后细节)、复现规范、实验设计与消融、日志与可复现性、学术写作、审稿视角 | 完成一次可被他人复现的改进实验;写出一份含消融与误差分析的实验报告;给一篇投稿写出审稿意见 | 你的改进在所有随机种子下都稳定吗?删掉你最主要的模块后,性能下降了多少? |
| 5 · 选题与产出 | 识别真问题、界定贡献边界、构建 baseline、控制实验规模、论文与代码的同步发布 | 一篇可投稿的工作;或一个被他人实际使用的开源实现 | 如果把你论文中的新方法替换掉,问题还能被解决吗?如果能,你的贡献到底是什么? |
5.1 核心书目
BOOKS| 书 | 定位 | 怎么读 |
|---|---|---|
| Bishop《Pattern Recognition and Machine Learning》 | 贝叶斯视角的 ML 全景 | 精读前四章与图模型两章;其余按需 |
| Hastie 等《The Elements of Statistical Learning》 | 频率派视角 + 大量方法 | 当工具书查,重点读第 3、7、12 章 |
| Goodfellow 等《Deep Learning》 | 深度学习体系化教材 | 第 6–11 章是地基,其余可跳 |
| Sutton & Barto《Reinforcement Learning》 | RL 的规范定义与算法 | 读完 Part I–II;第三部分按方向取舍 |
| Prince《Understanding Deep Learning》 | 较新的 DL 教材,图示好 | 与 Goodfellow 互补,适合先建立直觉 |
| Boyd《Convex Optimization》 | 优化基础 | 前五章足够支撑大部分阅读需求 |
5.2 建议精读的论文
PAPERS| 主题 | 起点 |
|---|---|
| 卷积网络 | LeCun 1989;AlexNet 2012;ResNet 2015 |
| 序列与注意力 | LSTM 1997;Bahdanau 注意力 2014;Transformer 2017 |
| 预训练范式 | word2vec 2013;GPT-1/BERT 2018;GPT-3 2020 |
| 缩放律与数据 | Kaplan 2020;Chinchilla 2022 |
| 对齐 | InstructGPT/RLHF 2022;DPO 2023;Constitutional AI 2022 |
| 生成模型 | GAN 2014;VAE 2013;DDPM 2020;Latent Diffusion 2022 |
| 强化学习 | DQN 2015;PPO 2017;AlphaZero 2017;MuZero 2019 |
| 推理模型 | CoT 2022;自洽性 2022;o1 与 DeepSeek-R1 2025 |
| 高效架构 | FlashAttention 2022;GQA 2023;Mamba 2023 |
读法:先读摘要与图表 → 用自己的话写出它解决的问题与做法 → 再核对方法细节 → 最后问「它的假设在我的场景里成立吗」。
5.3 进度清单
进度保存在本机浏览器七个能省下一年时间的习惯
这一节不含新知识,全是可操作的规范。它们不提升你的智力上限,但直接决定你的有效产出。
| 01 · 先建 baseline | 在动新方法之前,把最简单的 baseline 跑到可复现。90% 的「新方法有效」最终被证明是 baseline 没调好。 |
| 02 · 一切可复现 | 固定随机种子、记录环境与数据版本、把超参写进配置文件而不是命令行历史。你自己的复现是最容易被忽略的坑。 |
| 03 · 实验日志当天写 | 记录「为什么做这个实验、结果是什么、下一步」。三周后你只会记得结论,而丢失全部推理过程。 |
| 04 · 小规模先验证 | 在能训完的尺度上把流程跑通、把指标对齐,再放大。不要用一次昂贵的训练去验证一个本可以在十分钟内证伪的假设。 |
| 05 · 用多种子说话 | 单次运行的差距大多落在噪声内。至少三个种子,并报告均值与方差。 |
| 06 · 主动问「为什么」 | 指标涨了要能解释机制。如果只是「试出来有效」,那你还没有可以写进论文的贡献。 |
| 07 · 控制选题范围 | 把「我想解决什么」压缩到能在一学期内做完的程度。范围失控是研究生阶段最常见的失败模式,而不是能力不足。 |
常见误区
ANTI-PATTERNS| 误区 | 后果与纠正 |
|---|---|
| 跳过数学直接调库 | 能跑通别人的代码,但无法诊断失败原因。纠正:对自己常用的每个算子,至少手推一次它的梯度。 |
| 只追最新模型 | 三年后你会的工具全部换掉,但方法论的折旧慢得多。投资于可迁移的判断力。 |
| 把榜单分数当能力 | 基准饱和与数据污染使跨代比较常常无效。纠正:在你自己关心的分布上做小评测。 |
| 论文复现失败就放弃 | 复现失败本身是信息。先怀疑自己的工程细节(数据划分、学习率调度、评测口径),再去怀疑论文。 |
| 过早追求创新点 | 没有可靠 baseline 的「创新」无法被证明。纠正:把 baseline 做到自己都难以超越,再谈改进。 |
七个真正没有答案的问题
选题的最佳来源不是「哪个方向热」,而是「哪个问题被公认为重要但没人解决」。 下面每一条都附上为什么它难,而不只是它重要。
| 问题 | 现状 | 为什么难 |
|---|---|---|
| ① 样本效率 | 人类看几张图就能学会一个新类别,模型常需成千上万 | 缺少对「先验从何而来」的统一解释;元学习与贝叶斯方法只在窄设定下有效 |
| ② 长程推理的可靠性 | 多步推理中一步出错会传播,且模型难以察觉自身错误 | 缺乏对自身状态的不确定性建模;错误检测需要模型具有「知道自己不知道」的能力,而这与训练目标并不直接相关 |
| ③ 可解释性与机制 | 有电路级分析等进展,但离「能预测行为」还很远 | 高维非凸系统的表征难以定位到语义单元;可解释的粒度与实用性之间存在取舍 |
| ④ 评测的可信度 | 基准快速饱和与污染,静态基准难以刻画真实能力 | 能力边界本身是移动的;任何固定测试集都会随时间失效,而动态评测又引入不可复现性 |
| ⑤ 对齐与可控性 | RLHF 类方法有效但脆弱,代理目标与真实意图之间存在偏差 | 人类偏好难以完整表述;奖励黑客(reward hacking)是优化过程的内生现象,而非实现缺陷 |
| ⑥ 成本、能耗与数据枯竭 | 训练成本以千万美元计;高质量公开语料接近用尽 | 规模增长与数据供给之间存在结构性矛盾;合成数据能否替代真实数据尚无定论,且存在模型坍缩风险 |
| ⑦ 因果与泛化 | 模型擅长分布内插值,分布外与反事实表现明显下降 | 观测数据只能识别相关;要从数据中恢复因果机制需要额外假设或干预实验,而干预往往代价高昂 |
把不可判定问题改写成可观测问题
—— Turing 在 1950 年所做的那个替换,仍然是这个领域最值得学习的方法论。
本页所有公式与数量级都可以被你改参数复算,这正是它想示范的态度。