Smart-Yuki · AI科普-高年级
面向六七年级 · 不需要编程基础

机器是怎么
学会的?

几乎所有 AI 的秘密,都藏在一句话里:
不再由人写规则,而是让机器从数据里自己找规律。

0数据点 / samples
0可调参数 / params
0自测题 / quiz
0联网请求 / offline
// 01 — 观念转变

规则,是谁写的?

<IF/ELSE> vs <LEARN>

先看一个你能立刻听懂的例子:判断一封邮件是不是垃圾邮件。

传统程序的做法是——人来写规则。程序员把经验翻译成一条条判断:

如果 标题里含有「中奖」「速领」 → 标记为垃圾邮件 如果 发件人不在通讯录 → 标记为垃圾邮件 如果 正文里有大量链接 → 多扣一点分 ...

这套办法能work,但有个致命问题:骗子只要换个词,规则就失效了。「中奖」改成「中奨」,机器立刻就不认识了。你得一直追着写新规则,永远写不完。

现在试试更难的任务:认出一只猫。你能写出「猫的规则」吗?

TEST_01

有四条腿?

可椅子也有四条腿。

TEST_02

有毛?

可毛毯也有毛。

TEST_03

有胡须?

那老爷爷呢……写到这里你会发现:规则根本列不完。

机器学习换了一个方向:不写规则,改给例子。

给机器看一万张「这是猫」的图片,让它自己去找规律。它自己会发现:尖耳朵、胡须、竖瞳孔、特定的毛色纹理……这些规律甚至很难用语言描述,但它能用数字表示出来。之后再给它一张没见过的图片,它就能判断了。

两条路线的对比

传统程序机器学习
规则从哪来程序员写死从数据里学出来
需要什么输入规则 + 数据数据 + 正确答案(标签)
擅长什么流程明确的活儿:算工资、排序说不清规则的模式:认图、认语音
怕什么没写进规则的意外情况没见过的数据(分布变了就翻车)
能不能解释能,一步步可查常常很难说清「为什么」
划重点:这不是「机器更聪明」,而是解决问题的方式变了——从「人来总结规律」变成「让机器从大量例子里自己拟合规律」。也正因为如此,它的表现几乎完全取决于喂给它的数据
// 02 — 三个零件

「训练」到底在干什么?

DATA / MODEL / LOSS
PART_01 // DATA

数据

一堆带答案的例子。图片配上「猫」这个标签,这个过程叫标注。数据是原料,也是最贵的一环。

PART_02 // MODEL

模型

一个可以调的数学函数。里面有一堆参数——你可以把它们直接理解成很多个「旋钮」。

PART_03 // LOSS

训练

自动去拧这些旋钮,目标只有一个:让「错得有多离谱」这个分数——损失(Loss)——越小越好。

这里有个好消息:你其实已经学过最简单的模型了。一次函数 y = kx + b 就是一个模型,而 kb 就是它的两个参数(两个旋钮)。

平时做数学题是:给你 k、b,你算出 y
机器学习是反过来:给你一堆 (x, y) 数据点,让你找出最合适的 k、b

「最合适」怎么衡量?就是让模型算出来的 ŷ 和真实答案 y 差得尽量小。把所有数据点的误差加起来(比如平方后求和),就得到损失。找最好的参数,就是让损失最小

至于怎么找——靠一种叫 梯度下降 的方法:先算出「往哪个方向拧、损失会下降」,然后朝那个方向挪一小步;重复几千几万次。听起来笨,但它几乎撑起了今天所有的 AI。

理论说完了,去亲手拧一次。

// 03 — 动手实验(真实计算)

调参实验室

LOCAL COMPUTE — 无联网

图里有 40 个数据点,分成两类:蓝色绿色。你的任务是拖动下面三个旋钮,让一条直线尽可能把两类点分开。

这条线叫决策边界:点落在线的哪一侧,就被判成哪一类。用公式写就是 w₁x + w₂y + b = 0

x 轴 → x₁ ↑ x₂
类别 0 类别 1 分错的点 你的决策边界

// 三个旋钮 (权重与偏置)
1.00
-1.00
0.70
准确率 / ACCURACY
50.0%
判对 20 / 40 个点

自动训练 = 用真实的梯度下降跑 500 步,实时更新参数。

先别急着点自动训练。手动试着拧一拧,感受一下:三个旋钮互相牵扯,改一个就得再调另外两个——人工调参非常费劲。目标线大致是「左上—右下」方向:当 w₁ 和 w₂ 同号时斜率为负——先把 w₂ 拉成正数,再用 b 把这条线平移到两类点的中间。
做完了回头看这句话:你刚才手动拧旋钮的过程,就是「训练」;而梯度下降只是把这件苦力活自动化了。模型本身没变——还是那条直线。
另外注意:这组数据是特意造的「干净」数据,几乎能被一条线完美分开。真实数据永远没这么整齐,准确率很难到 100%。
// 04 — 从一条线到很多层

神经网络:把旋钮连起来

NEURON → LAYER → DEPTH

刚才那条直线有个硬伤:它只能画一条线。如果两类数据是这样摆的——一类在左下和右上,另一类在左上和右下——无论你怎么拧三个旋钮,都不可能分开。这种结构叫「异或」,是单层模型的经典死穴。

怎么破?把很多条直线叠起来,再组合。这就是神经网络。

LEVEL_01

一个神经元

收到几个数 → 各自乘以一个权重再相加(就是刚才那条线)→ 过一个非线性函数 → 输出一个数。

那个非线性函数很关键:没有它,叠多少层都等于一条直线。

LEVEL_02

一层

很多个神经元并排。这一层里每个神经元都在找一种不同的「局部规律」——有的盯边缘,有的盯颜色。

LEVEL_03

很多层

后一层把前一层的发现当输入,组合出更抽象的概念:边缘 → 眼睛 → 猫脸 → 猫。这就是「深度」学习里「深度」的意思。

// 参数量是这么来的
这一层有 1000 个神经元 上一层有 1000 个输出 每个连接都要 1 个权重 → 1000 × 1000 = 1,000,000 个旋钮 (只算了这一层)

今天的大模型有几十亿到上万亿个参数。没有梯度下降这种自动方法,靠人调是不可能完成的。

// 一个新麻烦:过拟合

旋钮太多,模型就有能力「把训练数据背下来」,但换成没见过的新数据就一塌糊涂。

过拟合就像只背了答案、却没理解题意:作业原题会做,换个数字就废。

常见对策:喂更多数据、让模型别太复杂(正则化)、见好就收(早停)。

// 05 — 生成式 AI

大语言模型:一个「猜下一个词」的机器

TOKEN → NEXT-TOKEN → LOOP

先说一件反直觉的事:AI 并不直接看「字」。送进模型之前,文字会先被切成一小块一小块,叫 token(词元),每块再换成一个编号——模型从头到尾处理的都是数字,不是中文或英文。

在下面输入任何内容,看看它会怎么被切开(真实的本地切分,不联网):

// TOKEN 切分器
TOKENS0

看懂切分之后,大模型的核心机制一句话就能说完:

核心循环
给它前面所有 token → 计算出下一个 token 的概率分布 → 挑一个接上去 → 再算下一个 → 循环。

比如输入「今天天气真」,它会给「好」「不错」「糟糕」……分别算一个概率,挑一个写出来,然后拿着更长的句子继续算。你看到的整篇文章,就是这样一个 token 一个 token 长出来的

那它为什么好像什么都懂?因为为了把「猜下一个 token」做到极致,它被迫顺便学会了语法、常识、逻辑链条、代码结构——这些都有助于更准地预测下一个词。这是整件事里最令人意外的地方。

// 训练 vs 推理(很重要)

训练:一次性的大工程。用成千上万块专用芯片跑几个月,烧掉巨额电费,最终得到的只是一套参数。成本以百万美元计。

推理:你每次问它问题时,用那套已经固定的参数算一遍,几秒钟出结果。

结论:它不会「边聊边学」。你的对话默认不会改变模型本身——它记住你,靠的是把历史对话一起塞进上下文,而不是「长了记性」。

// 知识截止

训练数据是有时间点的。这个时间点之后发生的事,它天生不知道——它的知识停在那一刻,这叫知识截止(knowledge cutoff)

所以问它「昨天发生了什么」时,如果产品没有联网检索功能,它可能一本正经地编一个答案。这直接引出下一节的第一个短板。

问:昨天的球赛谁赢了? 答案:(如果它不知道 → 它常常不会说"不知道")     而是编一个像模像样的比分)
// 06 — 它做不到什么

AI 的五个短板

LIMITATIONS

了解 AI 的边界,比了解它的能力更重要——这决定了你该怎么用它。

01

幻觉:它会一本正经地编

不存在的论文、查无此条的法规、编造的引用和日期——它都能用非常流畅自信的语气说出来。 原因不神秘:它的训练目标是「生成最像样的文本」,不是「说真话」。像样的假话,对它是很容易的输出。

对策:凡是数字、日期、人名、引用,一律自己核对原始来源。
02

偏见:数据里有什么,它就学什么

如果训练资料里「护士」总是和女性一起出现、「CEO」总是和男性一起出现,它就会把这种统计偏向学下来并放大。 它不会自动分辨「这是偏见」,它只负责复制数据里的规律。

对策:看到涉及人群的结论时多想一步——这是事实,还是数据里的旧习惯?
03

它只是在算概率,不是在「理解」

它能写出「冰化了,因为温度升高」,但这不代表它像人一样体验过物理世界。它是在海量文本里学到「冰」「化」「温度」这些词经常这样搭配。 它也能顺畅地说出「我很难过」——可它并没有难过。

对策:别把它的流畅当成理解;流畅来自语言,不等于来自事实。
04

它不会自己验证,常常「不知道自己在错」

多位数乘法、长链条推理、严格的逻辑步骤——它可能中间错了还继续往下推,最后给出一个自信的错答案。 它没有「我知道我算错了」这种内部报警。

对策:数学题、代码、推理链,务必自己验算或实际跑一遍。
05

成本与代价:不是免费的魔法

训练和每天响应亿万次提问,都要消耗大量电力、水(用于散热)和稀有硬件。此外还牵涉版权(训练数据来自哪里)、隐私(你输入的内容去哪了)等现实问题。

对策:把它当工具而不是游戏;别为了好玩反复问无意义的问题,也别随意上传他人的作品。
// 07 — 实用技能

怎么问,才问得准

PROMPT ENGINEERING

有个好用的比喻:把 AI 当成一位「很聪明、但完全不了解你的新同事」。他知识面很广,却不知道你要什么、给谁看、要多长、什么风格。你不说,他只能靠猜——于是给你一份平庸的答案。

「提示词」要做的,就是把你的需求说清楚。下面四个要素,能解决绝大多数「答得不好」的问题。点击左边按钮,看它在右边对应哪一句:

// 四要素(点我高亮)

已找到 0 / 4 个要素

// 同一个请求,两种问法

弱提示

讲讲机器学习

强提示

我是初一学生,刚学过一元一次方程,没学过概率。 请解释什么是机器学习,说明它和「人工写规则」有什么不同。 分 3 点讲,每点不超过 2 句话,最后给一个生活中的例子。 像这样:过拟合就像只背了答案不理解题意——原题会做,换个数字就不会。
// 四要素逐条拆解
说清任务别只说「讲讲AI」。用动词 + 具体对象:「解释什么是机器学习」比「讲讲机器学习」明确得多。
给出背景交代你是谁、给谁看、已知什么。这决定了它用多深的语言——「我是初一学生,没学过概率」这一句,能大幅改变答案的难度。
指定格式告诉它输出长什么样:几点、多长、要不要表格、要不要结论先行。不指定,它就会写成一坨。
给个例子最有效但最少人用的一招。示范一个你满意的效果,它就能照着那个风格与深度来。
还有两个实用习惯:
1. 追问,不要重开。结果不满意时直接接着说:「第 2 点太难了,换成小学生能懂的说法。」它能看到整段对话,越改越准。
2. 让它分步。复杂问题加一句「先列思路,再给结论」,能显著降低它中途跑偏的概率。
// 08 — 使用底线

四条安全准则

SAFETY

这一节没有技术含量,但比前面所有内容都更重要。

不输入真实隐私

不要往对话框里写:真实姓名、家庭住址、学校班级、身份证号、家人姓名与电话、各类账号密码。你的输入可能被保存、被人工查看,甚至被用于改进模型(取决于具体产品的设置)。需要举例时,用「小A」「某某中学」代替。

看到「某人的视频」,先怀疑

今天的声音、人脸、视频都能被合成,这叫深度伪造(deepfake)。判断依据不是「看起来真不真」,而是:来源是否权威、有没有第二家可信媒体同样报道、内容是否符合常识、有没有诡异的细节(口型不同步、光影不对、手指异常)。

作业可以用它,但别用它交差

用它讲解、提问、检查、出题,都是极好的学习方式。但如果直接交一份自己都没读懂的东西——真正的风险不是被老师发现,而是你什么都没学到,而且考试时会立刻暴露。

公开发布要谨慎,事实性内容要溯源

AI 生成的图片和文字,用于公开发布可能涉及版权与署名问题。引用的数据、结论、法规,必须去找原始来源核实——记住第 06 节的第一个短板:它编得很像真的。

如果只能记住一条:凡是会影响真实决定的信息(健康、安全、重要选择),至少找两个互相独立的来源核对。这条习惯在 AI 时代比在任何时候都值钱。
// 09 — 自测

五道题,检验一下

5 QUESTIONS
Q_01

传统程序和机器学习,最核心的区别是什么?

Q_02

「训练」这个动作,本质上在做什么?

Q_03

大语言模型生成文字时,每一步本质上在做什么?

Q_04

为什么说 AI 会「一本正经地胡说」?

Q_05

下面哪种做法最合理?

已答对0/ 5 题
✓ 全部答对。你已经掌握了 AI 的基本原理、边界和使用底线——这比会用某个具体产品重要得多。