规则,是谁写的?
先看一个你能立刻听懂的例子:判断一封邮件是不是垃圾邮件。
传统程序的做法是——人来写规则。程序员把经验翻译成一条条判断:
这套办法能work,但有个致命问题:骗子只要换个词,规则就失效了。「中奖」改成「中奨」,机器立刻就不认识了。你得一直追着写新规则,永远写不完。
现在试试更难的任务:认出一只猫。你能写出「猫的规则」吗?
有四条腿?
可椅子也有四条腿。
有毛?
可毛毯也有毛。
有胡须?
那老爷爷呢……写到这里你会发现:规则根本列不完。
机器学习换了一个方向:不写规则,改给例子。
给机器看一万张「这是猫」的图片,让它自己去找规律。它自己会发现:尖耳朵、胡须、竖瞳孔、特定的毛色纹理……这些规律甚至很难用语言描述,但它能用数字表示出来。之后再给它一张没见过的图片,它就能判断了。
两条路线的对比
| 传统程序 | 机器学习 | |
|---|---|---|
| 规则从哪来 | 程序员写死 | 从数据里学出来 |
| 需要什么输入 | 规则 + 数据 | 数据 + 正确答案(标签) |
| 擅长什么 | 流程明确的活儿:算工资、排序 | 说不清规则的模式:认图、认语音 |
| 怕什么 | 没写进规则的意外情况 | 没见过的数据(分布变了就翻车) |
| 能不能解释 | 能,一步步可查 | 常常很难说清「为什么」 |
「训练」到底在干什么?
数据
一堆带答案的例子。图片配上「猫」这个标签,这个过程叫标注。数据是原料,也是最贵的一环。
模型
一个可以调的数学函数。里面有一堆参数——你可以把它们直接理解成很多个「旋钮」。
训练
自动去拧这些旋钮,目标只有一个:让「错得有多离谱」这个分数——损失(Loss)——越小越好。
这里有个好消息:你其实已经学过最简单的模型了。一次函数 y = kx + b 就是一个模型,而 k 和 b 就是它的两个参数(两个旋钮)。
平时做数学题是:给你 k、b,你算出 y。
机器学习是反过来:给你一堆 (x, y) 数据点,让你找出最合适的 k、b。
「最合适」怎么衡量?就是让模型算出来的 ŷ 和真实答案 y 差得尽量小。把所有数据点的误差加起来(比如平方后求和),就得到损失。找最好的参数,就是让损失最小。
至于怎么找——靠一种叫 梯度下降 的方法:先算出「往哪个方向拧、损失会下降」,然后朝那个方向挪一小步;重复几千几万次。听起来笨,但它几乎撑起了今天所有的 AI。
理论说完了,去亲手拧一次。
调参实验室
图里有 40 个数据点,分成两类:蓝色 和 绿色。你的任务是拖动下面三个旋钮,让一条直线尽可能把两类点分开。
这条线叫决策边界:点落在线的哪一侧,就被判成哪一类。用公式写就是 w₁x + w₂y + b = 0。
自动训练 = 用真实的梯度下降跑 500 步,实时更新参数。
另外注意:这组数据是特意造的「干净」数据,几乎能被一条线完美分开。真实数据永远没这么整齐,准确率很难到 100%。
神经网络:把旋钮连起来
刚才那条直线有个硬伤:它只能画一条线。如果两类数据是这样摆的——一类在左下和右上,另一类在左上和右下——无论你怎么拧三个旋钮,都不可能分开。这种结构叫「异或」,是单层模型的经典死穴。
怎么破?把很多条直线叠起来,再组合。这就是神经网络。
一个神经元
收到几个数 → 各自乘以一个权重再相加(就是刚才那条线)→ 过一个非线性函数 → 输出一个数。
那个非线性函数很关键:没有它,叠多少层都等于一条直线。
一层
很多个神经元并排。这一层里每个神经元都在找一种不同的「局部规律」——有的盯边缘,有的盯颜色。
很多层
后一层把前一层的发现当输入,组合出更抽象的概念:边缘 → 眼睛 → 猫脸 → 猫。这就是「深度」学习里「深度」的意思。
今天的大模型有几十亿到上万亿个参数。没有梯度下降这种自动方法,靠人调是不可能完成的。
旋钮太多,模型就有能力「把训练数据背下来」,但换成没见过的新数据就一塌糊涂。
过拟合就像只背了答案、却没理解题意:作业原题会做,换个数字就废。
常见对策:喂更多数据、让模型别太复杂(正则化)、见好就收(早停)。
大语言模型:一个「猜下一个词」的机器
先说一件反直觉的事:AI 并不直接看「字」。送进模型之前,文字会先被切成一小块一小块,叫 token(词元),每块再换成一个编号——模型从头到尾处理的都是数字,不是中文或英文。
在下面输入任何内容,看看它会怎么被切开(真实的本地切分,不联网):
看懂切分之后,大模型的核心机制一句话就能说完:
核心循环
给它前面所有 token → 计算出下一个 token 的概率分布 → 挑一个接上去 → 再算下一个 → 循环。
比如输入「今天天气真」,它会给「好」「不错」「糟糕」……分别算一个概率,挑一个写出来,然后拿着更长的句子继续算。你看到的整篇文章,就是这样一个 token 一个 token 长出来的。
那它为什么好像什么都懂?因为为了把「猜下一个 token」做到极致,它被迫顺便学会了语法、常识、逻辑链条、代码结构——这些都有助于更准地预测下一个词。这是整件事里最令人意外的地方。
训练:一次性的大工程。用成千上万块专用芯片跑几个月,烧掉巨额电费,最终得到的只是一套参数。成本以百万美元计。
推理:你每次问它问题时,用那套已经固定的参数算一遍,几秒钟出结果。
结论:它不会「边聊边学」。你的对话默认不会改变模型本身——它记住你,靠的是把历史对话一起塞进上下文,而不是「长了记性」。
训练数据是有时间点的。这个时间点之后发生的事,它天生不知道——它的知识停在那一刻,这叫知识截止(knowledge cutoff)。
所以问它「昨天发生了什么」时,如果产品没有联网检索功能,它可能一本正经地编一个答案。这直接引出下一节的第一个短板。
AI 的五个短板
了解 AI 的边界,比了解它的能力更重要——这决定了你该怎么用它。
幻觉:它会一本正经地编
不存在的论文、查无此条的法规、编造的引用和日期——它都能用非常流畅自信的语气说出来。 原因不神秘:它的训练目标是「生成最像样的文本」,不是「说真话」。像样的假话,对它是很容易的输出。
对策:凡是数字、日期、人名、引用,一律自己核对原始来源。偏见:数据里有什么,它就学什么
如果训练资料里「护士」总是和女性一起出现、「CEO」总是和男性一起出现,它就会把这种统计偏向学下来并放大。 它不会自动分辨「这是偏见」,它只负责复制数据里的规律。
对策:看到涉及人群的结论时多想一步——这是事实,还是数据里的旧习惯?它只是在算概率,不是在「理解」
它能写出「冰化了,因为温度升高」,但这不代表它像人一样体验过物理世界。它是在海量文本里学到「冰」「化」「温度」这些词经常这样搭配。 它也能顺畅地说出「我很难过」——可它并没有难过。
对策:别把它的流畅当成理解;流畅来自语言,不等于来自事实。它不会自己验证,常常「不知道自己在错」
多位数乘法、长链条推理、严格的逻辑步骤——它可能中间错了还继续往下推,最后给出一个自信的错答案。 它没有「我知道我算错了」这种内部报警。
对策:数学题、代码、推理链,务必自己验算或实际跑一遍。成本与代价:不是免费的魔法
训练和每天响应亿万次提问,都要消耗大量电力、水(用于散热)和稀有硬件。此外还牵涉版权(训练数据来自哪里)、隐私(你输入的内容去哪了)等现实问题。
对策:把它当工具而不是游戏;别为了好玩反复问无意义的问题,也别随意上传他人的作品。怎么问,才问得准
有个好用的比喻:把 AI 当成一位「很聪明、但完全不了解你的新同事」。他知识面很广,却不知道你要什么、给谁看、要多长、什么风格。你不说,他只能靠猜——于是给你一份平庸的答案。
「提示词」要做的,就是把你的需求说清楚。下面四个要素,能解决绝大多数「答得不好」的问题。点击左边按钮,看它在右边对应哪一句:
已找到 0 / 4 个要素
弱提示
强提示
| 说清任务 | 别只说「讲讲AI」。用动词 + 具体对象:「解释什么是机器学习」比「讲讲机器学习」明确得多。 |
| 给出背景 | 交代你是谁、给谁看、已知什么。这决定了它用多深的语言——「我是初一学生,没学过概率」这一句,能大幅改变答案的难度。 |
| 指定格式 | 告诉它输出长什么样:几点、多长、要不要表格、要不要结论先行。不指定,它就会写成一坨。 |
| 给个例子 | 最有效但最少人用的一招。示范一个你满意的效果,它就能照着那个风格与深度来。 |
1. 追问,不要重开。结果不满意时直接接着说:「第 2 点太难了,换成小学生能懂的说法。」它能看到整段对话,越改越准。
2. 让它分步。复杂问题加一句「先列思路,再给结论」,能显著降低它中途跑偏的概率。
四条安全准则
这一节没有技术含量,但比前面所有内容都更重要。
不输入真实隐私
不要往对话框里写:真实姓名、家庭住址、学校班级、身份证号、家人姓名与电话、各类账号密码。你的输入可能被保存、被人工查看,甚至被用于改进模型(取决于具体产品的设置)。需要举例时,用「小A」「某某中学」代替。
看到「某人的视频」,先怀疑
今天的声音、人脸、视频都能被合成,这叫深度伪造(deepfake)。判断依据不是「看起来真不真」,而是:来源是否权威、有没有第二家可信媒体同样报道、内容是否符合常识、有没有诡异的细节(口型不同步、光影不对、手指异常)。
作业可以用它,但别用它交差
用它讲解、提问、检查、出题,都是极好的学习方式。但如果直接交一份自己都没读懂的东西——真正的风险不是被老师发现,而是你什么都没学到,而且考试时会立刻暴露。
公开发布要谨慎,事实性内容要溯源
AI 生成的图片和文字,用于公开发布可能涉及版权与署名问题。引用的数据、结论、法规,必须去找原始来源核实——记住第 06 节的第一个短板:它编得很像真的。
五道题,检验一下
传统程序和机器学习,最核心的区别是什么?
「训练」这个动作,本质上在做什么?
大语言模型生成文字时,每一步本质上在做什么?
为什么说 AI 会「一本正经地胡说」?
下面哪种做法最合理?