高中通识课 · 约 60 分钟

人工智能发展简史

从图灵之问到 ChatGPT —— 看懂机器的「眼睛」与「语言大脑」

合肥六中 王瑞

ZCode GLM-5.3

🎬 第一幕 · 70 年历史 👁️ 第二幕 · 卷积神经网络 CNN 💬 第三幕 · Transformer
翻页  ·  F 全屏  ·  S 演讲者讲稿  ·  O 缩略图总览
今天的旅程

一场三幕剧:机器是怎么变聪明的?

🎬

第一幕 · 时空穿越

AI 的 70 年:从图灵之问、两次寒冬,到 AlexNet、AlphaGo 与 ChatGPT。

约 18 分钟

👁️

第二幕 · 会看世界的机器

卷积神经网络 CNN:放大镜、找重点、层层抽象——机器如何认出一只猫。

约 18 分钟

💬

第三幕 · 会读文字的机器

Transformer:注意力机制、查字典式的 Q/K/V,ChatGPT 为什么会"说话"。

约 18 分钟

🚀

尾声 · 回望与展望

70 年时间线总回顾;AI 的能与不能;你现在就能做的三件事。

约 6 分钟 + 问答

每一幕都有小互动,随时举手提问——没有"太笨"的问题。

热身 · 互动 3 分钟

开始之前,先聊三个问题

① 你手机里,藏着多少个 AI?

人脸解锁、拍照美颜、语音助手、相册搜索、短视频推荐……一部手机里至少有 5~10 个 AI 模型在工作。

② AI 和计算器,都是"会算的机器",差别在哪?

计算器的规则是人写死的;AI 的本事是从大量例子中自己学出来的——没人告诉它猫长什么样,它看过百万张猫片后自己总结。

③ 今天下课时,你希望弄明白什么?

比如:手机凭什么认出我的脸?ChatGPT 凭什么会聊天?——这两个问题,正是今天的第二幕和第三幕。

第一幕 · AI 历史

到底什么是「人工智能」?

人工智能 AI
机器学习 —— 从数据中学规律
深度学习 —— 多层神经网络

如果一件事通常需要人类智能才能完成——看得懂、听得懂、会推理、能创造——那么让机器去做它,就是人工智能。

注意包含关系:AI 是大圈机器学习是其中一支(不写规则、自己学),深度学习又是机器学习的一支(用多层神经网络学)。

📌 今天的两位主角 CNNTransformer,都在最里面那个小圈里。

第一幕 · AI 历史 · 1950

图灵之问:「机器能思考吗?」

艾伦·图灵(1912–1954),计算机科学之父、二战密码破译英雄。1950 年他在论文《计算机器与智能》里提出那个著名的问题。

但"思考"没法测量,吵一万年也没结论。图灵的天才之处:换一个可以检验的问题——

模仿游戏(图灵测试):提问者隔着墙向"人 A"和"机器 B"提问,如果分不清谁是人、谁是机器,那台机器就算拥有智能。

他曾预言:到 2000 年,机器能骗过 30% 的提问者。2014 年确有聊天程序宣称达标(争议很大)——而今天的大模型早已让这个问题变得更微妙。

提问者 👩‍🏫

↓ 隔着墙提问 ↓

🧑 人 A 🤖 机器 B

分得清吗?

第一幕 · AI 历史 · 1956

达特茅斯会议:AI 的「开国大典」

1956 年夏,美国达特茅斯学院。约翰·麦卡锡、马文·明斯基、克劳德·香农等 10 位年轻人聚在一起,研究一个当时听起来像科幻的题目。

就在这份提案里,Artificial Intelligence(人工智能)一词正式诞生——这门学科有了名字和生日。

提案里的乐观预言:只需一个夏天、一台机器,就能在语言、抽象等智能问题上取得重大进展。

"我们将猜测:学习的每个方面、智能的任何特征,原则上都能被精确描述,从而让机器去模拟它。"

—— 达特茅斯提案,1956

结果:这个"夏天",一过就是 70 年。

冷知识:这 10 位与会者中,先后走出了 5 位图灵奖得主——含金量堪比"全明星赛"。

第一幕 · AI 历史 · 1974–1993

理想撞上现实:两次 AI 寒冬

1956–1974 · 蜜月期

演示程序在小问题上惊艳四座:会证明定理、会下跳棋。媒体和经费蜂拥而至。

但全都只在小规模下成立,问题一变难就崩。

❄️ 1974–1980 · 第一次寒冬

机器翻译闹笑话:把"心有余而力不足"译成"伏特加不错,肉都烂了"(经典轶闻)。

算力不足 + 承诺落空 → 各国经费断流。

⏳ 1980s · 回光返照

专家系统流行:把人类专家的知识写成一条条 IF–THEN 规则。

规则越写越多、维护成本爆炸,1987 年市场崩盘。

❄️ 1987–1993 · 第二次寒冬

"AI"一度成为贬义词,从业者被迫改名换姓叫"机器学习"。

但种子还在:神经元思想与反向传播在暗中积蓄力量。

💡 教训:靠人手写规则,永远写不完。智能不该被"教",而应该自己"学"。

第一幕 · AI 历史 · 1997

深蓝战胜世界冠军:是「智能」还是「算力」?

1997 年,IBM 的深蓝以 3.5 : 2.5 击败国际象棋世界冠军卡斯帕罗夫,举世震惊。

但深蓝赢的方式一点也不"像人":它不会直觉,只会暴力搜索——把能走的棋全部算一遍,挑最好的。

2 亿 / 秒
深蓝每秒评估的走法数

象棋只有 64 格,暴力搜索撑得住。可是围棋的变化约 10¹⁷⁰ 种——比全宇宙的原子还多,再快的计算机也算不过来。

64 格棋盘 → 搜索可行 ✅

19×19 围棋 → 搜索失效 ❌

图像、语言更是如此:没有明确的"下一步"可枚举。

出路不在"算得更多",而在"学得更好"。

第一幕 · AI 历史 · 范式转变

关键转折:从「教规则」到「学规律」

📜

旧范式 · 教规则(符号主义)

IF 长耳朵 AND 有胡须 THEN 是猫

人把知识一条条写进机器。优点:可解释。死穴:写不完、不会变通——猫趴着、侧脸、只有半只耳朵呢?

🌱

新范式 · 学规律(机器学习)

给机器看 100 万张标注过的图片,它自己调整参数总结出"什么是猫"。

见得多了,趴着、侧脸、糊图都能认——会泛化

🍼 比喻:没有人教孩子"猫的几何定义",都是指着猫说"这是猫",看多了自然认得。机器学习就是把这套流程搬给计算机。

这一路叫监督学习:图片是习题册,标签是标准答案——机器刷几百万道题,刷到接近满分。

第一幕 · AI 历史 · 深度学习的前夜

为什么爆发在 2012 年?三桶燃料同时到位

📊

数据

互联网把整个世界数字化。李飞飞团队 2009 年建成 ImageNet:1400 万张人工标注图片,机器的"习题册"终于够厚。

算力

GPU——原本为游戏画面发明的显卡,恰好擅长神经网络最需要的"海量乘加运算",速度是 CPU 的几十倍。

🧠

算法

神经网络思想 1943 年就有,反向传播 1986 年已成熟——老点子静静等了几十年,就等燃料到位。

🔥 老想法 × 新燃料 = 新革命。深度学习的三种成分早就齐了,只差点火。

第一幕 · AI 历史 · 2012

AlexNet:深度学习点燃之夜

2010
28.2%
2011
25.8%
2012 · AlexNet
16.4%
2013
11.7%
2014 · GoogLeNet
6.7%
2015 · ResNet
3.6%
人类水平 ≈
5.1%

ImageNet 图像识别大赛:把 1000 类图片认错的比例(越低越好)

赛场上,多伦多大学 Hinton 团队的学生 Alex两块游戏显卡,训练了一个 8 层神经网络——正是 CNN。

错误率一步从 26.2% → 16.4%,比第二名整整领先 10 个百分点,学界直接炸锅。

三年后(2015),深度网络错误率 3.6%,低于人类的 5.1% —— 机器第一次在"看"这件事上超过了人。

从此:大厂全面转向,GPU 被抢购一空,"深度学习"时代正式开始。

第一幕 · AI 历史 · 2016

AlphaGo:攻下人类智力的最后堡垒

围棋曾是"计算机永远攻不下"的堡垒:10¹⁷⁰ 种变化让暴力搜索彻底绝望,职业棋手判断棋形靠的是直觉

DeepMind 的思路:深度学习(研究人类几千万盘棋谱,学出"棋感")+ 强化学习(左手跟右手对弈 3000 万盘,越下越强)。

2016 年 3 月,AlphaGo 4 : 1 战胜李世石

第二局第 37 手 · 载入史册

AlphaGo 落下一手人类棋手概率仅 0.007% 的棋——起初被视为失误,几十手后显出杀机。解说惊呼"神之一手"。

那一刻人类意识到:它不是在模仿人,它在探索人没走过的路

后续:2017 年 Master 对人类顶尖棋手 60 连胜;同年 AlphaZero 不看任何棋谱、纯自学 3 天,超越全部人类历史棋力。2020 年 AlphaFold 破解蛋白质折叠,把 AI 推进了基础科学(2024 年获诺贝尔化学奖)。

第一幕 · AI 历史 · 2017 → 今天

大模型时代:AI 装进每个人的口袋

2017Transformer 论文发表
2018GPT-1 / BERT
2020GPT-3 · 1750 亿参数
2022ChatGPT 发布
2024Sora · 多模态爆发
2025推理模型 · 智能体

史上最快的产品

ChatGPT 上线 2 个月,用户破 1 亿——电话用了 75 年,手机 16 年,互联网 7 年。

AI 第一次不再是实验室名词,而是日常工具。

它是怎么来的?

核心技术正是 2017 年那篇论文:Transformer(第三幕主角)。

更惊人的是:没人专门教它聊天——会"接龙"就自然会聊天,能力是"涌现"出来的。

想看懂这一切,得先弄懂机器是怎么「看」的 → 进入第二幕。

02
第二幕 · 约 18 分钟

会看世界的机器:CNN

人脑约 80% 的外界信息来自视觉。
计算机没有眼睛——它「看」到的世界,究竟是什么样子?

像素 → 神经元 → 卷积 → 池化 → 层层抽象 → 认出一只猫

第二幕 · CNN · 第一步

计算机眼中的世界:一堆数字

一张 10×10 的手写数字图(每个小方格 = 一个亮度)

这是什么数字? —— 7 ✔

对计算机而言,图片就是一张数字表格:0 = 全黑,255 = 全白。它不懂"形状",只认识数字。

10
235
255
240
15
0
0
0
200
60
0
0
30
185
0
0
10
45
170
0
0
30
70
150
0

放大看:所谓"笔画",只是数字由暗变亮

感受一下规模:28×28 小图 = 784 个数;一张手机照片 4000×3000×3(RGB)≈ 3600 万个数

🎯 核心难题:从 3600 万个数字里,怎么判断"这是一只猫"?

第二幕 · CNN · 零件

灵感来自大脑:人工神经元

x₁ × w₁ x₂ × w₂ x₃ × w₃+ b
Σ 求和
f 激活
输出 y

y = f( w₁x₁ + w₂x₂ + w₃x₃ + b )

权重 w:重要性打分

期末总评 = 0.2×平时 + 0.3×期中 + 0.5×期末——这就是加权求和!区别:老师手动定权重,神经网络自己学出权重。

偏置 b:及格线

相当于老师的"印象分基准":信号再强,达不到门槛就不兴奋。

激活函数 f:开关

决定"要不要兴奋、兴奋多少"。最常用的 ReLU 一句话:负数一律归零——没用的信号直接闭嘴。

生物神经元:树突收信号 → 胞体汇总 → 超过阈值就放电。人工神经元是它的数学漫画版。

第二幕 · CNN · 组装

把神经元连成网络:分层加工

输入层 隐藏层 ×N("深"度) 输出层

每一根连线都是一个可学习的权重。图上这个小网络就有 26 个参数——而 GPT-3 有 1750 亿个。

信息流向:输入层接收原始数据 → 隐藏层逐层加工 → 输出层给出答案(如"猫 98%")。

"深度"学习的"深",指的就是隐藏层堆得层数多:信息像流水线,一层比一层抽象。

📌 训练的全部内容:自动调好每一个权重,让"看图识猫"的正确率最高。

第二幕 · CNN · 怎么学

网络怎么学习?——蒙眼下山的智慧

  1. 做题:给网络看一张图,它输出"狗 (70%)"。标准答案:猫。→ 预测有误差。
  2. 误差 = 山的高度(损失函数):错得越离谱,你站得越高。学习目标 = 走到谷底
  3. 蒙眼下山(梯度下降):看不见全貌,只能用脚感受坡度——每一步都朝最陡的下坡方向挪一点,把几百万个权重各微调一点点。
  4. 重复千万次:换下一张图,做题 → 对答案 → 调参数……直到近乎全对。("从误差倒推每个权重该背多少责任"的算法,叫反向传播。)

📐 数学彩蛋:"最陡下坡的方向"就是导数——高中数学的"变化率",即将在你的人工智能生涯里反复登场。

步子大小叫"学习率":迈太大容易跨过谷底来回震荡,迈太小则学得极慢。

第二幕 · CNN · 遇到墙

笨办法撞墙:全连接网络看不了图

把每个像素都连给每个神经元:一张 100×100 的小图、输出层 1000 个神经元
= 1 亿个参数(这才只是第一层!)

参数爆炸 💥

训练慢、显存爆、还容易"死记硬背"(过拟合)——背会了训练集,见到新图就懵。

不懂空间 🧩

把图片像素全部打乱,全连接照样"工作"——因为它从没理解过"相邻像素有关系"。

怕挪位置 📍

猫在左上角学会一套,猫挪到右下角就得从头再学——全连接天生不懂"平移不变"。

💡 但图像有两条天然规律:① 局部相关(相邻像素才构成特征);② 平移不变(猫在哪都是猫)。
需要一位天生懂"看"的专家 → CNN(卷积神经网络)登场,1998 年由 LeCun 提出,2012 年一战成名。

第二幕 · CNN · 核心思想 ①

卷积:带着「放大镜」找图案

在班级大合影里找好朋友:你不会一眼扫描全班,而是拿着他的样子,一小块一小块对照

CNN 就这么干:一个小窗口(比如 3×3)从图片左上角出发,逐格滑动,每到一处就把窗口里的像素做一次"加权求和",得到一个数。

所有位置算完,得到一张新图——特征图:它标记了"这个图案在哪里出现过"。

为什么这样设计是天才的?

🔍 只看局部:3×3 窗口=9 个权重,而不是 1 亿个——参数骤减。

🔁 权重共享:同一扇"放大镜"扫遍全图——猫在哪个角落都逃不掉。

🗺️ 输出特征图:不仅回答"有没有",还回答"在哪里"。

这个"滑动窗口 + 加权求和"的操作,学名叫 卷积(Convolution)。下一页亲手算一次!

第二幕 · CNN · 亲手算一次

卷积现场直播:让机器找到「竖直边缘」

输入图像 5×5(右侧一条亮带)
卷积核 3×3(特征探测器)
输出特征图 3×3
小窗口正在逐格扫描,每到一处:输出 = 右列之和 − 左列之和

看结果:只有"左暗右亮"的边缘处被点亮——这组权重就是一台"竖直边缘探测器"。

换一组数字,就能探测横边、斜边、斑点……最妙的是:这些数字不是人设计的,是训练自动学出来的!真实 CNN 每层有几十~几百个这样的"探测器"并行工作。

第二幕 · CNN · 核心思想 ②

池化:只留重点,其余放过

1
2
5
1
3
6
0
2
0
1
4
7
2
0
3
8

4×4 特征图

6
5
2
8

2×2:每个区域取最大值

Max Pooling(最大池化):每个 2×2 小区域只保留最大的一个数——"这片区域最强响应是多少"。

📉 图变小 75%,算力省下来;"哪里有特征"留住了,"特征多亮"不重要。

🧲 附赠能力:图案稍微挪一两格,最大值不变——网络对小平移不敏感了。

⚽ 比喻:看完 90 分钟球赛,你记住的不是每一帧,而是进球瞬间——最强的信号才值得记住。

第二幕 · CNN · 组装成型

卷积 + 池化,层层堆叠:从边缘到猫脸

输入 · 原始像素
只是一堆数字 🖼️
第 1 层 · 卷积+池化
学会认边缘、条纹、色块(最简单的零件)📏
第 2 层
把零件拼成眼睛、耳朵、毛发纹理👁️
第 3 层
部件组合成完整结构:一张猫脸 🐱
输出 · 分类
98.2% | 狗 1.1% | 其他 0.7%

📚 类比识字:笔画 → 偏旁 → 汉字 → 词 → 句子。每一层都基于上一层,越深越抽象——这就是"深度学习"名字的由来。

这不是比喻——科学家真的可视化过训练好的网络:第 1 层的卷积核长得和边缘探测器一模一样,与猫视觉皮层的研究(1962)惊人相似。AI 向大脑偷师,学得很成功。

第二幕 · CNN · 成绩单

CNN 改变了什么?机器长出了「眼睛」

🏦

1998 · LeNet

银行支票上的手写数字自动识别——CNN 的第一次商业上岗,每天处理几百万张支票。

🏆

2012 · AlexNet

ImageNet 错误率断崖式下降,深度学习时代开幕(第一幕已讲)。

🚗

2015 → 今天

ResNet 深达 152 层、错误率低于人类;人脸解锁、相册搜"猫"、医学影像筛查、自动驾驶感知。

🏥

看不见的应用

CT 片早期肺癌筛查、皮肤癌识别、工业质检——很多领域 CNN 比疲惫的人类医生更稳定。

📐 一句话总结 CNN:局部扫描(卷积) + 抓重点(池化) + 层层抽象(深度) = 让机器看见

眼睛解决了。可语言更狡猾——「它」指什么、「苹果」是水果还是手机……→ 第三幕。

03
第三幕 · 约 18 分钟

会读文字的机器:Transformer

2017 年,8 位 Google 研究者发表了一篇标题狂妄的论文:
《Attention Is All You Need》—— 注意力,就是你所需要的一切。

语言的难点 → 老办法的困境 → 注意力 → Q / K / V → 大模型

第三幕 · Transformer · 困难

语言难在哪?两个拦路虎

🍎

拦路虎 ① · 一词多义

"苹果发布了新手机" —— 是公司

"苹果酸酸甜甜的" —— 是水果

同一个词,意思全靠上下文决定。词典查不出来。

🔗

拦路虎 ② · 长距离依赖

"小明把书放在桌上,因为他觉得太厚了。"

"它"是还是?隔了好几个词,还得靠常识(厚的通常是书)。人秒懂,机器很难。

🔢 前置问题:计算机不认识汉字。第一步是把每个词变成一串数字(词向量),意思相近的词,数字也相近——"国王 − 男人 + 女人 ≈ 女王",数学真能这么算!

于是问题变成:怎么让机器根据上下文,动态地理解每个词?

第三幕 · Transformer · 老办法

老办法 RNN:像传纸条,边读边忘

"小明放在桌上因为它 …"

RNN 从左到右逐词阅读,把"读书笔记"(隐状态)一路往下传

烦恼 ① · 金鱼记忆 🐟

笔记每传一步就被覆盖压缩,读到句尾,开头的信息早忘了。梯度消失的通俗版:传 100 步后,"小明是谁"基本听不见声了。

烦恼 ② · 一个都不能慢 ⏳

必须从左到右排队处理,第 100 个词必须等第 99 个——没法并行,GPU 的肌肉完全使不上,数据一大就训不动。

2017 年那 8 位研究者拍板:干脆别传纸条了——让每个词直接"看"整句话。

第三幕 · Transformer · 核心思想

破局思想:注意力(Attention)

读到每个词时,回头"看一眼"句子里所有的词
并把注意力集中在真正有用的词上。

📖 比喻 · 侦探小说

读到结局时,你会自动翻回前面的伏笔——关键线索注意得多,路人角色注意得少。每个读者心里都有一套"注意力分配"。

⚙️ 关键特性 · 动态计算

注意力权重不是写死的规则,而是根据词的内容现场算出来:换一句话,"它"关注的对象就变了。

这个"看一眼、分轻重"的机制完美解决两个拦路虎:多义词看上下文"它"直接望向"书"——不管隔多远。

第三幕 · Transformer · 眼见为实

亲眼看看:「它」在注意谁?

「小明把书放在桌上,因为太厚了。」

行 = 当前正在理解的词  列 = 它注意的词(越亮越强)

看「它」那一行:「书」亮得刺眼 (0.60) —— 注意力机制自己学会了指代消解,没人写一条规则。

再验证一下:「厚」那一行也最关注「书」——形容词天然黏着它修饰的名词。注意力矩阵里,全是语言学。

第三幕 · Transformer · 机关详解

注意力的机关:Q · K · V(查字典三部曲)

Q 查询 Query

我想找什么?
—— 当前词抛出的问题

🏷️

K 键 Key

我能被怎样找到?
—— 每个词亮出的索引标签

📦

V 值 Value

我真正的内容是什么?
—— 匹配成功后取走的答案

  1. 句子里每个词都派出自己的 Q、亮出自己的 K、备好自己的 V(由同一个词向量乘三种不同的权重变换而来);
  2. 用「我的 Q」和「所有词的 K」逐个比对,算出相似度分数
  3. 分数经 softmax 变成百分比(就是热力图上那一行!加起来=100%);
  4. 按百分比把所有词的 V 加权混合 → 得到这个词"看过全文之后"的新理解。

📖 类比:在图书馆,你带着问题(Q),扫每本书的书脊标签(K),把最相关几本的内容(V)摘抄汇总。
公式版:Attention(Q,K,V) = softmax(QKᵀ/√d)·V —— 能看懂就赚了,看不懂记住思想:按相关度加权取内容。

第三幕 · Transformer · 升级

多头注意力:请一组专家同时看

一套 Q/K/V 只能捕捉一种关系——有点像一个只懂语法的语文老师。

Transformer 的做法:并行跑 8~16 套注意力(每套叫一个"头"),每套有自己独立的 Q/K/V 权重,各自学会关注不同角度:

🧑‍🏫 语法头:动词找它的宾语 🧑‍⚖️ 指代头:「它」→「书」
🧑‍🎨 语义头:近义词抱团 🧑‍💼 位置头:相邻词组合

👥 类比 · 小组讨论

六个同学分别从语法、逻辑、常识、情感……角度读同一句话,最后把结论拼接汇总——比一个人看得全、看得深。

还有两位幕后功臣:前馈网络(注意力后各自"消化深思")和残差连接(把输入抄个近道加回来,层数再深也不失忆)。每个零件都简单,组合起来就强大。

第三幕 · Transformer · 全家福

两个补丁,一张全家福

⚠️ 注意力有个盲点:它天生不分先后——"猫追狗"和"狗追猫"算出的注意力一样!
补丁:位置编码——给每个词发一个"座位号"(一串数字加进词向量),顺序信息从此入账。

输入:词向量 + 位置编码
编码器 Encoder ×N 层 · 负责「理解」
多头自注意力(句内互看)
前馈网络(逐词深思)
↓ 输出 K、V 供解码器查询 ↓
已生成的词 + 位置编码
解码器 Decoder ×N 层 · 负责「生成」
掩码自注意力(只许看前文)
交叉注意力(Q 问编码器,K/V 是全文理解)
前馈网络
线性 + Softmax → 词表概率 → 下一个词

全家福里没有循环、没有卷积——只有注意力 + 前馈,堆叠 N 层。这就是论文标题《Attention Is All You Need》的狂妄与精辟。

第三幕 · Transformer · 两大门派

同一个 Transformer,两种玩法:BERT 与 GPT

📝

BERT · 完形填空

随机遮住一个词,让模型双向看上下文猜出来。

"白日依山尽,黄河入海[MASK]" →

擅长理解:搜索引擎、文本分类、阅读理解。

📜

GPT · 文字接龙

只看前文,预测下一个词,然后继续往下编。

"床前明月" → → ",疑是地上霜"…

擅长生成:对话、写作、写代码。

GPT = Generative(生成式)Pre-trained(先海量预训练)Transformer(用本幕架构)。ChatGPT 就是 GPT 家族加上"人类示范教学"(RLHF)后的直系后代。

共同配方:预训练(先博览群书)+ 微调(再针对岗位培训)——像先上大学,再岗前培训。

第三幕 · Transformer · 揭秘

大模型如何说话:一直在「猜下一个词」

输入:「白日依山尽,黄河入海」→ 模型预测下一个字:

92%
3%
2%
1%

朴素得惊人的目标

没有模板、没有 if-else,只有一件事:猜得准。选中"流"后拼回句尾,再猜下一个……一字一字滚出去。

有趣的小细节

每生成一个词都重新做一轮注意力;"温度"参数允许偶尔选低概率词——所以 AI 有时更稳、有时更浪。

🔥 惊人的部分:目标这么简单,但当数据够多 + 参数够大时,语法、事实、翻译、代码、甚至一步步推理……全都自动涌现
熟读唐诗三百首,不会作诗也会吟——大模型是这句话的工业级实现。

第三幕 · Transformer · 军备竞赛

越大越聪明?——规模定律

GPT-1 (2018)
1.17 亿参数
GPT-2 (2019)
15 亿
GPT-3 (2020)
1750 亿
GPT-4 (2023)
万亿级(未公开)

横轴为对数尺度——每往右一格,都是 ×10

读的书也指数增长

训练文本从几本书 → 数万亿词,相当于一个人不吃不睡读上几千年

量变引起质变

多步推理、少样本学习等能力,在小模型上近乎 0 分,规模过坎后突然出现——涌现。

冷静一点 🧊

更大 = 更贵、更慢、更耗电,幻觉依旧。科学家同时在找"更聪明的办法"——效率革命正在发生。

尾声 · 回望

70 年,一次回望

1943神经元数学模型
1950图灵测试
1956AI 正式命名
1969寒冬将至 ❄️
1986反向传播
1997深蓝胜棋王
1998LeNet 上岗
2012AlexNet 引爆
2016AlphaGo 破围棋
2017Transformer 诞生
2020GPT-3 · 1750 亿
2022ChatGPT 破圈
2024AI 摘得诺贝尔奖

历史规律 ①

每次爆发 = 老思想 × 新燃料(数据、算力)。神经网络等了 70 年才等到自己的时代。

历史规律 ②

寒冬之后必有突破。被嘲笑的想法,可能只是在等它的 GPU。

历史规律 ③

从"教规则"到"学规律",再到"规模涌现"——范式一换,天地皆宽。

尾声 · 冷静看待

AI 的能与不能

它很能干

认图、听音、写作、编程、翻译;辅助科研——AlphaFold 预测 2 亿多个蛋白质结构,拿下 2024 诺贝尔化学奖。

⚠️

它会翻车

幻觉:一本正经地编造不存在的论文、史实;没有真正的理解:换个刁钻问法就露馅;还有数据偏见、隐私、能耗问题。

🧭

使用守则

① 把 AI 当"最博学也最自信的同学"——一定要核验
② 用 AI 辅助学习,不用它代替学习。
③ 敏感信息不投喂。

🎯 一句话:AI 没有善恶,使用者的素养决定它是良师还是枪手
它能给你答案,但代替不了你思考——而思考,恰恰是你未来最值钱的能力。

尾声 · 展望

想亲手创造 AI?你的三步行动清单

📐

第一步 · 打好地基

数学:函数 → 导数(下山的方向!)→ 概率(接龙的底气)→ 矩阵(数据的容器)。
英语:前沿论文和文档几乎都是英文。

🐍

第二步 · 学会工具

Python——AI 世界的通用语,语法接近自然语言。高中完全学得动,一周能写小项目。

🛠️

第三步 · 立刻动手

用 PyTorch 训练"手写数字识别"(MNIST,核心代码约 10 行,笔记本就能跑);B 站公开课(吴恩达/李宏毅);Kaggle 比赛。

💡 AI 还远未"完成"——70 年的历史说明,下一个里程碑可能就出自今天教室里的某个人。

谢谢 · 问答

"我们只能看清前方很短的距离,
但那里已有太多值得去做的事。"

—— 艾伦·图灵,1950

🕰 历史:老思想 × 新燃料 👁 CNN:局部扫描,层层抽象 💬 Transformer:注意力,全局关联

Q & A

课后挑战 🏗️ ① 让 AI 给你讲一遍"卷积",检查它讲得对不对 ② 对家人解释:ChatGPT 为什么会"说话" ③ 试着让 AI 犯一次错,并找到证据