从图灵之问到 ChatGPT —— 看懂机器的「眼睛」与「语言大脑」
合肥六中 王瑞
ZCode GLM-5.3
AI 的 70 年:从图灵之问、两次寒冬,到 AlexNet、AlphaGo 与 ChatGPT。
约 18 分钟
卷积神经网络 CNN:放大镜、找重点、层层抽象——机器如何认出一只猫。
约 18 分钟
Transformer:注意力机制、查字典式的 Q/K/V,ChatGPT 为什么会"说话"。
约 18 分钟
70 年时间线总回顾;AI 的能与不能;你现在就能做的三件事。
约 6 分钟 + 问答
每一幕都有小互动,随时举手提问——没有"太笨"的问题。
① 你手机里,藏着多少个 AI?
人脸解锁、拍照美颜、语音助手、相册搜索、短视频推荐……一部手机里至少有 5~10 个 AI 模型在工作。
② AI 和计算器,都是"会算的机器",差别在哪?
计算器的规则是人写死的;AI 的本事是从大量例子中自己学出来的——没人告诉它猫长什么样,它看过百万张猫片后自己总结。
③ 今天下课时,你希望弄明白什么?
比如:手机凭什么认出我的脸?ChatGPT 凭什么会聊天?——这两个问题,正是今天的第二幕和第三幕。
如果一件事通常需要人类智能才能完成——看得懂、听得懂、会推理、能创造——那么让机器去做它,就是人工智能。
注意包含关系:AI 是大圈,机器学习是其中一支(不写规则、自己学),深度学习又是机器学习的一支(用多层神经网络学)。
📌 今天的两位主角 CNN 和 Transformer,都在最里面那个小圈里。
艾伦·图灵(1912–1954),计算机科学之父、二战密码破译英雄。1950 年他在论文《计算机器与智能》里提出那个著名的问题。
但"思考"没法测量,吵一万年也没结论。图灵的天才之处:换一个可以检验的问题——
模仿游戏(图灵测试):提问者隔着墙向"人 A"和"机器 B"提问,如果分不清谁是人、谁是机器,那台机器就算拥有智能。
他曾预言:到 2000 年,机器能骗过 30% 的提问者。2014 年确有聊天程序宣称达标(争议很大)——而今天的大模型早已让这个问题变得更微妙。
↓ 隔着墙提问 ↓
分得清吗?
1956 年夏,美国达特茅斯学院。约翰·麦卡锡、马文·明斯基、克劳德·香农等 10 位年轻人聚在一起,研究一个当时听起来像科幻的题目。
就在这份提案里,Artificial Intelligence(人工智能)一词正式诞生——这门学科有了名字和生日。
提案里的乐观预言:只需一个夏天、一台机器,就能在语言、抽象等智能问题上取得重大进展。
"我们将猜测:学习的每个方面、智能的任何特征,原则上都能被精确描述,从而让机器去模拟它。"
—— 达特茅斯提案,1956
结果:这个"夏天",一过就是 70 年。
冷知识:这 10 位与会者中,先后走出了 5 位图灵奖得主——含金量堪比"全明星赛"。
演示程序在小问题上惊艳四座:会证明定理、会下跳棋。媒体和经费蜂拥而至。
但全都只在小规模下成立,问题一变难就崩。
机器翻译闹笑话:把"心有余而力不足"译成"伏特加不错,肉都烂了"(经典轶闻)。
算力不足 + 承诺落空 → 各国经费断流。
专家系统流行:把人类专家的知识写成一条条 IF–THEN 规则。
规则越写越多、维护成本爆炸,1987 年市场崩盘。
"AI"一度成为贬义词,从业者被迫改名换姓叫"机器学习"。
但种子还在:神经元思想与反向传播在暗中积蓄力量。
💡 教训:靠人手写规则,永远写不完。智能不该被"教",而应该自己"学"。
1997 年,IBM 的深蓝以 3.5 : 2.5 击败国际象棋世界冠军卡斯帕罗夫,举世震惊。
但深蓝赢的方式一点也不"像人":它不会直觉,只会暴力搜索——把能走的棋全部算一遍,挑最好的。
象棋只有 64 格,暴力搜索撑得住。可是围棋的变化约 10¹⁷⁰ 种——比全宇宙的原子还多,再快的计算机也算不过来。
64 格棋盘 → 搜索可行 ✅
19×19 围棋 → 搜索失效 ❌
图像、语言更是如此:没有明确的"下一步"可枚举。
出路不在"算得更多",而在"学得更好"。
IF 长耳朵 AND 有胡须 THEN 是猫
人把知识一条条写进机器。优点:可解释。死穴:写不完、不会变通——猫趴着、侧脸、只有半只耳朵呢?
给机器看 100 万张标注过的图片,它自己调整参数总结出"什么是猫"。
见得多了,趴着、侧脸、糊图都能认——会泛化。
🍼 比喻:没有人教孩子"猫的几何定义",都是指着猫说"这是猫",看多了自然认得。机器学习就是把这套流程搬给计算机。
这一路叫监督学习:图片是习题册,标签是标准答案——机器刷几百万道题,刷到接近满分。
互联网把整个世界数字化。李飞飞团队 2009 年建成 ImageNet:1400 万张人工标注图片,机器的"习题册"终于够厚。
GPU——原本为游戏画面发明的显卡,恰好擅长神经网络最需要的"海量乘加运算",速度是 CPU 的几十倍。
神经网络思想 1943 年就有,反向传播 1986 年已成熟——老点子静静等了几十年,就等燃料到位。
🔥 老想法 × 新燃料 = 新革命。深度学习的三种成分早就齐了,只差点火。
ImageNet 图像识别大赛:把 1000 类图片认错的比例(越低越好)
赛场上,多伦多大学 Hinton 团队的学生 Alex 用两块游戏显卡,训练了一个 8 层神经网络——正是 CNN。
错误率一步从 26.2% → 16.4%,比第二名整整领先 10 个百分点,学界直接炸锅。
三年后(2015),深度网络错误率 3.6%,低于人类的 5.1% —— 机器第一次在"看"这件事上超过了人。
从此:大厂全面转向,GPU 被抢购一空,"深度学习"时代正式开始。
围棋曾是"计算机永远攻不下"的堡垒:10¹⁷⁰ 种变化让暴力搜索彻底绝望,职业棋手判断棋形靠的是直觉。
DeepMind 的思路:深度学习(研究人类几千万盘棋谱,学出"棋感")+ 强化学习(左手跟右手对弈 3000 万盘,越下越强)。
2016 年 3 月,AlphaGo 4 : 1 战胜李世石。
第二局第 37 手 · 载入史册
AlphaGo 落下一手人类棋手概率仅 0.007% 的棋——起初被视为失误,几十手后显出杀机。解说惊呼"神之一手"。
那一刻人类意识到:它不是在模仿人,它在探索人没走过的路。
后续:2017 年 Master 对人类顶尖棋手 60 连胜;同年 AlphaZero 不看任何棋谱、纯自学 3 天,超越全部人类历史棋力。2020 年 AlphaFold 破解蛋白质折叠,把 AI 推进了基础科学(2024 年获诺贝尔化学奖)。
ChatGPT 上线 2 个月,用户破 1 亿——电话用了 75 年,手机 16 年,互联网 7 年。
AI 第一次不再是实验室名词,而是日常工具。
核心技术正是 2017 年那篇论文:Transformer(第三幕主角)。
更惊人的是:没人专门教它聊天——会"接龙"就自然会聊天,能力是"涌现"出来的。
想看懂这一切,得先弄懂机器是怎么「看」的 → 进入第二幕。
人脑约 80% 的外界信息来自视觉。
计算机没有眼睛——它「看」到的世界,究竟是什么样子?
像素 → 神经元 → 卷积 → 池化 → 层层抽象 → 认出一只猫
一张 10×10 的手写数字图(每个小方格 = 一个亮度)
这是什么数字? —— 7 ✔
对计算机而言,图片就是一张数字表格:0 = 全黑,255 = 全白。它不懂"形状",只认识数字。
放大看:所谓"笔画",只是数字由暗变亮
感受一下规模:28×28 小图 = 784 个数;一张手机照片 4000×3000×3(RGB)≈ 3600 万个数。
🎯 核心难题:从 3600 万个数字里,怎么判断"这是一只猫"?
y = f( w₁x₁ + w₂x₂ + w₃x₃ + b )
期末总评 = 0.2×平时 + 0.3×期中 + 0.5×期末——这就是加权求和!区别:老师手动定权重,神经网络自己学出权重。
相当于老师的"印象分基准":信号再强,达不到门槛就不兴奋。
决定"要不要兴奋、兴奋多少"。最常用的 ReLU 一句话:负数一律归零——没用的信号直接闭嘴。
生物神经元:树突收信号 → 胞体汇总 → 超过阈值就放电。人工神经元是它的数学漫画版。
每一根连线都是一个可学习的权重。图上这个小网络就有 26 个参数——而 GPT-3 有 1750 亿个。
信息流向:输入层接收原始数据 → 隐藏层逐层加工 → 输出层给出答案(如"猫 98%")。
"深度"学习的"深",指的就是隐藏层堆得层数多:信息像流水线,一层比一层抽象。
📌 训练的全部内容:自动调好每一个权重,让"看图识猫"的正确率最高。
📐 数学彩蛋:"最陡下坡的方向"就是导数——高中数学的"变化率",即将在你的人工智能生涯里反复登场。
步子大小叫"学习率":迈太大容易跨过谷底来回震荡,迈太小则学得极慢。
把每个像素都连给每个神经元:一张 100×100 的小图、输出层 1000 个神经元
= 1 亿个参数(这才只是第一层!)
训练慢、显存爆、还容易"死记硬背"(过拟合)——背会了训练集,见到新图就懵。
把图片像素全部打乱,全连接照样"工作"——因为它从没理解过"相邻像素有关系"。
猫在左上角学会一套,猫挪到右下角就得从头再学——全连接天生不懂"平移不变"。
💡 但图像有两条天然规律:① 局部相关(相邻像素才构成特征);② 平移不变(猫在哪都是猫)。
需要一位天生懂"看"的专家 → CNN(卷积神经网络)登场,1998 年由 LeCun 提出,2012 年一战成名。
在班级大合影里找好朋友:你不会一眼扫描全班,而是拿着他的样子,一小块一小块对照。
CNN 就这么干:一个小窗口(比如 3×3)从图片左上角出发,逐格滑动,每到一处就把窗口里的像素做一次"加权求和",得到一个数。
所有位置算完,得到一张新图——特征图:它标记了"这个图案在哪里出现过"。
为什么这样设计是天才的?
🔍 只看局部:3×3 窗口=9 个权重,而不是 1 亿个——参数骤减。
🔁 权重共享:同一扇"放大镜"扫遍全图——猫在哪个角落都逃不掉。
🗺️ 输出特征图:不仅回答"有没有",还回答"在哪里"。
这个"滑动窗口 + 加权求和"的操作,学名叫 卷积(Convolution)。下一页亲手算一次!
看结果:只有"左暗右亮"的边缘处被点亮——这组权重就是一台"竖直边缘探测器"。
换一组数字,就能探测横边、斜边、斑点……最妙的是:这些数字不是人设计的,是训练自动学出来的!真实 CNN 每层有几十~几百个这样的"探测器"并行工作。
4×4 特征图
2×2:每个区域取最大值
Max Pooling(最大池化):每个 2×2 小区域只保留最大的一个数——"这片区域最强响应是多少"。
📉 图变小 75%,算力省下来;"哪里有特征"留住了,"特征多亮"不重要。
🧲 附赠能力:图案稍微挪一两格,最大值不变——网络对小平移不敏感了。
⚽ 比喻:看完 90 分钟球赛,你记住的不是每一帧,而是进球瞬间——最强的信号才值得记住。
📚 类比识字:笔画 → 偏旁 → 汉字 → 词 → 句子。每一层都基于上一层,越深越抽象——这就是"深度学习"名字的由来。
这不是比喻——科学家真的可视化过训练好的网络:第 1 层的卷积核长得和边缘探测器一模一样,与猫视觉皮层的研究(1962)惊人相似。AI 向大脑偷师,学得很成功。
银行支票上的手写数字自动识别——CNN 的第一次商业上岗,每天处理几百万张支票。
ImageNet 错误率断崖式下降,深度学习时代开幕(第一幕已讲)。
ResNet 深达 152 层、错误率低于人类;人脸解锁、相册搜"猫"、医学影像筛查、自动驾驶感知。
CT 片早期肺癌筛查、皮肤癌识别、工业质检——很多领域 CNN 比疲惫的人类医生更稳定。
📐 一句话总结 CNN:局部扫描(卷积) + 抓重点(池化) + 层层抽象(深度) = 让机器看见
眼睛解决了。可语言更狡猾——「它」指什么、「苹果」是水果还是手机……→ 第三幕。
2017 年,8 位 Google 研究者发表了一篇标题狂妄的论文:
《Attention Is All You Need》—— 注意力,就是你所需要的一切。
语言的难点 → 老办法的困境 → 注意力 → Q / K / V → 大模型
"苹果发布了新手机" —— 是公司
"苹果酸酸甜甜的" —— 是水果
同一个词,意思全靠上下文决定。词典查不出来。
"小明把书放在桌上,因为他觉得它太厚了。"
"它"是书还是桌?隔了好几个词,还得靠常识(厚的通常是书)。人秒懂,机器很难。
🔢 前置问题:计算机不认识汉字。第一步是把每个词变成一串数字(词向量),意思相近的词,数字也相近——"国王 − 男人 + 女人 ≈ 女王",数学真能这么算!
于是问题变成:怎么让机器根据上下文,动态地理解每个词?
RNN 从左到右逐词阅读,把"读书笔记"(隐状态)一路往下传
笔记每传一步就被覆盖压缩,读到句尾,开头的信息早忘了。梯度消失的通俗版:传 100 步后,"小明是谁"基本听不见声了。
必须从左到右排队处理,第 100 个词必须等第 99 个——没法并行,GPU 的肌肉完全使不上,数据一大就训不动。
2017 年那 8 位研究者拍板:干脆别传纸条了——让每个词直接"看"整句话。
读到每个词时,回头"看一眼"句子里所有的词,
并把注意力集中在真正有用的词上。
读到结局时,你会自动翻回前面的伏笔——关键线索注意得多,路人角色注意得少。每个读者心里都有一套"注意力分配"。
注意力权重不是写死的规则,而是根据词的内容现场算出来:换一句话,"它"关注的对象就变了。
这个"看一眼、分轻重"的机制完美解决两个拦路虎:多义词看上下文,"它"直接望向"书"——不管隔多远。
「小明把书放在桌上,因为它太厚了。」
看「它」那一行:「书」亮得刺眼 (0.60) —— 注意力机制自己学会了指代消解,没人写一条规则。
再验证一下:「厚」那一行也最关注「书」——形容词天然黏着它修饰的名词。注意力矩阵里,全是语言学。
我想找什么?
—— 当前词抛出的问题
我能被怎样找到?
—— 每个词亮出的索引标签
我真正的内容是什么?
—— 匹配成功后取走的答案
📖 类比:在图书馆,你带着问题(Q),扫每本书的书脊标签(K),把最相关几本的内容(V)摘抄汇总。
公式版:Attention(Q,K,V) = softmax(QKᵀ/√d)·V —— 能看懂就赚了,看不懂记住思想:按相关度加权取内容。
一套 Q/K/V 只能捕捉一种关系——有点像一个只懂语法的语文老师。
Transformer 的做法:并行跑 8~16 套注意力(每套叫一个"头"),每套有自己独立的 Q/K/V 权重,各自学会关注不同角度:
🧑🏫 语法头:动词找它的宾语 🧑⚖️ 指代头:「它」→「书」
🧑🎨 语义头:近义词抱团 🧑💼 位置头:相邻词组合
六个同学分别从语法、逻辑、常识、情感……角度读同一句话,最后把结论拼接汇总——比一个人看得全、看得深。
还有两位幕后功臣:前馈网络(注意力后各自"消化深思")和残差连接(把输入抄个近道加回来,层数再深也不失忆)。每个零件都简单,组合起来就强大。
⚠️ 注意力有个盲点:它天生不分先后——"猫追狗"和"狗追猫"算出的注意力一样!
补丁:位置编码——给每个词发一个"座位号"(一串数字加进词向量),顺序信息从此入账。
全家福里没有循环、没有卷积——只有注意力 + 前馈,堆叠 N 层。这就是论文标题《Attention Is All You Need》的狂妄与精辟。
随机遮住一个词,让模型双向看上下文猜出来。
"白日依山尽,黄河入海[MASK]" → 流
擅长理解:搜索引擎、文本分类、阅读理解。
只看前文,预测下一个词,然后继续往下编。
"床前明月" → 光 → ",疑是地上霜"…
擅长生成:对话、写作、写代码。
GPT = Generative(生成式)Pre-trained(先海量预训练)Transformer(用本幕架构)。ChatGPT 就是 GPT 家族加上"人类示范教学"(RLHF)后的直系后代。
共同配方:预训练(先博览群书)+ 微调(再针对岗位培训)——像先上大学,再岗前培训。
输入:「白日依山尽,黄河入海」→ 模型预测下一个字:
没有模板、没有 if-else,只有一件事:猜得准。选中"流"后拼回句尾,再猜下一个……一字一字滚出去。
每生成一个词都重新做一轮注意力;"温度"参数允许偶尔选低概率词——所以 AI 有时更稳、有时更浪。
🔥 惊人的部分:目标这么简单,但当数据够多 + 参数够大时,语法、事实、翻译、代码、甚至一步步推理……全都自动涌现。
熟读唐诗三百首,不会作诗也会吟——大模型是这句话的工业级实现。
横轴为对数尺度——每往右一格,都是 ×10
训练文本从几本书 → 数万亿词,相当于一个人不吃不睡读上几千年。
多步推理、少样本学习等能力,在小模型上近乎 0 分,规模过坎后突然出现——涌现。
更大 = 更贵、更慢、更耗电,幻觉依旧。科学家同时在找"更聪明的办法"——效率革命正在发生。
每次爆发 = 老思想 × 新燃料(数据、算力)。神经网络等了 70 年才等到自己的时代。
寒冬之后必有突破。被嘲笑的想法,可能只是在等它的 GPU。
从"教规则"到"学规律",再到"规模涌现"——范式一换,天地皆宽。
认图、听音、写作、编程、翻译;辅助科研——AlphaFold 预测 2 亿多个蛋白质结构,拿下 2024 诺贝尔化学奖。
幻觉:一本正经地编造不存在的论文、史实;没有真正的理解:换个刁钻问法就露馅;还有数据偏见、隐私、能耗问题。
① 把 AI 当"最博学也最自信的同学"——一定要核验。
② 用 AI 辅助学习,不用它代替学习。
③ 敏感信息不投喂。
🎯 一句话:AI 没有善恶,使用者的素养决定它是良师还是枪手。
它能给你答案,但代替不了你思考——而思考,恰恰是你未来最值钱的能力。
数学:函数 → 导数(下山的方向!)→ 概率(接龙的底气)→ 矩阵(数据的容器)。
英语:前沿论文和文档几乎都是英文。
Python——AI 世界的通用语,语法接近自然语言。高中完全学得动,一周能写小项目。
用 PyTorch 训练"手写数字识别"(MNIST,核心代码约 10 行,笔记本就能跑);B 站公开课(吴恩达/李宏毅);Kaggle 比赛。
💡 AI 还远未"完成"——70 年的历史说明,下一个里程碑可能就出自今天教室里的某个人。
"我们只能看清前方很短的距离,
但那里已有太多值得去做的事。"
—— 艾伦·图灵,1950
课后挑战 🏗️ ① 让 AI 给你讲一遍"卷积",检查它讲得对不对 ② 对家人解释:ChatGPT 为什么会"说话" ③ 试着让 AI 犯一次错,并找到证据