A Brief History of Artificial Intelligence

从一颗人造神经元,
到会推理的万亿参数模型

人工智能不是某一天被发明的,而是八十多年里一次次「提出设想 → 遭遇瓶颈 → 换条路再来」的结果。 这份导览用八个阶段、六十多个关键节点,把它的来龙去脉讲清楚:谁提出了问题,什么技术解决了它,又是什么让它两次跌入寒冬。

1943第一个人工神经元数学模型
1956「人工智能」一词诞生
80+年学科历程
2次行业寒冬(1974 / 1987)
01 · 定义

先弄清楚:我们究竟在谈什么

「人工智能」在日常语境里指三件并不相同的事。分清楚它们,历史里的许多争论就顺理成章了。

PERSPECTIVE 01

像人一样思考

关注内部的推理过程,希望机器复现人类的思维规律。认知科学、逻辑主义、早期符号 AI 都在这个框架里工作。

关键词:逻辑推理、知识表示、可解释

PERSPECTIVE 02

像人一样行动

以外部行为为判据。图灵 1950 年提出:如果对话中分不出对方是人还是机器,就不必再纠结「它是否真的在思考」。

关键词:图灵测试、行为主义、评估基准

PERSPECTIVE 03

理性地行动

最主流的工程定义:在给定目标与环境约束下,选择期望收益最大的动作。它把 AI 交给优化与决策理论。

关键词:搜索、规划、强化学习、效用

一句话概括:AI 是「让机器完成那些原本需要人类智能才能完成的任务」的工程与科学集合。 它包含但不等于机器学习,更不等于大语言模型——后者只是当前这条技术曲线上的最新一段。
02 · 分期

八个阶段,一条锯齿状的曲线

AI 的历史不是稳步上升,而是「热情高涨 → 承诺落空 → 经费撤退 → 新范式接棒」的反复。 每一次寒冬之后,回归的技术路线都与上一轮不同。

1943–1955

孕育:思想先于机器

神经元的数学模型、信息论、赫布学习律与图灵测试相继出现。计算能力尚不存在,但问题已经被提对了。

# 设想期
1956–1973

诞生与盲目乐观

达特茅斯会议命名了「人工智能」。逻辑理论家、感知机、LISP、ELIZA 接连问世,研究者相信二十年就能造出人级智能。

# 黄金年代
1974–1979

第一次寒冬

机器翻译与语音理解项目失败,莱特希尔报告直接导致英国撤资;明斯基对感知机的批评冻结了神经网络研究十余年。

# 第一次寒冬
1980–1987

专家系统与连接主义复兴

XCON 等专家系统在工业界赚到真金白银,日本启动第五代计算机计划;反向传播算法被重新发现,神经网络卷土重来。

# 商业化高峰
1987–2011

第二次寒冬与统计学习崛起

专用 LISP 机器被通用工作站取代,专家系统维护成本失控。AI 转向概率、统计与数据驱动:SVM、贝叶斯网络、LSTM 陆续成型。

# 静默积累期
2012–2017

深度学习革命

AlexNet 在 ImageNet 上一战成名,GPU + 大数据 + 深层网络形成正循环。AlphaGo 击败李世石,Transformer 在 2017 年埋下下一轮爆发的种子。

# 范式确立
2018–2022

大模型时代

预训练 + 微调成为通用配方,参数从亿级走到千亿级。AlphaFold 2 解决了蛋白质折叠;ChatGPT 让数十亿人第一次真正用上生成式 AI。

# 规模定律
2023–至今

推理、智能体与治理

多模态成为标配,「测试时计算」让模型学会先想再答;智能体开始接管长流程任务。与此同时,监管、版权与就业冲击第一次成为主线议题。

# 落地与约束

展开六十多个具体节点 →

03 · 驱动力

算法、算力、数据:三根柱子缺一不可

神经网络的想法 1958 年就有了,为什么直到 2012 年才爆发?因为深度学习不是单点发明, 它需要同时具备三样东西——而其中两样来自 AI 领域之外。

ALGORITHM

算法

反向传播解决「深层网络怎么训练」,ReLU、Dropout、批量归一化解决「深层网络怎么训得稳」,注意力机制解决「长序列怎么建模」。

1958 感知机 → 1986 反向传播 → 1997 LSTM → 2012 AlexNet → 2017 Transformer

COMPUTE

算力

GPU 原本为游戏图形设计,其大规模并行浮点运算恰好匹配矩阵乘法。算力增长使「规模越大、效果越好」从猜测变成可复现的规律。

CPU → GPU(2007 CUDA)→ TPU(2015)→ 万卡集群

DATA

数据

互联网积累了人类历史上从未有过的标注与文本语料。ImageNet(2009)提供了统一评测基准,让「谁更强」第一次有了客观答案。

WordNet → ImageNet → 网页级语料 → 合成数据与人类反馈

前沿模型训练算力的量级变化

单位为训练所需浮点运算次数量级(FLOP),横条长度按对数刻度绘制。这些数字来自公开研究机构的估算,不同统计口径差异很大,此处只用于展示增长趋势,不宜当作精确值引用。

04 · 流派

三条路线,轮流坐庄

整部 AI 史,很大程度上是这三种信念之间的竞争。今天的大模型是连接主义的胜利, 但它同时在吸收另外两条路线的工具:符号推理用于工具调用,强化学习用于对齐与推理训练。

流派 核心信念 代表方法 巅峰时刻 主要局限
符号主义
Symbolism
智能 = 符号操作与逻辑推理 逻辑理论家、LISP、专家系统、知识图谱、定理证明 1980 年代专家系统商业化;2011 年 Watson 夺冠 知识靠人工编写,难以扩展;处理不了模糊、感知与常识
连接主义
Connectionism
智能从大量简单单元的连接中涌现 感知机、反向传播、CNN / RNN、Transformer、扩散模型 2012 年 AlexNet;2017 年 Transformer;2022 年 ChatGPT 依赖海量数据与算力;黑箱难解释;容易产生幻觉
行为主义
Actionism
智能体现在与环境的交互和奖惩中 控制论、强化学习、TD-Gammon、AlphaGo、RLHF 2016 年 AlphaGo;2022 年 RLHF 塑造 ChatGPT 样本效率低;奖励设计困难;真实环境试错代价高
学习的每一个方面或智能的任何其他特征,原则上都可以被精确地描述,从而可以造出一台机器来模拟它。 —— 1955 年达特茅斯会议项目提案(原文大意),「人工智能」一词正是从这里走向世界
常见的误解:「AI 一直在进步」并不成立。1974 与 1987 两次寒冬中,大量研究者转行、经费被砍、论文无人问津。 今天的热度同样建立在「承诺能否兑现」之上——这正是了解这段历史最现实的意义。