已经具备生产价值的能力
- 语言转换类:翻译、改写、摘要、格式转换、代码注释——有明确输入输出且可人工复核。
- 代码生成与调试:写样板代码、解释报错、重构,配合测试即可验证,是目前收益最明确的场景之一。
- 信息整合:在给定材料范围内做归纳与比较(前提是材料由你提供,而不是让它「回忆」)。
- 创意发散:生成候选方案、命名、大纲,作为人类决策的起点而非终点。
- 结构化抽取:把非结构化文本转成字段、表格与标签。
共同特征:结果可验证,或错误代价可承受。
历史之所以有用,是因为它能防止两种极端:把当前技术当成万能,或当成骗局。 这一页尽量冷静地列出:今天的大模型能做到什么、在哪些地方会稳定失败、以及接下来最可能往哪走。
共同特征:结果可验证,或错误代价可承受。
共同特征:错误看起来同样自信,人类难以察觉。
它们不是修辞,而是有具体技术表现、有可测量指标、也有明确研究方向的工程难题。
模型优化目标是「生成看起来合理的文本」,这与「说出真相」并不等价。检索增强、工具调用与可验证推理是当前三条主要缓解路径,但没有一条能彻底解决。
衡量方式:事实准确率、引用可追溯率、幻觉率
我们能测出模型的行为,却很难解释它为什么这样决策。对高风险领域而言,这既是监管障碍,也是改进模型的障碍——不知道原因就无法可靠地修复。
研究方向:机制可解释性、特征可视化、探针分析
高质量人类文本正在接近枯竭,而算力与电力的扩张受物理条件约束。合成数据、数据筛选与更高效的架构成为必需,而不是可选项。
相关讨论:规模定律是否仍将延续、算力集中度
训练与推理的电力消耗已进入数据中心规划的约束条件。推理需求随用户量线性增长,使「单位 token 成本」成为比模型参数更关键的商业指标。
研究方向:量化、蒸馏、稀疏化、专用推理芯片
训练数据中大量受版权保护的作品如何使用、生成内容是否享有著作权、创作者如何被补偿——这些问题在不同法域有截然不同的答案,且仍在诉讼与立法之中。
相关议题:数据授权、生成内容标识、收益分配
「让系统做我们真正想要的」在技术上远比「让系统听话」困难。评测标准、红队测试、部署前审查、国际协调机制都处于快速搭建阶段,各国路径差异明显。
相关框架:风险分级、透明度义务、模型评测
以下不是预测,而是当前投入最集中、路线分歧也最明显的五个方向。每一条都可能在数年内被证伪—— 这正是这门学科过去八十年的常态。
把算力从训练阶段部分转移到推理阶段,让模型在回答前进行更长的推理链,并用可验证的奖励(数学答案、代码测试)来强化这个过程。核心张力是成本与延迟能否被接受。
从「预测下一个词」走向「预测世界的下一个状态」,把视频、动作与物理规律纳入统一表征。支持者认为这是通向常识与规划的必经之路,怀疑者认为代价过高、收益不确定。
把大模型的语义理解接到真实身体上。难点不在「会说」,而在数据稀缺、安全约束与硬件成本——真实世界的试错远比模拟昂贵,这条路的进展会明显慢于纯软件。
把可用能力压缩到手机、笔记本与嵌入式设备上。蒸馏、量化与混合专家架构让「小模型 + 专用数据」在大量具体任务上逼近通用大模型,同时解决隐私、成本与延迟问题。
一端是能自主拆解任务、调用工具、多轮自我纠错的智能体;另一端是把模型直接用作科研工具——蛋白质设计、材料筛选、数学猜想验证。两者共同点是把 AI 从「回答者」变成「执行者」。
这是一个短期内无法用证据裁决的问题,但了解三方的理由,比记住任何时间表预测都更有价值。
主张:现有范式足以通向通用智能,关键在规模、算力与工程投入;能力会持续涌现,抵制的代价是错失一个时代的增长。
主要依据:过去十年能力随规模稳定提升,且多次打破「这不可能」的预测。
弱点:难以解释为什么纯预测式训练会带来因果理解与真正的规划能力。
主张:能力进步不可否认,但安全研究、评测机制与治理框架必须同步甚至先行;在无法验证系统行为之前,不应把关键决策交给它。
主要依据:模型行为难以完全预测,且能力越强,错误的后果越不可逆。
弱点:安全投入难以量化收益,容易被竞争者视为拖慢节奏。
主张:当前模型是强大的统计拟合器,缺少真正的世界模型与因果推理,「通用智能」被过度营销,短期会有大量承诺落空。
主要依据:模型在简单变换下的脆弱性、训练数据依赖与缺乏持续学习能力。
弱点:低估了工程规模化与「足够好」的实用性所带来的真实影响。
从入门到深入,按阅读顺序排列。前四项适合任何背景的读者,后三项需要一定技术基础。
| 书目 | 作者 | 推荐理由 |
|---|---|---|
| 《人工智能:一种现代的方法》 | 罗素、诺维格 | 该领域最权威的教科书,覆盖搜索、逻辑、概率、学习与感知。即使只读第一部分的历史概述,也能建立完整框架。 |
| 《人工智能的探索》(The Quest for Artificial Intelligence) | 尼尔森 | 由亲历者撰写的通史,对 1950–2000 年代的人物、项目与经费起伏记录尤为详实。 |
| 《AI 3.0》 | 梅拉妮·米歇尔 | 冷静地拆解「AI 已经理解世界」这一印象,用大量具体案例说明当前系统的能力边界,适合用来校正预期。 |
| 《人机对齐》(The Alignment Problem) | 布莱恩·克里斯汀 | 把对齐问题的历史与技术脉络讲成一部叙事,是理解「为什么让 AI 听话很难」的最佳入门。 |
| 《强化学习导论》 | 萨顿、巴托 | 行为主义路线的标准教材。想理解 AlphaGo 与 RLHF 的数学基础,从这里开始。 |
| 《深度学习》 | 古德费洛、本吉奥、库维尔 | 深度学习的系统性教材,覆盖反向传播、正则化、卷积与循环网络的核心推导。 |
| 《超级智能》 | 尼克·博斯特罗姆 | 关于长期风险最常被引用的论证。无论是否同意,它定义了此后二十年这场辩论的概念框架。 |
每年发布一次的 AI 产业与学术年度报告,用数据覆盖论文、专利、投资、算力与政策,是引用率最高的年度资料。
专门追踪模型规模、训练算力与数据趋势的研究机构,本页关于算力量级的估算口径多来自此类公开分析。
几乎所有重要成果都会先以预印本形式出现在这里。前文表格中列出的十篇文献都可以免费找到原文。