SIGNAL · 2026 // 人工智能纪事

硅基黎明
当机器学会思考

从图灵的纸笔推演,到万亿参数模型在指尖生成万物——这是人类有史以来第一次,试图把自己的「心智」编译成代码。

CHAPTER 01 · 定义

什么是人工智能?

人工智能(Artificial Intelligence)是让机器模拟、延伸并扩展人类智能的科学与工程。它不是某一种技术,而是一族技术:感知、学习、推理、决策与创造。当一台机器能看、能听、能读、能写、能做出你意料之外的回应——智能的边界,就刚刚被推开了一寸。

机器学习:数据喂出规律,从像素到意义
FIG.01 / NEURAL CORTEX1024×1024
1.1

机器如何「学」

传统程序是人写规则;机器学习是数据喂出规律。深度学习用层层神经网络逼近函数——从像素到边缘,从边缘到物体,从物体到意义。没有一行代码是「教」它看猫的,它只是看了千万张猫。

2012 年 AlexNet 在图像大赛中碾压人类精心设计的特征,那一刻,行业集体意识到:算力 + 数据 = 智能 的飞轮开始转动。

赛博朋克未来城市
FIG.02 / NEON METROPOLIS1600×900
1.2

它正在渗进哪里

医疗影像里找病灶,推荐算法决定你今晚看什么,自动驾驶在车流中计算毫秒,AlphaFold 折叠了生命的基本零件——AI 不是一门学科,而是一种基础设施,像电力和语言一样,安静地嵌进一切。

2022 年之后,它又长出了新器官:大语言模型。它不仅能识别世界,还能生成世界——写文章、编代码、画图像、做视频。人机关系的定义,被彻底改写。

CHAPTER 02 · 进化纪事

七十六年,七次浪潮

AI 的历史不是一条上升曲线,而是潮起、潮落、再潮起。每一次热潮之后都有幻灭,而每一次幻灭,都为下一次更大的觉醒积累了燃料。

1950
图灵之问
Alan Turing 在论文中写下那句著名提问——「机器能思考吗?」,并提出用对话来检验智能。种子落下。
1956
达特茅斯会议
McCarthy、Minsky 等人正式命名「Artificial Intelligence」。第一波黄金时代开启,乐观到近乎天真。
1974
第一次寒冬
算力不足、承诺落空,资金断流。AI 在冷板凳上坐了十年——但研究者们没有散场。
1997
深蓝胜卡斯帕罗夫
IBM 的深蓝击败国际象棋世界冠军。世界第一次亲眼看到机器在「人类最引以为傲的智力」上赢了一次。
2012
深度学习起飞
GPU + 大数据 + 神经网络,AlexNet 引爆计算机视觉。此后十年,图像、语音、翻译全面被 AI 重新定义。
2017
Transformer 诞生
《Attention Is All You Need》——一个优雅的架构,成为之后所有大模型的共同骨架。语言的机器,有了心脏。
2022
ChatGPT 时刻
两个月,一亿用户。AI 从实验室走进每个人的手机。生成式浪潮席卷写作、编程、设计、科研——人类第一次拥有了「通用型」的智能伙伴。
2026
此刻
多模态、Agent、本地化算力……智能正在从「回答问题的机器」进化为「替你完成工作的同事」。而关于它边界的辩论,才刚刚开始。
76
从图灵论文到今天的年数
1018+
前沿模型的参数量级(个)
它让我们提出的问题数量
CHAPTER 03 · 神经网络

神经网络:从生物神经元到硅基大脑

1943 年,心理学家 McCulloch 和数学家 Pitts 提出了一个大胆的念头——把生物神经元简化成数学公式,看它能不能「思考」。答案不仅是可以,而且这条路线最终长出了今天所有的深度学习。Transformer 不是神经网络的反面,它是神经网络最精巧的一次重组

生物神经元:树突接收、胞体求和、轴突放电、突触传递(动画)
FIG.03 / BIO NEURON1024×1024
3.1

神经元:一个会做加法的小开关

生物神经元收到足够强的刺激就放电。M-P 神经元把这个行为写成了三行数学:加权求和 → 过激活函数 → 输出 0 或 1。输入信号乘以各自的「权重」,加在一起,超过阈值就「点亮」。

单个神经元几乎什么也学不会——但它有一个惊人的性质:把几百万个这样的小开关连成网络,让它们共享输入、逐层传递,整个系统就能逼近任何复杂的函数。这就是万能逼近定理,也是深度学习的数学地基。

反向传播四步:前向、算错、回传、更新
FIG.04 / BACKPROPAGATION1600×900
3.2

反向传播:机器如何「认错」

网络搭好之后,权重是随机的,输出当然是错的。怎么办?让它自己算出每个权重该往哪调

这就是反向传播(Backpropagation):预测错了,把误差从输出层一层层往回传,用链式法则算出「这个权重对错误负多少责」,然后朝减少错误的方向微调一点点。重复几百万次,网络就从乱猜变成了专家。1986 年 Rumelhart 团队把这套算法推向成熟——虽然他们自己后来都没想到,它四十年后会长出 Transformer

CNN → RNN → Transformer 架构进化图
FIG.05 / ARCHITECTURE EVOLUTION1024×1024
3.3

从神经元到 Transformer:一次架构革命

经典神经网络是「接力赛」——信息从输入层跑到输出层,一层等一层。卷积网络(CNN)让神经元看局部、堆出深度;循环网络(RNN)让信息转圈传递,记住上文。

但 RNN 有个致命伤:序列一长,记忆就丢。2017 年,Transformer 干脆拆掉了「传递」这个动作——每个词直接「注视」所有词,用注意力矩阵替代了时间上的接力。注意力的每一次计算,本质上仍是一个加权求和:和神经元做的是同一件事,只是连接方式从「固定相邻」变成了「按需动态」

所以当你说「Transformer 很强」时,更准确的说法是——它是把神经网络最核心的思想(加权、激活、反向传播、层层堆叠)保留下来,只把连接方式革命了一次

CHAPTER 04 · Transformer

Transformer:让机器学会「注视」

2017 年,Google 的八位研究者发表了一篇只有八页的论文——《Attention Is All You Need》。它扔掉了统治 NLP 十年的循环结构,只留了一个概念:注意力。今天你正在使用的一切——大语言模型、翻译、代码生成——都是站在这八页纸之上。

注意力机制:Q K V 打分、softmax 加权、多头并行
FIG.06 / ATTENTION FLOW1600×900
4.1

注意力:让每个词自己找重点

读这句话——「它放在那里,因为它属于那个地方」——你大脑会自动把「它」和「地方」连起来。Transformer 做的正是这件事:每一个词都会向整句话里的所有词发出提问——「谁和我相关?」然后按相关度分配权重、吸收信息。

这就是 Q(查询)、K(键)、V(值)三件套的由来。多头注意力(Multi-Head)则是同时开一组「注视通道」:有的盯语法,有的盯指代,有的盯语义——拼起来,就是完整的理解。

Transformer 积木:注意力+前馈+残差,堆叠成塔
FIG.07 / STACKED LAYERS1024×1024
4.2

为什么它能无限堆高

旧架构处理长文本要「排队」——一个词等上一个词算完;Transformer 的注意力是全体并行的,GPU 天生擅长这种计算,于是训练速度被甩开一个数量级。

更关键的是它的可复制性:一层 Transformer 模块 = 注意力 + 前馈网络 + 残差连接,结构干净得像乐高。于是工程师们开始疯狂堆叠——12 层、96 层、上千层,配上位置编码和层归一化,就长成了 GPT、Claude、DeepSeek 这些万亿参数的巨兽

2012 年 AlexNet 点燃了视觉,2017 年 Transformer 点燃了语言。两次革命,同一个配方:简单模块 + 无限堆叠 + 海量算力

CHAPTER 05 · 大语言模型

LLM:一个「预测下一个词」的技巧

Transformer 给了语言机器心脏,而大语言模型(Large Language Model,LLM)是这颗心脏长成的完整生命。它的能力听起来像魔法——写诗、编程、推理——但拆开看,训练目标朴素得令人惊讶:猜出下一句

大语言模型:自回归预测下一个词 + 参数规模增长
FIG.08 / LLM ENGINE1024×800
5.1

自回归:把「预测」变成「生成」

训练时,模型反复做一件事:给你前半句,猜后半句。「今天天气真__」,它答「好」。猜错就调参数,猜对就强化。几十亿次这样的练习之后,它掌握了语法、事实、甚至常识。

使用时更妙——把猜出的那个词接回到输入末尾,再猜下一个:「晴」「朗」「,」「适」「合」……一次一个词,滚雪球般生成整篇文章。这叫自回归(autoregressive):输出变成下一次输入,循环往复,直到它说出「结束」的符号。

规模定律:损失幂律下降 + 能力涌现 + 本地化
FIG.09 / SCALING LAW1024×800
5.2

规模定律:参数越多,越「像懂」

2018 年 GPT-1 只有 1.17 亿参数;两年后 GPT-2 是 15 亿;再两年 GPT-3 冲到 1750 亿,PaLM 推到 5400 亿。研究者发现一条惊人的规律——能力随规模平滑涌现:模型大到某个临界点,突然会做之前完全不会的事:写代码、做多步推理、翻译罕见语言。

到 2026 年,这条曲线没有停:万亿参数的旗舰模型在云上运行;而 2025 年的 DeepSeek-V3 用 6710 亿参数证明——聪明的模型不必最贵。量化压缩后,千亿级模型已经能塞进一台桌面电脑,大语言模型正在从「云端的巨人」变成「你身边的同事」——而它做的,自始至终只有一件事:预测下一个词。

CHAPTER 06 · 尾声
我们建造 AI,
不是为了造出更聪明的人
而是为了看清——
什么是
// END OF TRANSMISSION · Intelligence·Cortex