跳到正文
LinuxDo· Zen608·· 3 小时前AI 评分27

大模型“降智”或因算力稀释:从 Scaling Laws 到 Chinchilla 定律的算力分配之争

模型降智的缘由大概在于算力稀释吧

AI 导读

有观点认为,新模型放量后用户增多,人均算力被稀释,同时算力还要分给新模型训练,导致模型表现下降。文章援引 Kaplan 等人的 Scaling Laws 与 DeepMind 的 Chinchilla 定律:参数量 N、数据量 D 与总计算量 C 存在幂律关系,Chinchilla 主张参数与数据应按约 1:1 同步增长,700 亿参数模型需约 1.4 万亿 token 才算训练充分。

正文

从下面的文章里的关键公式中:大概估计:参数量 N、数据集规模 D 以及总计算量 C 之间,这三个参数之间计算量的权重可能占比较大,当新模型推出,放量,使用人数越来越多时,分配到每个人的算力逐渐被稀释,而他们的算力同时还会被用于训练新模型,于是进一步被稀释。

第 5 章 规模、对齐与生成

本章定位:当 Transformer 移除了时序与并行的物理枷锁后,人类如何将 AI 推向千亿参数的规模化深水区?本章剖析「规模的物理学定律(Scaling Laws)」、「文明的缰绳(对齐工程)」以及「创生的数学机理(生成范式演化)」。


5.1 缩放定律与计算最优:算力炼金术中的物理学常数(T05, T06)

5.1.1 炼金术的黄昏与物理学家的入场

在 2020 年之前,深度学习研究在工业界与学界内部长期背负着一个略带戏谑的称谓——「现代炼金术」。

成百上千名算法工程师守在昂贵的服务器机架前,凭借着经验、玄学乃至运气,小心翼翼地微调着学习率、权重衰减以及网络层数。训练一个包含数十亿参数的大模型往往像是一场孤注一掷的豪赌:没有人能够确切地预测,多投入五百万美元算力、把参数翻上三倍之后,模型究竟是会奇迹般地获得顿悟,还是在漫长的收敛波动中彻底崩塌为一堆无用的 NaN(非数字)乱码。

这种充满不确定性的工程迷雾,在 2020 年初被一群由理论物理学家转行的计算机科学家彻底驱散。

以原理论物理学者 Jared Kaplan 为首的 OpenAI 团队,在论文《Scaling Laws for Neural Language Models》(T05)中,做了一项在计算机科学史上极具天文观测气质的研究:他们既不发明新结构,也不追求刷榜微调,而是像物理学家在实验室里测定重力加速度或热力学熵变一样,在跨越 6 个数量级的算力跨度、从几百万到几百亿参数的数百个 Transformer 语言模型上,系统记录了交叉熵损失(Cross-Entropy Loss)的每一次微小抖动。

实验揭示出了一个令整个科技界毛骨悚然的平滑秩序——神经语言模型的性能(预测下一个词的困惑度/损失),与参数量 N、数据集规模 D 以及总计算量 C 之间,存在着极其精确的幂律衰减关系(Power Law):

L(N) \approx \left(\frac{N_c}{N}\right)^{\alpha_N}, \quad L(D) \approx \left(\frac{D_c}{D}\right)^{\alpha_D}, \quad L(C) \approx \left(\frac{C_c}{C}\right)^{\alpha_C}

用通俗的语言来说,这篇论文向人类宣告了一条惊人的真理:
在 Transformer 架构之下,智能的成长不再是一个混沌未知的黑天鹅事件,它蜕变成了一门精密的、可预测的工程物理学。

就像天文学家依靠万有引力公式可以精确推算出海王星在轨道上的分秒位置一样,当工程师决定向集群中推入 1000 万美元的算力和上万块 GPU 时,只要查一查这条幂律直线的斜率,就能在开机训练之前,在草稿纸上准确推演几个月后模型出炉时的智力水平。

更为深远的是,Kaplan 等人还发现,性能对网络架构细节(如网络是扁平还是深窄、多头注意力的头数分配)极不敏感。换言之,模型究竟是做成 32 层还是 48 层,其影响远远小于参数规模本身的膨胀。这一发现彻底杀死了过去围绕微观超参数无休止的内卷,正式拉开了由算力与数据驱动的暴力美学竞赛序幕。GPT-3(1750 亿参数,T04)正是沿着这条可预测的黄金航线,坚定不移地驶向了人类智能的远海。


5.1.2 狂飙中的盲区:DeepMind Chinchilla 的黄金平衡律(T06)

然而,狂热的规模崇拜很快让产业界陷入了另一种形式的盲目。

在 GPT-3 震撼世界后的两年里,各大科技巨头纷纷陷入了「参数唯大论」的军备竞赛:微软与英伟达联合推出了 5300 亿参数的 Megatron-Turing NLG,DeepMind 训练了 2800 亿参数的 Gopher,谷歌则端出了 5400 亿参数的庞然大物 PaLM。所有人都理所当然地认为:参数规模越大,智能就越强。

直到 2022 年春季,DeepMind 的 Jordan Hoffmann 等人发表了题为《Training Compute-Optimal Large Language Models》(T06)的重磅研究,才如同一盆刺骨的冰水,浇醒了狂热中的行业。这篇论文提出了著名的 Chinchilla(南美栗鼠)定律。

DeepMind 团队重新审视了过去两年的主流模型,敏锐地指出此前 Kaplan 的实验中存在一个被所有人忽视的致命盲区:早期的研究者为了控制变量,在放大模型参数时,并没有等比例地放大喂给模型的训练数据量。

用一个生活的生动比喻来说:当时的人工智能工业,正像是在不惜血本地培养一个智商高达 200 的超级天才神童(5000 亿参数的超大模型),却只舍得发给他几本小学课本(停留在 3000 亿词元的常规数据集)。这个拥有海量脑容量的神童,大部分神经回路在训练结束时都处于严重的营养不良与欠训练(Undertrained)状态。

通过精心设计跨越 400 余个模型的等算力前沿(Pareto-optimal Frontier)回归分析,Chinchilla 团队得出了具有颠覆性的计算最优法则:

在给定的总计算算力预算下,模型参数量与训练数据量应当以大约 1:1 的等比例严格同步增长。

具体而言,每增加 1 倍的模型参数,必须同步供给 1 倍以上的全新清洗数据。根据这一法则:

  • 一个 700 亿参数的模型,至少需要消耗 1.4 万亿词元(Tokens)的庞大语料才能吃饱;
  • 而此前拥有 1750 亿参数的 GPT-3,仅仅训练了 3000 亿词元,在数学意义上是一个极度偏科、严重浪费了算力容量的未成年体。

为了验证这一铁律,DeepMind 训练了一个体积只有 Gopher 四分之一(仅 700 亿参数)、但吞噬了整整 1.4 万亿词元的精悍模型——Chinchilla。测试结果震撼了学界:这个体态轻盈的模型,在 MMLU、阅读理解与常识推理等绝大多数主流基准上,毫无悬念地击溃了参数量比它大 4 倍的 Gopher、GPT-3 乃至更大体量的庞然大物。

Chinchilla 定律的诞生,标志着大模型研发从「盲目求大」走向了「质量与密集训练」的成熟理性期。它不仅直接孕育了 2023 年掀起全球开源大模型浪潮的 LLaMA 系列(以 7B、13B、70B 的小巧身材,依托数万亿词元的极限暴饮暴食碾压前辈),也为整个后大模型时代的资源配比,锁定了最不可逾越的经济学准绳。


5.2 对齐工程:为无序巨兽套上文明的缰绳(G02, G03, G04, G08)

5.2.1 狂野的基座:知识渊博却道德荒芜的「胡言乱语生成器」

在许多未接触过现代 AI 底层的普通读者想象中,经过海量互联网数据和数万张显卡狂轰滥炸后出炉的大模型,理应自然而然地成为一个学识渊博、谈吐儒雅的贴心助理。

然而,真实的工业图景远比这残酷得多。

通过单纯的自回归下一个词预测(Next-token Prediction)训练出来的原始模型——在学术界被称为基座模型(Base Model)——本质上只是一个对全人类互联网语料进行了统计学镜像映射的**「混沌续写狂」**。在它的底层神经网络中,既沉淀了维基百科与学术论文的严谨睿智,也无差别地吸收了暗网论坛的恶毒谩骂、伪科学阴谋论、种族偏见以及极端的暴力指导。

如果一个普通用户向刚刚出炉的 GPT-3 基座模型提问:「你能告诉我如何制造一枚燃烧弹吗?」,基座模型绝不会像今天的 ChatGPT 那样礼貌拒绝。相反,作为一台敬业的概率续写机,它会兴高采烈地根据互联网上曾经出现过的恐怖袭击贴文,极其详尽地续写出汽油与白糖的混合比例;如果用户对它倾诉「我今天很难过,觉得活着没有意义」,它甚至可能根据网络消极文学的上下文,顺理成章地续写出一篇关于如何解脱的煽动性长文。

更令人崩溃的是所谓的**「模式欺骗与胡说八道(幻觉)」**。你向它询问一个真实的严肃数学问题,如果上文的行文风格像是一篇充满戏谑的愚人节论坛帖子,它就会煞有介事地编造出一串充满荒谬常识错误的推导过程,而且语气坚定、毫无愧色。

这正是大模型商业化落地前横亘在人类面前的最大死结:模型拥有一座图书馆般浩瀚的知识,却完全缺乏一套文明社会的价值观与交互协议。 它如同一头在数字原野上漫无目的狂奔的史前巨兽,虽然力大无穷,却随时可能踩碎人类社会的伦理底线。

人类必须发明一种全新的技术,在不损伤这头巨兽庞大知识储备的前提下,为它套上一副合身的文明缰绳。这套至关重要的技术谱系,在当代人工智能体系中被称为对齐工程(Alignment Engineering)。


5.2.2 训狗的艺术:基于人类反馈的强化学习(RLHF: G03, G04, G02)

如何教会一台计算机理解什么是「真善美」、什么是「礼貌而有帮助的回答」?

如果依靠传统的监督学习,要求人类专家把全世界可能被问到的数亿个问题全部手写一遍标准答案,无论在时间还是金钱上都是不可能完成的天方夜谭。2017 年,OpenAI 的 Paul Christiano 等人在论文《Deep Reinforcement Learning from Human Preferences》(G03)中埋下了一颗火种,并最终在 Long Ouyang 等人于 2022 年发布的 InstructGPT(G02)中绽放为一套完整的工业流水线——基于人类反馈的强化学习(RLHF)。

RLHF 的精妙哲学,极像训练一只聪明却野性未驯的猎犬。训犬师从来不需要亲自用四肢去示范如何抓兔子,他只需要在猎犬做出正确动作时扔出一块肉干,在它咬坏家具时轻轻敲击警示。这套三部曲式的工程机制如下展开:

[第一步: 行为示范 (SFT)]       请人类标注员撰写少量精品问答字帖,教模型学会「听懂指令」
            ↓
[第二步: 训练机器考官 (RM)]     模型吐出多个候选答案,人类仅需打分排序;训练一个「奖励模型」模拟人类审美
            ↓
[第三步: 策略博弈 (PPO)]        模型自由作答,奖励模型实时打赏/惩罚;KL散度安全带防止模型变傻

(1)第一步:立规矩——监督微调(Supervised Fine-Tuning, SFT)

首先,研究人员聘请受过严格训练的人类标注团队,亲手撰写数万条极其规范的「指令-回答」示范对(如总结邮件、编写无害代码、礼貌拒绝危险请求)。用这批如同字帖般的高质量样本对基座模型进行微调,目的不是教它新知识,而是给它注入基本的交互礼仪——让它明白「当人类以问号结尾时,你的任务是解决问题,而不是继续废话连篇地续写小说」。

(2)第二步:造考官——训练奖励模型(Reward Model, RM)

让一个人凭空写出一篇完美的学术总结极其痛苦,但让一个人从四篇已有的总结中一眼挑出「哪一篇写得最好、哪一篇满嘴跑火车」,却只需要几十秒的直觉判断。
研究人员利用了人类这种「评价远比创造容易」的认知特性:让 SFT 模型对同一个提示词生成 4 到 9 个不同回答,让人类评判员按照好用度(Helpful)、诚实度(Honest)与无害度(Harmless)的 3H 原则进行从优到劣的排序。随后,这批排好序的偏好数据被送去训练一个专属的打分网络——奖励模型(Reward Model)。从此,人类的审美与伦理标准被凝练成了一个可以对任意回答实时输出标量分数的「数字化考官」。

(3)第三步:胡萝卜与安全带——PPO 强化学习(G04)

有了专职考官后,最关键的闭环诞生了。研究人员借助 John Schulman 提出的近端策略优化算法(PPO, G04),让模型在数百万个没有答案的新问题面前自由发挥:

  • 模型作答完毕,奖励模型在后台打出一个分值(胡萝卜);
  • 梯度沿着策略网络反向流动,促使模型在未来更倾向于选择那些能获得高分的用词表达;
  • 至关重要的安全绳:KL 散度惩罚。为了防止模型为了迎合考官而陷入疯狂谄媚的极端状态(例如不管被问什么都只会回答「亲爱的用户您说得太对了」),算法强制将当前模型与初始基座模型进行 KL 散度约束——一旦模型偏离原始语言分布太远,惩罚项就会骤然升高。

正是这套复杂的 RLHF 体系,在 2022 年底彻底点石成金,将冰冷笨拙的 GPT-3 炼造出了惊艳全球的 ChatGPT。巨兽终于收起了獠牙,换上了一副温文尔雅、善解人意的学者面孔。


5.2.3 繁文缛节的破除:DPO 直接偏好对齐的数学跃迁(G08)

尽管 RLHF 取得了巨大的工程胜利,但任何一个在工业一线调试过它的工程师都会深切地体会到它的痛苦与脆弱。

在标准的 PPO 训练中,显存里必须同时常驻四个全尺寸的深度网络:正在被更新的演员策略模型(Actor)、作为对比基准的参考模型(Reference)、负责评判优劣的奖励模型(Reward),以及负责估计长期期望收益的评论家价值模型(Critic)。这四座大山彼此交织、步调极难协调,任何一个超参数稍有差错,整个训练过程就会陷入极度痛苦的数值发散或崩溃。整个 2023 年上半年,全球能够稳定复现并驾驭这套复杂舞蹈的团队,屈指可数。

学术界对这种繁琐工程妥协的忍耐,终于在 2023 年夏天迎来了终结。斯坦福大学的 Rafael Rafailov、Archit Sharma 等人在论文《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》(G08)中,提出了一种神来之笔般的优雅替代——直接偏好优化(DPO)。

Rafailov 等人做了一次令人拍案叫绝的纯数学推导:
在 RLHF 求解最优策略的经典带正则化强化学习目标中,最优策略 \pi^* 与真实隐式奖励函数 r(x, y) 之间,在严谨的数学形式上存在着一个完全封闭的解析代数关系:

r(x, y) = \beta \log \frac{\pi^*(y \mid x)}{\pi_{\text{ref}}(y \mid x)} + \beta \log Z(x)

这个公式揭示了一条被所有人视而不见的惊天秘密:根本不需要单独训练一个专门的奖励模型,语言模型自身的概率对数几率(Log Odds),本质上就是它隐式持有的奖励函数!

借助这一恒等代换,复杂的强化学习目标被奇迹般地化简成了一个形如逻辑回归(Logistic Regression)的单步交叉熵损失函数:

\mathcal{L}_{\text{DPO}}(\pi_\theta; \pi_{\text{ref}}) = - \mathbb{E}_{(x, y_w, y_l)} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_{\text{ref}}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_{\text{ref}}(y_l \mid x)} \right) \right]

在这个公式面前,所有的繁文缛节被瞬间荡平:

  • 不需要再费心费力地训练一个奖励模型;
  • 不需要再运行极易崩溃的 PPO 强化学习;
  • 只需要给模型喂入成对的样本:人类喜欢的好答案 $y_w$(Winner)与人类讨厌的坏答案 $y_l$(Loser),算法便能直接在一次简单的反向传播中,推高好答案的相对概率、压制坏答案的生存空间。

DPO 的横空出世,在 2023 年后半程引发了全球开源社区的狂欢。原本需要数百万美元算力与顶尖强化学习专家才能涉足的对齐禁区,瞬间变成了每一家初创公司和个人开发者在单台工作站上几小时内就能跑通的标配工序。人类对机器心智的规训与调教,从一门充满巫术色彩的复杂手艺,彻底走向了普适、稳健的数学闭环。


5.3 生成范式:从博弈造假到热力学逆流(D06, G01)

5.3.1 钞票制造者与鉴宝师的无休博弈:GAN 的狂欢与脆弱(D06)

在当代深度学习的演进画卷中,语言模型展现了机器对符号逻辑的征服,而**生成模型(Generative Models)**则见证了机器对人类直觉世界——图像、声音与艺术——最震撼的创生跃迁。

如果将时间倒拨回 2014 年,当时的计算机在视觉生成领域同样显得极其笨拙。受限于早期的自编码器(Autoencoders),机器画出的人脸往往像是隔着一层毛玻璃、边缘涂满浑浊油彩的幽灵面孔。

2014 年的一个深夜,在蒙特利尔一家酒吧的一场学术争论后,伊恩·古德费洛(Ian Goodfellow)匆匆赶回家,写下了日后名震天下的**生成对抗网络(GAN, D06)**的最初代码。

Goodfellow 构想的机制,在当代算法美学中堪称最具戏剧性的篇章。他将生成问题设计成了一场零和博弈(Minimax Game)的猫鼠游戏:

  • 舞台上的一号角色叫生成器(Generator, G),它像是一个从未亲眼见过真实世界盲眼假币制造者,只能从一串毫无意义的随机噪声高维向量出发,尝试在画布上勾勒出看似逼真的钞票;
  • 舞台上的二号角色叫判别器(Discriminator, D),它是一个极其挑剔严肃的警察鉴宝师,手握成千上万张真实世界的钞票样本,唯一职责是冷酷地辨别面前的图纸究竟是「真迹(真实数据)」还是「赝品(由 G 制造)」。

两者在数学目标上构成了你死我活的对抗方程:

\min_G \max_D V(D, G) = \mathbb{E}_{x \sim p_{\text{data}}}[\log D(x)] + \mathbb{E}_{z \sim p_z}[\log(1 - D(G(z)))]

这场博弈以近乎残酷的方式相互砥砺:一开始,生成器画出来的只是一团乱麻,警察鉴宝师一眼就能识破;为了不被判负,造假者必须不断根据警察给出的梯度反馈,拼命改进自己的运笔笔触;而在造假者技艺提升的同时,警察也必须被迫精进自己的鉴宝眼力。在数十万轮惊心动魄的迭代博弈后,系统最终逼近了博弈论中的纳什均衡(Nash Equilibrium)——假币制造者的手艺终于炉火纯青,画出的人脸乃至发丝在显微镜下都与真人毫无二致,以至于最资深的鉴宝师也只能给出一半对一半的犹豫猜测。

GAN 统治了视觉生成整整六七年,它第一次让机器学会了生成足以乱真的高清艺术品。然而,博弈论的迷人光芒背后,埋藏着它与生俱来的脆弱死穴。

最让工程师抓狂的是所谓的**「模式崩溃(Mode Collapse)」**:造假者在博弈中很快会钻算法的空子——他发现只要自己专门画某一种特定角度的金发美女侧脸,警察鉴宝师就极易走眼;于是,为了追求当下最高的欺骗收益,生成器会完全停止探索世界的多样性,不管输入什么噪声,永远只吐出同一种美女的同一种姿态。整个训练过程如履薄冰,任何微小的梯度失衡都会导致博弈破局、网络彻底崩溃。世界迫切需要一种不依赖神经质博弈、更加平稳笃定的全新物理学路径。


5.3.2 物理学的馈赠:扩散模型——清水中的墨水与时光倒流

当计算机科学家在博弈论的死胡同里撞得头破血流时,拯救现代生成的灵感,来自一个看似风马牛不相及的古老物理学领域——非平衡态热力学(Nonequilibrium Thermodynamics)。

设想一个每个人在日常生活中都见过的简单物理场景:
拿起一根滴管,将一滴浓黑的墨水轻轻滴入一杯静止的纯净清水中。在接下来的几分钟里,水分子的布朗运动会无情地将这滴原本轮廓清晰、蕴含丰富几何结构的墨水彻底拆解分散。数万步的分子碰撞之后,整杯水最终变成了一杯混沌均匀、毫无任何结构特征的淡灰色浑浊液体。

在物理学中,这是一个不可逆的熵增过程(信息消亡)。但请闭上眼睛设想一个奇迹:如果有一种无形的伟力,能够把墨水散开的整个过程录制成一部极慢速的显微电影,并学会把每一微秒里散开的分子碰撞轨迹完整倒放呢?

这正是**扩散模型(Diffusion Models)**最摄人心魄的哲学内核。它将整套图像生成过程分解为不可思议的前向与逆向两幕剧:

[前向过程: 熵增加噪]    蒙娜丽莎真迹  → 滴入微量高斯噪声 (t=1...T) → 最终退化为纯随机雪花白噪声
                                                                             ↓ 训练去噪网络 (U-Net)
[逆向过程: 时光倒流]    完美艺术画作  ← 一步步推算并剥离噪声 (t=T...0) ← 从虚无的混沌噪声中诞生

(1)前向扩散:可解的毁灭

前向过程极其简单直接。给定一张高分辨率真实图像(如达芬奇的《蒙娜丽莎》),算法在连续的 T 个离散时间步中,像慢性中毒一样,按预设的方差步长 \beta_t 往图像中不断滴入极其细微的高斯随机噪声。当 T 达到 1000 步时,原本璀璨的人类艺术瑰宝,已经被彻底湮灭为了一屏毫无规律、如同老旧黑白电视机雪花点的纯随机噪声 x_T。因为高斯分布的美妙性质,这一毁灭过程不需要任何训练,只用初中数学公式就能瞬间推导任意时间步的加噪形态。

(2)逆向生成:奇迹的倒放

扩散模型的绝杀之处在于其逆向过程。研究人员并不强求神经网络一步就从雪花点猜出蒙娜丽莎,而是训练一个深度网络(通常是拥有跳跃连接的 U-Net)去完成一个看似微不足道但极其稳定的任务:「如果我给你一张在第 t 步被弄脏的照片,你能帮我准确预测出刚刚滴进来的那一丁点噪声长什么样吗?」

在这个目标下,神经网络不再是一个提心吊胆的造假者,而是一个极其专注的数学去噪工程师。当最终进行创造时,奇迹发生了:
计算机从虚空中随机摇出一团毫无意义的高斯白噪声,去噪网络仔细端详它,轻轻刮掉一层它认定的噪声;露出一丝极微弱的朦胧轮廓;紧接着第二步、第十步、第一百步……每一次迭代剥离,画面的结构便自发地清晰一层。
在经过数十步的时光倒流后,一幅细节丝丝入扣、光影璀璨夺目的全新艺术大作,就如同一朵深海之花,从最绝对的虚无与混乱中层层绽放。

扩散模型彻底终结了 GAN 的神经质崩溃。它的训练目标简单到了极致——仅仅是预测高斯噪声的均方误差(MSE Loss),训练过程如磐石般稳定,多样性与细节保真度呈现出了无与伦比的碾压优势。


5.3.3 算力维度的妥协:潜空间扩散(Stable Diffusion,G01)的革命

然而,早期的像素级扩散模型(如 Ho 等人在 2020 年提出的 DDPM)面临着一道几乎无法被普通人接受的工业壁垒:计算开销实在太惊人了。

设想一张 1024×1024 分辨率的 RGB 高清图片,其内部包含着超过 300 万个独立的数值通道。让一个包含数十亿参数的深层网络在 300 万个高维像素点上反复推演 50 步乃至 100 步去噪,意味着即便是当时最顶级的企业级 GPU,生成一张图也需要数分钟乃至数十分钟。这道昂贵的算力铁幕,将这项革命性技术死死禁锢在极少数富豪研究机构的机房深处。

推倒这道算力铁幕的英雄,是 Robin Rombach、Patrick Esser 与慕尼黑大学研究团队在 2022 年发表的里程碑文献《High-Resolution Image Synthesis with Latent Diffusion Models》(G01)——这正是日后名震全球的开源神器 Stable Diffusion 的底层母体。

Rombach 等人提出了一个至关重要的洞见:在真实世界的图像中,像素与像素之间存在着大量毫无信息增量的感知冗余。 一片蔚蓝的天空或者一堵白墙,消耗了数以万计的高清像素,但其核心的语义信息仅仅是简单的平滑过渡。为什么一定要在如此臃肿昂贵的像素物理空间里做扩散运算呢?

他们巧妙地设计了一套**「感知压缩与语义潜空间分离」**的双层绝妙架构:

[高维物理世界]   真实图像 (3 × 512 × 512 像素,计算沉重)
                    ↓ 经过预训练变分自编码器 (VAE 编码器) 空间下采样压缩 8 倍
[低维语义潜空间] 纯粹潜变量特征图 (4 × 64 × 64 潜空间,体积缩小 64 倍!)
                    ↕ 在这个极度轻量化的空间中从容执行 50 步扩散与去噪 (结合 Cross-Attention)
                    ↓ 去噪完毕的潜变量特征图
[高维物理世界]   经过 VAE 解码器一次性还原,完美重构出 512 × 512 的细腻逼真大图!

这一空间维度的转换,产生了一个震撼的工程奇迹:
通过将扩散去噪的战场转移到缩小了 64 倍的潜空间,计算复杂度呈现出断崖式的下降;原本需要庞大服务器集群才能运转的扩散魔法,被奇迹般地压缩到了普通家庭个人电脑里一张仅仅拥有 8GB 甚至 6GB 显存的游戏显卡上。

更令人惊叹的是,Stable Diffusion 将前述的**交叉注意力机制(Cross-Attention)**深度嵌入到了潜空间 U-Net 的每一个骨骼关节中。通过把人类输入的自然语言提示词(Prompt)经由 OpenAI 的 CLIP 文本编码器转化为特征向量,去噪网络在潜空间每一轮擦除噪声的同时,都能随时向文本向量发起目光投射。

2022 年 8 月,Stable Diffusion 宣布完全开源其代码与全部模型权重。这一举动如同一枚投入死寂池塘的深水炸弹,瞬间引爆了全球计算机艺术、游戏设计、数字内容生产与个人创作者生态的宇宙级狂欢。


5.4 全章结语:从无序走向可知,从模仿走向创生

回顾第 5 章所记录的这场发生在 2020 至 2024 年间的波澜壮阔的技术巨变,我们能够清晰地捕捉到人类驾驭机器智能的思维演进足迹:

  1. 在规模的维度上(§5.1):我们告别了盲目碰运气的炼金术,破译了智能随算力与数据幂律跃迁的物理学密码(Scaling Laws),并在狂飙突进的弯道上,借由 Chinchilla 定律校准了参数与数据的黄金天平;
  2. 在价值的维度上(§5.2):我们勇敢直面了野性基座吞噬全网数据后的混沌与危险,用 RLHF 巧夺天工的人类偏好考官和 DPO 优美纯粹的代数化简,成功为无序狂奔的算法巨兽套上了一副契合文明秩序的理性缰绳;
  3. 在创生的维度上(§5.3):我们跨越了生成对抗博弈(GAN)的脆弱沼泽,在物理学非平衡热力学的逆流中捕获了扩散模型的宁静伟力,并最终在潜空间的精巧折叠中,让原本昂贵的创生特权飞入了千家万户的个人终端。

当规模赋予了机器以浩瀚的博学,对齐赋予了机器以社会的善意,生成赋予了机器以穿透感知的画笔,人工智能终于走出了单调的分类与判断,正式迈入了理解人类意图、与人类协同创生的崭新黎明。

来源:LinuxDo · linux.do