什么是扩散模型?AI 绘画和视频是怎么"画"出来的
Midjourney、Sora 这些 AI 是怎么凭一句话生成图片和视频的?扩散模型的"加噪—去噪"原理、为什么它和大模型不一样、一文用大白话讲清。
Midjourney 画图、Sora 和 Runway 生成视频,背后大多是同一类技术:扩散模型(Diffusion Model)。它和聊天用的大语言模型是完全不同的思路。这篇用大白话讲清:AI 到底是怎么凭一句话「画」出一张从没存在过的图的。
一个反直觉的核心思路:从噪声里”雕”出图
你可能以为 AI 画图是像人一样「一笔一笔画」。其实不是。扩散模型的思路反过来——先给一张清晰图片不断加噪声,直到变成一片雪花点;再训练 AI 学会把这个过程倒过来。
分两步理解:
- 加噪(训练时做):拿海量真实图片,一步步撒上随机噪声,最后变成纯粹的「雪花屏」。这一步是为了制造「问题和答案」的配对。
- 去噪(生成时做):AI 学到的本事是——给它一张带噪声的图,它能预测「去掉一点噪声后该长什么样」。
生成一张新图时,AI 从一张纯随机噪声出发,一步步去噪,几十步之后,一张清晰的、原本不存在的图就「显影」出来了。就像米开朗基罗那句话:雕像本就在石头里,我只是把多余的部分去掉——扩散模型做的,就是从噪声里「去掉多余的部分」。
文字是怎么控制画面的
光会去噪只能生成随机的图,怎么让它「画一只戴帽子的柴犬」?
关键在于去噪的每一步都会参考你的文字提示。文字先被转成一串向量(模型能理解的数字),在每一步去噪时充当「导航」,把画面往「柴犬 + 帽子」的方向推。于是最终显影出来的,就是符合你描述的图。
这也解释了为什么提示词写得越具体,出图越准——你给的导航信息越多,去噪的方向就越明确。
为什么它和 ChatGPT 不一样
这是最容易混淆的点。两者是两套完全不同的机制:
| 大语言模型(如 ChatGPT) | 扩散模型(如 Midjourney) | |
|---|---|---|
| 干什么 | 生成文字 | 生成图像 / 视频 |
| 怎么生成 | 一个词一个词往下接龙 | 从噪声整体一步步去噪 |
| 生成顺序 | 从左到右,先后有序 | 全图同时逐步清晰 |
一句话:语言模型是「顺着写」,扩散模型是「整体显影」。很多产品把两者组合起来——你用文字对话,它调扩散模型出图,但内核是两回事。
视频只是”会动的图”吗
基本可以这么理解,但更难。视频不仅每一帧要清晰,帧与帧之间还得连贯——柴犬不能上一帧朝左、下一帧突然朝右。所以视频扩散模型要额外处理「时间一致性」,这也是为什么 AI 视频比 AI 图片起步晚、算力贵得多、时长还受限。
为什么早期 AI 画手总画错
扩散模型是「统计意义上」学会了图像长什么样,它并不真正「理解」解剖结构。所以早期常见翻车:手指画成六根、文字变成鬼画符。原因是——手和文字的局部结构极其严格,差一点就明显错,而模型只是在模仿见过的像素分布,不是在数手指。这两年靠更大的模型和更好的训练已经改善很多,但本质上它仍是「画得像」,不是「画得懂」。
小结
扩散模型的核心,是一个反直觉的把戏:学会「去噪」,再从纯噪声里一步步显影出图像,而你的文字提示在每一步充当导航。它和聊天用的语言模型是两套机制——一个顺着写字,一个整体显影。理解了这一点,你就明白了为什么提示词要具体、为什么 AI 视频这么贵、为什么它偶尔还会画错手。想动手试试,可从 Midjourney 或 Runway 开始;想了解能同时看图看文的 AI,见什么是多模态大模型。