什么是扩散模型?AI 绘画和视频是怎么"画"出来的

Midjourney、Sora 这些 AI 是怎么凭一句话生成图片和视频的?扩散模型的"加噪—去噪"原理、为什么它和大模型不一样、一文用大白话讲清。

什么是扩散模型?AI 绘画和视频是怎么"画"出来的
编辑部 ·

Midjourney 画图、Sora 和 Runway 生成视频,背后大多是同一类技术:扩散模型(Diffusion Model)。它和聊天用的大语言模型是完全不同的思路。这篇用大白话讲清:AI 到底是怎么凭一句话「画」出一张从没存在过的图的。

一个反直觉的核心思路:从噪声里”雕”出图

你可能以为 AI 画图是像人一样「一笔一笔画」。其实不是。扩散模型的思路反过来——先给一张清晰图片不断加噪声,直到变成一片雪花点;再训练 AI 学会把这个过程倒过来。

分两步理解:

  • 加噪(训练时做):拿海量真实图片,一步步撒上随机噪声,最后变成纯粹的「雪花屏」。这一步是为了制造「问题和答案」的配对。
  • 去噪(生成时做):AI 学到的本事是——给它一张带噪声的图,它能预测「去掉一点噪声后该长什么样」。

生成一张新图时,AI 从一张纯随机噪声出发,一步步去噪,几十步之后,一张清晰的、原本不存在的图就「显影」出来了。就像米开朗基罗那句话:雕像本就在石头里,我只是把多余的部分去掉——扩散模型做的,就是从噪声里「去掉多余的部分」。

文字是怎么控制画面的

光会去噪只能生成随机的图,怎么让它「画一只戴帽子的柴犬」?

关键在于去噪的每一步都会参考你的文字提示。文字先被转成一串向量(模型能理解的数字),在每一步去噪时充当「导航」,把画面往「柴犬 + 帽子」的方向推。于是最终显影出来的,就是符合你描述的图。

这也解释了为什么提示词写得越具体,出图越准——你给的导航信息越多,去噪的方向就越明确。

为什么它和 ChatGPT 不一样

这是最容易混淆的点。两者是两套完全不同的机制:

大语言模型(如 ChatGPT)扩散模型(如 Midjourney)
干什么生成文字生成图像 / 视频
怎么生成一个词一个词往下接龙从噪声整体一步步去噪
生成顺序从左到右,先后有序全图同时逐步清晰

一句话:语言模型是「顺着写」,扩散模型是「整体显影」。很多产品把两者组合起来——你用文字对话,它调扩散模型出图,但内核是两回事。

视频只是”会动的图”吗

基本可以这么理解,但更难。视频不仅每一帧要清晰,帧与帧之间还得连贯——柴犬不能上一帧朝左、下一帧突然朝右。所以视频扩散模型要额外处理「时间一致性」,这也是为什么 AI 视频比 AI 图片起步晚、算力贵得多、时长还受限。

为什么早期 AI 画手总画错

扩散模型是「统计意义上」学会了图像长什么样,它并不真正「理解」解剖结构。所以早期常见翻车:手指画成六根、文字变成鬼画符。原因是——手和文字的局部结构极其严格,差一点就明显错,而模型只是在模仿见过的像素分布,不是在数手指。这两年靠更大的模型和更好的训练已经改善很多,但本质上它仍是「画得像」,不是「画得懂」。

小结

扩散模型的核心,是一个反直觉的把戏:学会「去噪」,再从纯噪声里一步步显影出图像,而你的文字提示在每一步充当导航。它和聊天用的语言模型是两套机制——一个顺着写字,一个整体显影。理解了这一点,你就明白了为什么提示词要具体、为什么 AI 视频这么贵、为什么它偶尔还会画错手。想动手试试,可从 MidjourneyRunway 开始;想了解能同时看图看文的 AI,见什么是多模态大模型