Wan 2.2 详解:阿里巴巴的开源 AI 视频模型
Wan 2.2 是阿里巴巴通义实验室开源的 AI 视频系列,基于 Apache 2.0 协议发布——可免费下载、自行部署、商用无忧。它覆盖文生视频、图生视频,以及一个更轻量的文+图版本,采用混合专家(MoE)设计,把画质推到接近闭源模型的水平。代价和所有开源权重一样:显卡、流程、审美都得你自己扛。下面讲清楚 Wan 2.2 到底给了什么、怎么跑,以及什么时候开源路线比托管平台更划算。
Wan 2.2 是什么?
Wan 2.2 是阿里巴巴开源 Wan 视频系列在 2025 年 7 月的升级版,出自通义实验室。它以可下载权重的形式发布在 Hugging Face 上,采用 Apache 2.0 协议——这意味着你可以本地运行、部署到自己的云上、并用它交付商业作品,而无需按次付费。当问题是「最好的开源 AI 视频模型」而不是「最好的模型(不论开闭源)」时,它就是头号候选。
这次发布有三种形态:14B 的文生视频模型(T2V-A14B)、14B 的图生视频模型(I2V-A14B),以及更小的 5B 文+图生视频模型(TI2V-5B)——后者牺牲一点画质,换取在单张消费级显卡上运行的能力。开源权重的输出上限为 720p、24fps,1080p 在路线图上,也可通过托管端点获得。想看更完整的开源阵营地图,见 2026 年最好的开源 AI 视频模型。
MoE 架构:画质为什么跃升
Wan 2.2 是首个把混合专家(MoE)设计引入去噪流程的开源视频扩散模型。A14B 模型带着两个 14B 专家——磁盘上共 27B 参数——但每一步只激活 14B,因此显存开销接近单专家模型。一个高噪声专家负责早期阶段(布局、构图、运动),随后由一个低噪声专家接手,细化细节、打光、对比度和色调。把任务这样拆开,正是相比 Wan 2.1 那道肉眼可见提升的来源。
| 版本 | 参数 | 任务 | 最低显卡(720p) |
|---|---|---|---|
| T2V-A14B | 27B(激活 14B) | 文生视频 | 约 48GB(A6000)不量化 |
| I2V-A14B | 27B(激活 14B) | 图生视频 | 约 48GB 不量化 |
| TI2V-5B | 5B | 文+图生视频 | 24GB(RTX 4090) |
| A14B + GGUF | 激活 14B | T2V / I2V,量化 | 搭配 offload 12–16GB |
对个人创作者最关键的一条:5B 版本能在 24GB 显卡上跑——一张 RTX 4090 就够。14B 模型在 720p 不量化下想要 48GB 的 A6000,但 GGUF 量化加上文本编码器 offload 能把它压到 12–16GB,代价是损失一些保真度和速度。
Wan 2.2 擅长什么
- 强运动与相机控制。 升级后的动画控制加入了相机轨迹——推拉、变焦、焦点转移——外加主体锁定和背景稳定,让跟拍镜头更稳。
- 中英双语提示与画面内文字。 中英文提示都能用,并且它在画面里渲染可读文字的能力优于大多数开源权重。
- 图生视频有真实保真度。 I2V 模型在动画化一张静态图时能保住它的观感,让「把主视觉变成动镜头」成为真正可用的工具。
- 语音驱动视频(Wan 2.2-S2V)。 一个配套模型能把一张人像照加一段音频,变成会说话、会唱歌的数字人——这是开源权重对托管数字人工具的回应。
- 边际成本为零。 显卡一旦买单,之后每次生成都免费。对高频次的 B-roll 和试错来说,这笔账很难被打败。
Wan 2.2 与同类模型对比
| 模型 | 强项 | 注意点 |
|---|---|---|
| Wan 2.2 | 免费开源、可自部署、商用安全的协议 | 开源权重上限 720p,整套流程得自己跑 |
| Seedance 2.5 | 30 秒长镜头、原生 4K、强参考控制 | 闭源、按积分计费 |
| Veo 3.1 | 原生音频、顶级提示理解 | 价格偏高、闭源 |
| Kling 3 | 性价比、多镜头主体一致性 | 闭源、原生单镜头较短 |
| 海螺 H3 | 原生音频、部分开源、2K | 最长 15 秒、非 4K |
实话实说:Wan 2.2 在分辨率和时长上并不是闭源榜单的头名。Seedance 和 Veo 分辨率更高、时长更长。Wan 2.2 赢的是自由——权重是你的,协议宽松,没有计费表在转。对需要掌控流程、或想用自己的数据做微调的团队来说,这个取舍就是全部意义所在。
「托管逃生舱」
开源权重递给你的是一台引擎加一本说明书。要稳定产出视频,你还得自己搭 ComfyUI 工作流、管理显存和量化、调采样器和调度器,并且把整套观感在每条提示里重新敲一遍——因为模型对你上一帧的成片毫无记忆。这是实打实的工作量,也是为什么大多数团队最终会去够那个托管逃生舱:一个底层跑着开源或闭源引擎、但在上面加了手艺的「被导演化」平台。
在 ReelWand 上,B-Roll 生成器 Agent 内置一套固定的风格 DNA——媒介、打光、调色和一条质量基线——在服务端拼进每一次请求。大脑永远不离开服务器,因此你的招牌观感无法被复制粘贴带走。会话记忆意味着你的下一句提示会在两小时窗口内基于上一帧成片迭代,而不是从零重生成;一份成文的品牌规则手册也会被检索进每一次生成以保持一致。同样的生成能力,却没有那些管线杂活。想看更深的取舍,读 创作者该用 AI Agent 还是裸模型。
在一个「被导演化」的 Agent 里体验开源级别的生成力——自带风格 DNA 与会话记忆。
不用配显卡也能生成 B-roll常见问题
Wan 2.2 免费吗?
免费。Wan 2.2 以 Apache 2.0 协议发布,权重可免费下载、自行部署、商用且无需按次付费。你唯一的成本是运行它的显卡。像 ReelWand 这样的托管平台会在其上加一层积分制,视频计价高于静态图,让试错成本可控。
跑 Wan 2.2 需要什么显卡?
5B 的 TI2V 版本能在 24GB 显卡上跑,比如 RTX 4090。14B 的 A14B 模型在 720p 不量化下大约需要一张 48GB 的 A6000,不过 GGUF 量化加上文本编码器 offload 能把它压到 12–16GB,代价是损失一些保真度和速度。
Wan 2.2 输出什么分辨率和时长?
开源权重生成约 5 秒的片段,分辨率为 480p 或 720p,24fps。1080p 在路线图上、并可通过部分托管端点获得,但不是可下载模型里的默认设置。
Wan 2.2 和 Seedance 2.5 哪个更好?
Seedance 2.5 在原始输出上更强:原生 4K、30 秒单镜头、强参考控制,但它闭源且按积分计费。Wan 2.2 赢在自由:开放的 Apache 2.0 权重,可自部署、可微调。要顶级画质选 Seedance,要掌控力和零边际成本选 Wan。
Wan 2.2 能商用吗?
能。Apache 2.0 协议明确允许商业与研究用途。你可以用 Wan 2.2 交付客户作品、产品和付费内容,无需支付授权费——你要负责的是算力和围绕它的那套流程。
把它变成作品
62 个专精视觉 Agent,每一个都内置了本文所讲的手艺。挑一个,开始创作。