
WAN 是阿里巴巴通义实验室(通义万相团队)的开放权重视频生成模型家族,覆盖文生视频、图生视频、语音生视频、角色动画等全任务谱系。当前可自托管的最新开放权重主线 Wan2.2 于 2025 年 7 月发布,Apache-2.0 许可,采用视频扩散模型首个 MoE 架构,含 T2V-A14B、I2V-A14B、TI2V-5B 三款 checkpoint,支持 720P@24fps 视频生成,其中 5B 版本可在单张 RTX 4090 消费级显卡运行,是开放权重视频生成的事实标准。
产品概述
WAN 由阿里巴巴通义实验室(通义万相团队)开发,自 2025 年 2 月 Wan2.1 首次开源以来,已成为开放权重视频生成领域任务谱系最完整、生态最活跃的模型家族 。WAN 的定位是”开放且先进的大规模视频生成模型”——不仅开放权重,更通过 Apache-2.0 许可允许商用、微调、自托管,是少数能与闭源 Sora、Veo 在画质上竞争且完全开放的视频模型 。
版本演进与开放状态(具体以 Hugging Face Wan-AI 官方仓库实时信息为准):
| 版本 | 发布时间 | 开放权重 | 许可 | 关键能力 |
|---|---|---|---|---|
| Wan2.1 | 2025 年 2 月 | ✅ | Apache-2.0 | 首个开放权重主线,14B/1.3B 双尺寸,T2V/I2V |
| Wan2.2 | 2025 年 7 月 | ✅ | Apache-2.0 | 当前可自托管的最新开放权重主线。首个 MoE 视频扩散架构,电影美学控制,TI2V-5B 消费级可跑 |
| Wan2.2-S2V | 2025 年 8 月 | ✅ | Apache-2.0 | 语音生视频 |
| Wan2.2-Animate | 2025 年 9 月 | ✅ | Apache-2.0 | 角色动画 |
| Wan2.5 | 2025 年 9 月(预览) | ❌ | 仅商业 API | 原生音视频同步、1080P |
| Wan2.6 | 2025 年 12 月 | ❌ | 仅商业 API | 叙事功能、角色一致性、原生音频、多镜头 |
| Wan2.7 | 2026 年 3 月 | ✅(部分模型) | Apache-2.0 | 首帧/尾帧条件控制、”思考模式” |
| Wan3.0 | 2026 年(预期) | 🔮 计划 Apache-2.0 | 计划中 | 60B MoE(14B 激活),参考生视频、语音克隆、指令编辑 |
⚠️ 重要澄清:WAN 的”最新版本”与”最新开放权重版本”不是同一个概念。Wan2.5、Wan2.6 引入了音视频同步、1080P 等昂贵能力,阿里巴巴选择通过商业 API 变现而非开放权重 ;Wan2.7 仅开源了部分模型;第三方资料提及 Wan3.0 开放权重 ,但以 Hugging Face Wan-AI 官方组织实时发布的 checkpoint 为准,当前可稳定自托管的最新开放权重主线是 Wan2.2。后续版本若开放权重,收录时以官方仓库为准。
当前开放权重主线 Wan2.2 核心参数 :
| Checkpoint | 任务 | 参数 | 分辨率 | 硬件需求 |
|---|---|---|---|---|
| T2V-A14B | 文生视频 | 14B(MoE,约 27B 总参) | 480P & 720P | ~24GB VRAM(FP16) |
| I2V-A14B | 图生视频 | 14B(MoE,约 27B 总参) | 480P & 720P | ~24GB VRAM(FP16) |
| TI2V-5B | 文本+图像生视频 | 5B(稠密) | 720P@24fps | 单张 RTX 4090 24GB |
架构创新 :
- 视频扩散模型首个 MoE 架构:将去噪过程跨时间步分离为专门的专家模型——高噪声专家处理早期扩散阶段(整体布局与构图),低噪声专家精炼后期细节,总参数约 27B 但每步仅激活 14B
- 电影级美学控制:训练数据携带光影、构图、对比度、色调的精细标签,可从 prompt 直接控制电影美学风格,60+ 直观参数
- 高压缩 VAE:Wan2.2-VAE 实现 16×16×4 压缩比,让 5B 模型在消费级显卡上实现 720P@24fps 生成
- 训练数据大幅扩展:相比 Wan2.1,图像数据 +65.6%、视频数据 +83.2%,显著提升运动保真度与提示词遵循
许可策略(关键):
WAN 开放权重线全系 Apache-2.0 :
- 允许商用、修改、再分发、微调,无营收门槛、无月活限制、无署名义务
- 与 FLUX.2 [schnell](Apache-2.0)、Qwen-Image(Apache-2.0)、Mochi(Apache-2.0)、Open-Sora(Apache-2.0)并列”最干净许可”阵营
- Wan2.5/Wan2.6 虽未开放权重,但其 API 服务条款独立,不影响 Wan2.2 及之前版本的 Apache-2.0 许可效力
💡 与 FLUX(dev 分支非商用)形成最本质差异:WAN 的 Apache-2.0 是无条件开放——商用、修改、再分发均无门槛。这是 WAN 在视频生成领域最核心的差异化优势,也是其与 Sora、Veo 等闭源视频模型竞争时”开放性”杀器的来源。
核心能力
- 文生视频(T2V):T2V-A14B 支持 480P 与 720P 视频生成,中英文双语 prompt 原生支持
- 图生视频(I2V):I2V-A14B 基于输入图像生成动态视频,支持 480P 与 720P
- 统一文本+图像生视频(TI2V):TI2V-5B 同时接受文本与图像条件,可同时指定视觉风格(通过图像)与运动(通过文本)
- 语音生视频(S2V):Wan2.2-S2V 从音频/语音轨道驱动视频生成
- 角色动画(Animate):Wan2.2-Animate 14B 支持单张图像动画化或角色替换
- 电影美学控制:从 prompt 直接控制光影、构图、对比度、色调,60+ 直观电影参数
- 720P@24fps 消费级生成:TI2V-5B 通过 16×16×4 高压缩 VAE,在单张 RTX 4090 上实现 720P@24fps 视频生成
- LoRA 微调:支持低秩适配训练专属风格、角色一致性
- VBench SOTA:WAN 在 VBench 评测中得分 86.22%,超越 Sora 的 84.28%,是开放权重视频生成画质标杆
- 主流框架支持:Diffusers、ComfyUI 原生支持,Hugging Face Hub 一键加载
优势亮点
- Apache-2.0 无条件开放:商用、修改、再分发、微调均无门槛——与 FLUX.2 [schnell]、Mochi、Open-Sora 并列”最干净许可”阵营,是视频生成领域可商用的少数选择之一
- 任务谱系最完整:T2V、I2V、TI2V、S2V、Animate 五大任务全覆盖,是开放权重视频模型中任务最丰富的家族
- MoE 架构效率突破:首个将 MoE 引入视频扩散的模型,27B 总参仅激活 14B,推理成本接近 14B 稠密模型
- 消费级硬件可运行:TI2V-5B 在单张 RTX 4090(24GB)即可运行 720P@24fps 视频生成,是开放权重中消费级最友好的视频模型
- VBench 超越 Sora:86.22% vs Sora 84.28%,画质与闭源前沿竞争
- 电影美学可控:从 prompt 直接控制光影、构图、色调,60+ 电影参数,是开放权重中电影级控制的代表
- 中英文双语原生:中英文 prompt 均原生支持,中文文字生成视频能力突出(Wan2.1 起的首创能力延续)
- ComfyUI 生态成熟:WAN 是 ComfyUI 视频工作流最常用的基础模型,社区 LoRA、工作流、教程最丰富
- 与 Sora/Veo 的开放性对比:Sora、Veo 是闭源订阅制;WAN 是开放权重、可自托管、可微调、可免费商用——这是开发者构建视频管线的首选
局限
- 最新版本未开放权重:Wan2.5(原生音视频同步、1080P)、Wan2.6(叙事、角色一致性、多镜头)仅通过商业 API 提供 ,自托管用户无法使用这些最新能力
- 720P 分辨率上限:当前开放权重 Wan2.2 最大支持 720P;1080P 需使用 Wan2.5 API
- 5 秒时长上限:单次生成视频长度为 5 秒;更长视频需拼接多段或外推
- 无原生音频:Wan2.2 开放权重版本不支持音频生成,音视频同步需 Wan2.5 API
- A14B 自托管门槛较高:T2V-A14B/I2V-A14B 需 ~24GB VRAM(FP16),消费级显卡仅能运行量化版或 5B 版本
- 与顶级闭源仍有差距:虽然 VBench 超越 Sora,但在运动连贯性、长时序一致性、复杂提示词遵循上,Wan2.2 与最新闭源视频模型(Veo 3、Sora 2)仍有差距
- 版本演进不均匀:Wan2.5/Wan2.6 未开放权重,Wan2.7 仅开源部分模型,第三方资料提及 Wan3.0 计划开放权重 ——”最新版本”与”最新可自托管开放权重”之间存在时间差,收录时以 Hugging Face Wan-AI 官方仓库实时状态为准
适用人群
- 需 Apache-2.0 合规的商用视频生成:与 FLUX.2 [schnell]、Mochi、Open-Sora 并列”最干净许可”阵营,可商用、可修改、可再分发
- 消费级硬件视频生成:TI2V-5B 在单张 RTX 4090 即可运行 720P@24fps,是个人创作者、独立开发者的福音
- 视频生成管线开发者:T2V/I2V/TI2V/S2V/Animate 五任务全覆盖,是构建完整视频管线的开放权重首选
- 电影美学可控内容创作:从 prompt 直接控制光影、构图、色调,60+ 电影参数,适合短片、广告、MV 创作
- LoRA 微调与风格定制:支持 LoRA 训练专属风格、角色一致性,是品牌定制视频的最佳开放权重基础
- 数据主权敏感的企业:完全本地部署,数据不出本机,适合影视制作、广告、电商的合规视频生成
- 中英文视频生成:中英文 prompt 原生支持,中文文字生成视频能力突出,适合国内短视频、广告、影视行业
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| TI2V-5B(720P@24fps) | 单卡 RTX 4090 24GB 或 A100 80GB |
| TI2V-5B(FP8 量化) | 单卡 RTX 4070 12GB 或 RTX 4080 16GB |
| T2V-A14B / I2V-A14B(480P) | 单卡 A100 80GB 或 2×RTX 4090 24GB |
| T2V-A14B / I2V-A14B(720P) | 单卡 A100 80GB(FP16)或多卡 H100 |
| S2V-14B / Animate-14B | 单卡 A100 80GB 或多卡消费级 GPU |
2. 获取模型权重
# 安装 huggingface_hub pip install "huggingface_hub[cli]" # 下载 T2V-A14B huggingface-cli download Wan-AI/Wan2.2-T2V-A14B --local-dir ./Wan2.2-T2V-A14B # 下载 I2V-A14B huggingface-cli download Wan-AI/Wan2.2-I2V-A14B --local-dir ./Wan2.2-I2V-A14B # 下载 TI2V-5B(消费级硬件推荐) huggingface-cli download Wan-AI/Wan2.2-TI2V-5B --local-dir ./Wan2.2-TI2V-5B # 下载 S2V-14B(语音生视频) huggingface-cli download Wan-AI/Wan2.2-S2V-14B --local-dir ./Wan2.2-S2V-14B
3. 通过官方 GitHub 仓库部署
# 克隆官方仓库 git clone https://github.com/Wan-Video/Wan2.2.git cd Wan2.2 pip install -r requirements.txt # 文生视频(T2V-A14B,480P) python generate.py --task t2v-14B --size 1280x720 \ --ckpt_dir ./Wan2.2-T2V-A14B \ --prompt "A paper boat drifting down a rain-slicked gutter at dusk, shallow depth of field, warm street lights" # 图生视频(I2V-A14B) python generate.py --task i2v-14B --size 1280x720 \ --ckpt_dir ./Wan2.2-I2V-A14B \ --image example.png \ --prompt "The woman begins to dance gracefully, her movements fluid and expressive" # 统一文本+图像生视频(TI2V-5B,消费级硬件) python generate.py --task ti2v-5B --size 1280x704 \ --ckpt_dir ./Wan2.2-TI2V-5B \ --prompt "a paper boat sailing down a rain-filled gutter, cinematic"
4. 通过 Diffusers 推理
import torch
from diffusers import WanPipeline, WanTransformer3DModel
from diffusers.utils import export_to_video
# 加载 T2V-A14B
transformer = WanTransformer3DModel.from_pretrained(
"Wan-AI/Wan2.2-T2V-A14B",
torch_dtype=torch.bfloat16
)
pipe = WanPipeline.from_pretrained(
"Wan-AI/Wan2.2-T2V-A14B",
transformer=transformer,
torch_dtype=torch.bfloat16
).to("cuda")
# 生成视频
prompt = "A paper boat drifting down a rain-slicked gutter at dusk, shallow depth of field, warm street lights"
output = pipe(prompt=prompt, num_frames=81, height=720, width=1280)
frames = output.frames[0]
export_to_video(frames, "wan2.2_output.mp4", fps=24)
5. 通过 ComfyUI 部署(推荐可视化工作流)
# ComfyUI 原生支持 WAN 模型 # 下载 GGUF 量化版本到 ComfyUI/models/ # 加载 WAN 工作流 JSON,选择 T2V-A14B / I2V-A14B / TI2V-5B
6. 通过 ModelScope 下载(国内镜像)
pip install modelscope modelscope download Wan-AI/Wan2.2-T2V-A14B --local_dir ./Wan2.2-T2V-A14B
7. LoRA 微调
# 使用官方 finetune 脚本 bash finetune/finetune_wan_t2v_14B.sh \ --data_path your_dataset \ --ckpt_dir ./Wan2.2-T2V-A14B \ --lora_rank 64
8. 云端 API 调用(不想自托管)
通过 Wavespeed AI 等托管平台:
import requests
response = requests.post(
"https://api.wavespeed.ai/api/v3/wavespeed-ai/wan-2.2/t2v-480p",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"prompt": "A paper boat drifting down a rain-slicked gutter at dusk",
"duration": 5,
"enable_sync_mode": False
}
)
或通过阿里巴巴灵积/Model Studio API:
from openai import OpenAI
client = OpenAI(
api_key="your-dashscope-api-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
# 注意:DashScope 上提供的是 Wan 的 API 服务版本
9. 部署前必检清单
- 确认仓库位于
huggingface.co/Wan-AI(官方组织) - 商用部署审阅 Apache-2.0 许可(无附加限制)
- 消费级硬件推荐 TI2V-5B;A14B 版本需 24GB+ 显存
- 如需 1080P、音视频同步、长视频等最新能力,Wan2.2 开放权重不支持,需使用 Wan2.5/Wan2.6 商业 API
- 中英文 prompt 均原生支持
- ComfyUI 是 WAN 最流行的可视化工作流界面
- 收录时以 Hugging Face Wan-AI 最新发布的 checkpoint 为准——Wan2.7/Wan3.0 若开放权重,应及时更新
相关导航


SEA-LION

Llama

Apertus
Open-Sora

DeepSeek

MiniMax

