WAN翻译站点

3周前更新 17 0 0

阿里巴巴通义万相开放权重视频生成家族,Apache-2.0 可商用。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

WAN 是阿里巴巴通义实验室(通义万相团队)的开放权重视频生成模型家族,覆盖文生视频、图生视频、语音生视频、角色动画等全任务谱系。当前可自托管的最新开放权重主线 Wan2.2 于 2025 年 7 月发布,Apache-2.0 许可,采用视频扩散模型首个 MoE 架构,含 T2V-A14B、I2V-A14B、TI2V-5B 三款 checkpoint,支持 720P@24fps 视频生成,其中 5B 版本可在单张 RTX 4090 消费级显卡运行,是开放权重视频生成的事实标准。

 

产品概述

WAN 由阿里巴巴通义实验室(通义万相团队)开发,自 2025 年 2 月 Wan2.1 首次开源以来,已成为开放权重视频生成领域任务谱系最完整、生态最活跃的模型家族 。WAN 的定位是”开放且先进的大规模视频生成模型”——不仅开放权重,更通过 Apache-2.0 许可允许商用、微调、自托管,是少数能与闭源 Sora、Veo 在画质上竞争且完全开放的视频模型 。

 

版本演进与开放状态(具体以 Hugging Face Wan-AI 官方仓库实时信息为准):

版本 发布时间 开放权重 许可 关键能力
Wan2.1 2025 年 2 月 Apache-2.0 首个开放权重主线,14B/1.3B 双尺寸,T2V/I2V
Wan2.2 2025 年 7 月 Apache-2.0 当前可自托管的最新开放权重主线。首个 MoE 视频扩散架构,电影美学控制,TI2V-5B 消费级可跑
Wan2.2-S2V 2025 年 8 月 Apache-2.0 语音生视频
Wan2.2-Animate 2025 年 9 月 Apache-2.0 角色动画
Wan2.5 2025 年 9 月(预览) 仅商业 API 原生音视频同步、1080P
Wan2.6 2025 年 12 月 仅商业 API 叙事功能、角色一致性、原生音频、多镜头
Wan2.7 2026 年 3 月 ✅(部分模型) Apache-2.0 首帧/尾帧条件控制、”思考模式”
Wan3.0 2026 年(预期) 🔮 计划 Apache-2.0 计划中 60B MoE(14B 激活),参考生视频、语音克隆、指令编辑

⚠️ 重要澄清:WAN 的”最新版本”与”最新开放权重版本”不是同一个概念。Wan2.5、Wan2.6 引入了音视频同步、1080P 等昂贵能力,阿里巴巴选择通过商业 API 变现而非开放权重 ;Wan2.7 仅开源了部分模型;第三方资料提及 Wan3.0 开放权重 ,但以 Hugging Face Wan-AI 官方组织实时发布的 checkpoint 为准,当前可稳定自托管的最新开放权重主线是 Wan2.2。后续版本若开放权重,收录时以官方仓库为准。

 

当前开放权重主线 Wan2.2 核心参数​ :

Checkpoint 任务 参数 分辨率 硬件需求
T2V-A14B 文生视频 14B(MoE,约 27B 总参) 480P & 720P ~24GB VRAM(FP16)
I2V-A14B 图生视频 14B(MoE,约 27B 总参) 480P & 720P ~24GB VRAM(FP16)
TI2V-5B 文本+图像生视频 5B(稠密) 720P@24fps 单张 RTX 4090 24GB

 

架构创新​ :

  • 视频扩散模型首个 MoE 架构:将去噪过程跨时间步分离为专门的专家模型——高噪声专家处理早期扩散阶段(整体布局与构图),低噪声专家精炼后期细节,总参数约 27B 但每步仅激活 14B
  • 电影级美学控制:训练数据携带光影、构图、对比度、色调的精细标签,可从 prompt 直接控制电影美学风格,60+ 直观参数
  • 高压缩 VAE:Wan2.2-VAE 实现 16×16×4 压缩比,让 5B 模型在消费级显卡上实现 720P@24fps 生成
  • 训练数据大幅扩展:相比 Wan2.1,图像数据 +65.6%、视频数据 +83.2%,显著提升运动保真度与提示词遵循

 

许可策略(关键):

WAN 开放权重线全系 Apache-2.0​ :

  • 允许商用、修改、再分发、微调,无营收门槛、无月活限制、无署名义务
  • 与 FLUX.2 [schnell](Apache-2.0)、Qwen-Image(Apache-2.0)、Mochi(Apache-2.0)、Open-Sora(Apache-2.0)并列”最干净许可”阵营
  • Wan2.5/Wan2.6 虽未开放权重,但其 API 服务条款独立,不影响 Wan2.2 及之前版本的 Apache-2.0 许可效力

💡 与 FLUX(dev 分支非商用)形成最本质差异:WAN 的 Apache-2.0 是无条件开放——商用、修改、再分发均无门槛。这是 WAN 在视频生成领域最核心的差异化优势,也是其与 Sora、Veo 等闭源视频模型竞争时”开放性”杀器的来源。

 

核心能力

  • 文生视频(T2V):T2V-A14B 支持 480P 与 720P 视频生成,中英文双语 prompt 原生支持
  • 图生视频(I2V):I2V-A14B 基于输入图像生成动态视频,支持 480P 与 720P
  • 统一文本+图像生视频(TI2V):TI2V-5B 同时接受文本与图像条件,可同时指定视觉风格(通过图像)与运动(通过文本)
  • 语音生视频(S2V):Wan2.2-S2V 从音频/语音轨道驱动视频生成
  • 角色动画(Animate):Wan2.2-Animate 14B 支持单张图像动画化或角色替换
  • 电影美学控制:从 prompt 直接控制光影、构图、对比度、色调,60+ 直观电影参数
  • 720P@24fps 消费级生成:TI2V-5B 通过 16×16×4 高压缩 VAE,在单张 RTX 4090 上实现 720P@24fps 视频生成
  • LoRA 微调:支持低秩适配训练专属风格、角色一致性
  • VBench SOTA:WAN 在 VBench 评测中得分 86.22%,超越 Sora 的 84.28%,是开放权重视频生成画质标杆
  • 主流框架支持:Diffusers、ComfyUI 原生支持,Hugging Face Hub 一键加载

 

优势亮点

  • Apache-2.0 无条件开放:商用、修改、再分发、微调均无门槛——与 FLUX.2 [schnell]、Mochi、Open-Sora 并列”最干净许可”阵营,是视频生成领域可商用的少数选择之一
  • 任务谱系最完整:T2V、I2V、TI2V、S2V、Animate 五大任务全覆盖,是开放权重视频模型中任务最丰富的家族
  • MoE 架构效率突破:首个将 MoE 引入视频扩散的模型,27B 总参仅激活 14B,推理成本接近 14B 稠密模型
  • 消费级硬件可运行:TI2V-5B 在单张 RTX 4090(24GB)即可运行 720P@24fps 视频生成,是开放权重中消费级最友好的视频模型
  • VBench 超越 Sora:86.22% vs Sora 84.28%,画质与闭源前沿竞争
  • 电影美学可控:从 prompt 直接控制光影、构图、色调,60+ 电影参数,是开放权重中电影级控制的代表
  • 中英文双语原生:中英文 prompt 均原生支持,中文文字生成视频能力突出(Wan2.1 起的首创能力延续)
  • ComfyUI 生态成熟:WAN 是 ComfyUI 视频工作流最常用的基础模型,社区 LoRA、工作流、教程最丰富
  • 与 Sora/Veo 的开放性对比:Sora、Veo 是闭源订阅制;WAN 是开放权重、可自托管、可微调、可免费商用——这是开发者构建视频管线的首选

 

局限

  • 最新版本未开放权重:Wan2.5(原生音视频同步、1080P)、Wan2.6(叙事、角色一致性、多镜头)仅通过商业 API 提供 ,自托管用户无法使用这些最新能力
  • 720P 分辨率上限:当前开放权重 Wan2.2 最大支持 720P;1080P 需使用 Wan2.5 API
  • 5 秒时长上限:单次生成视频长度为 5 秒;更长视频需拼接多段或外推
  • 无原生音频:Wan2.2 开放权重版本不支持音频生成,音视频同步需 Wan2.5 API
  • A14B 自托管门槛较高:T2V-A14B/I2V-A14B 需 ~24GB VRAM(FP16),消费级显卡仅能运行量化版或 5B 版本
  • 与顶级闭源仍有差距:虽然 VBench 超越 Sora,但在运动连贯性、长时序一致性、复杂提示词遵循上,Wan2.2 与最新闭源视频模型(Veo 3、Sora 2)仍有差距
  • 版本演进不均匀:Wan2.5/Wan2.6 未开放权重,Wan2.7 仅开源部分模型,第三方资料提及 Wan3.0 计划开放权重 ——”最新版本”与”最新可自托管开放权重”之间存在时间差,收录时以 Hugging Face Wan-AI 官方仓库实时状态为准

 

适用人群

  • 需 Apache-2.0 合规的商用视频生成:与 FLUX.2 [schnell]、Mochi、Open-Sora 并列”最干净许可”阵营,可商用、可修改、可再分发
  • 消费级硬件视频生成:TI2V-5B 在单张 RTX 4090 即可运行 720P@24fps,是个人创作者、独立开发者的福音
  • 视频生成管线开发者:T2V/I2V/TI2V/S2V/Animate 五任务全覆盖,是构建完整视频管线的开放权重首选
  • 电影美学可控内容创作:从 prompt 直接控制光影、构图、色调,60+ 电影参数,适合短片、广告、MV 创作
  • LoRA 微调与风格定制:支持 LoRA 训练专属风格、角色一致性,是品牌定制视频的最佳开放权重基础
  • 数据主权敏感的企业:完全本地部署,数据不出本机,适合影视制作、广告、电商的合规视频生成
  • 中英文视频生成:中英文 prompt 原生支持,中文文字生成视频能力突出,适合国内短视频、广告、影视行业

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
TI2V-5B(720P@24fps) 单卡 RTX 4090 24GB 或 A100 80GB
TI2V-5B(FP8 量化) 单卡 RTX 4070 12GB 或 RTX 4080 16GB
T2V-A14B / I2V-A14B(480P) 单卡 A100 80GB 或 2×RTX 4090 24GB
T2V-A14B / I2V-A14B(720P) 单卡 A100 80GB(FP16)或多卡 H100
S2V-14B / Animate-14B 单卡 A100 80GB 或多卡消费级 GPU

 

2. 获取模型权重

# 安装 huggingface_hub
pip install "huggingface_hub[cli]"

# 下载 T2V-A14B
huggingface-cli download Wan-AI/Wan2.2-T2V-A14B --local-dir ./Wan2.2-T2V-A14B

# 下载 I2V-A14B
huggingface-cli download Wan-AI/Wan2.2-I2V-A14B --local-dir ./Wan2.2-I2V-A14B

# 下载 TI2V-5B(消费级硬件推荐)
huggingface-cli download Wan-AI/Wan2.2-TI2V-5B --local-dir ./Wan2.2-TI2V-5B

# 下载 S2V-14B(语音生视频)
huggingface-cli download Wan-AI/Wan2.2-S2V-14B --local-dir ./Wan2.2-S2V-14B

 

3. 通过官方 GitHub 仓库部署

# 克隆官方仓库
git clone https://github.com/Wan-Video/Wan2.2.git
cd Wan2.2
pip install -r requirements.txt

# 文生视频(T2V-A14B,480P)
python generate.py --task t2v-14B --size 1280x720 \
  --ckpt_dir ./Wan2.2-T2V-A14B \
  --prompt "A paper boat drifting down a rain-slicked gutter at dusk, shallow depth of field, warm street lights"

# 图生视频(I2V-A14B)
python generate.py --task i2v-14B --size 1280x720 \
  --ckpt_dir ./Wan2.2-I2V-A14B \
  --image example.png \
  --prompt "The woman begins to dance gracefully, her movements fluid and expressive"

# 统一文本+图像生视频(TI2V-5B,消费级硬件)
python generate.py --task ti2v-5B --size 1280x704 \
  --ckpt_dir ./Wan2.2-TI2V-5B \
  --prompt "a paper boat sailing down a rain-filled gutter, cinematic"

 

4. 通过 Diffusers 推理

import torch
from diffusers import WanPipeline, WanTransformer3DModel
from diffusers.utils import export_to_video

# 加载 T2V-A14B
transformer = WanTransformer3DModel.from_pretrained(
    "Wan-AI/Wan2.2-T2V-A14B",
    torch_dtype=torch.bfloat16
)
pipe = WanPipeline.from_pretrained(
    "Wan-AI/Wan2.2-T2V-A14B",
    transformer=transformer,
    torch_dtype=torch.bfloat16
).to("cuda")

# 生成视频
prompt = "A paper boat drifting down a rain-slicked gutter at dusk, shallow depth of field, warm street lights"
output = pipe(prompt=prompt, num_frames=81, height=720, width=1280)
frames = output.frames[0]
export_to_video(frames, "wan2.2_output.mp4", fps=24)

 

5. 通过 ComfyUI 部署(推荐可视化工作流)

# ComfyUI 原生支持 WAN 模型
# 下载 GGUF 量化版本到 ComfyUI/models/
# 加载 WAN 工作流 JSON,选择 T2V-A14B / I2V-A14B / TI2V-5B

 

6. 通过 ModelScope 下载(国内镜像)

pip install modelscope
modelscope download Wan-AI/Wan2.2-T2V-A14B --local_dir ./Wan2.2-T2V-A14B

 

7. LoRA 微调

# 使用官方 finetune 脚本
bash finetune/finetune_wan_t2v_14B.sh \
  --data_path your_dataset \
  --ckpt_dir ./Wan2.2-T2V-A14B \
  --lora_rank 64

 

8. 云端 API 调用(不想自托管)

通过 Wavespeed AI 等托管平台:

import requests

response = requests.post(
    "https://api.wavespeed.ai/api/v3/wavespeed-ai/wan-2.2/t2v-480p",
    headers={"Authorization": f"Bearer {API_KEY}"},
    json={
        "prompt": "A paper boat drifting down a rain-slicked gutter at dusk",
        "duration": 5,
        "enable_sync_mode": False
    }
)

或通过阿里巴巴灵积/Model Studio API:

from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
# 注意:DashScope 上提供的是 Wan 的 API 服务版本

 

9. 部署前必检清单

  • 确认仓库位于 huggingface.co/Wan-AI(官方组织)
  • 商用部署审阅 Apache-2.0 许可(无附加限制)
  • 消费级硬件推荐 TI2V-5B;A14B 版本需 24GB+ 显存
  • 如需 1080P、音视频同步、长视频等最新能力,Wan2.2 开放权重不支持,需使用 Wan2.5/Wan2.6 商业 API
  • 中英文 prompt 均原生支持
  • ComfyUI 是 WAN 最流行的可视化工作流界面
  • 收录时以 Hugging Face Wan-AI 最新发布的 checkpoint 为准——Wan2.7/Wan3.0 若开放权重,应及时更新

 

相关导航