
Open-Sora 是 HPC-AI Tech(潞晨科技)开发的开放权重视频生成模型家族,旨在”让所有人都能高效生产视频”。家族采用 Apache-2.0 许可,开放模型权重、训练代码与评估协议,是开放权重视频生成领域中”完全可复现”的代表。当前公开主线 Open-Sora 2.0 为 11B 参数视频扩散模型,支持文生视频(T2V)与图生视频(I2V),256px 至 768px 多分辨率,VBench 评分 81.8%,与 Sora 的差距从 Open-Sora 1.2 的 4.52% 缩小至 0.69%,完整训练成本约 20 万美元。
产品概述
Open-Sora 由 HPC-AI Tech(潞晨科技)开发,自 2024 年 3 月首次发布以来,已成为开放权重视频生成领域”完全开放”理念的奠基者——不仅开放模型权重,更开放训练代码、数据配方、评估协议与完整训练管道 。
家族演进(具体以 GitHub 仓库实时主线为准):
- Open-Sora 1.0:首个开放权重视频生成完整方案,含架构、captioning 等基础设施
- Open-Sora 1.1:多分辨率/时长/宽高比、图像/视频条件控制与编辑、数据预处理
- Open-Sora 1.2:Rectified Flow、3D-VAE、score condition、评估体系
- Open-Sora 1.3:Shift-window attention、统一时空 VAE
- Open-Sora 2.0(当前公开主线):11B 参数视频扩散模型,Apache-2.0 许可,VBench 评分 81.8%,与 Sora 的差距缩小至 0.69%,完整训练成本约 20 万美元
当前主线 Open-Sora 2.0 核心参数 :
- 架构:11B 参数视频扩散 Transformer(DiT),时空注意力
- 任务:T2V(文生视频)与 I2V(图生视频)由同一模型支持
- 分辨率:256px 与 768px
- 宽高比:16:9、9:16、1:1、2.39:1 电影宽银幕
- 时长:2-16 秒(帧数遵循 4k+1 模式,如 17/33/65 帧)
- 许可:Apache-2.0
- 权重体积:48.41GB(Safetensors 格式)
- 训练成本:约 20 万美元一次性投入
“完全开放”的具体内涵(Open-Sora 与仅”开放权重”模型的根本区别):
- 开放权重:11B 模型 Apache-2.0 许可,Hugging Face 与 ModelScope 双平台发布
- 开放训练代码:完整训练管道开源,含数据预处理、captioning、rectified flow、3D-VAE 等
- 开放评估协议:VBench 评估方案完整开源
- 开放数据配方:各版本技术报告详细披露数据配方与训练策略
- 逐步训练指南:提供从零训练或微调自有模型的 step-by-step 文档
许可策略(关键):
Open-Sora 全系采用 Apache-2.0 许可 :
- 允许商用、修改、再分发、微调,无营收门槛、无月活限制、无署名义务
- 明确授予专利权(这是与某些开源许可的关键差异)
- 生成的视频内容完全归创作者所有
- 与 WAN(Apache-2.0)、Mochi(Apache-2.0)、FLUX.2 [schnell](Apache-2.0)并列”最干净许可”阵营
- 是开放权重视频生成领域中许可最无争议的模型
💡 Open-Sora 的独特性不在单项基准跑分,而在”完全可复现”——20 万美元即可训练出一个与 Sora 差距仅 0.69% 的商业级视频生成模型,这是开放权重领域”技术平权”的里程碑。与 WAN(任务谱系最完整+消费级 5B 可跑)、Mochi(Apache-2.0+单卡 LoRA 微调友好)形成差异化:Open-Sora 的核心价值在 “权重+代码+协议”三重开放,是视频生成领域”完全开放”理念的奠基者。
核心能力
- 文生视频(T2V):从自然语言 prompt 直接生成视频;Open-Sora 2.0 通过 FLUX 文本生成图像+视频生成的 T2I2V 两阶段流水线,显著提升 T2V 质量
- 图生视频(I2V):基于输入图像+文本 prompt 生成动态视频,同一 11B 模型支持
- 视频编辑(V2V):编辑或风格化现有视频片段
- 多分辨率支持:256px 至 768px 灵活分辨率
- 多宽高比:16:9 横屏、9:16 竖屏(短视频友好)、1:1 方形、2.39:1 电影宽银幕
- 2-16 秒时长:帧数遵循 4k+1 模式,适配短视频、广告、社交媒体内容
- 运动强度控制:Motion Score 参数调节动态程度(1=微动如细雨,7=剧烈如海浪),支持 LLM 动态评估最优运动强度
- Prompt 自动优化:内置 prompt refinement,使用 LLM(如 GPT-4)将简短 prompt 自动扩展为 50-100 词详细描述
- 种子可复现:采样与全局执行均支持随机种子设定,确保结果一致性,便于调试与生产
- 主流框架支持:ColossalAI 序列并行、xFormers、Flash-Attention 3(Hopper 架构加速)
优势亮点
- Apache-2.0 最宽松许可:商用、修改、再分发、微调均无门槛,明确授予专利权,生成的视频完全归创作者所有
- 完全可复现训练:权重+训练代码+数据配方+评估协议四重开放,20 万美元即可训练商业级视频生成模型
- VBench 81.8%:Open-Sora 2.0 在 VBench 上得分 81.8%,与 Sora 的差距从 1.2 版本的 4.52% 缩小至 0.69%
- 人类偏好对标商业模型:人工评测显示 Open-Sora 2.0 与 HunyuanVideo 11B、Step-Video 30B 处于同一水平
- T2I2V 两阶段流水线:通过 FLUX 生成强初始帧再动画化,T2V 质量显著超越直接 T2V
- 灵活分辨率与宽高比:从 256px 到 768px,支持横屏/竖屏/方形/电影宽银幕,适配全平台内容需求
- 运动强度精确控制:Motion Score + LLM 动态评估,让运动强度与场景语义匹配
- 社区生态活跃:GitHub 29K+ Stars,ColossalAI 生态原生支持,提供完整的微调与分布式训练工具链
- Hugging Face + ModelScope 双平台:国内外开发者均可高速下载权重
局限
- 单卡 256px 需 52GB+ 显存:官方最低要求单张 CUDA GPU 52GB+ VRAM(如 A100 80GB)、系统内存 64GB+ ;消费级 GPU(RTX 4090 24GB)无法运行 11B 模型,仅能通过 CPU offload 做极限实验
- 768px 需多卡集群:官方推荐 2-8 张 H100/H800 做 768px 生成
- 无更小尺寸公开权重:当前 Hugging Face/ModelScope 公开主线为 11B 模型,社区期待的 1.3B 等小模型入口版本并未作为稳定权重发布(仅在第三方资料中提及)
- 时长上限 16 秒:单次生成视频最长为 16 秒,长视频需分段生成后拼接
- 无原生音频:Open-Sora 仅生成无声视频,音视频同步需外部方案
- 与顶级闭源仍有差距:虽与 Sora 差距缩小至 0.69%,但在运动连贯性、长时序一致性、复杂提示词遵循上,与最新闭源视频模型(Veo 3、Sora 2)仍有距离
- T2V 质量依赖 FLUX 初始帧:直接 T2V 质量不及 T2I2V 两阶段流水线,后者需额外部署 FLUX 文本生成图像模型
- 训练代码复现门槛高:虽然代码全开放,但完整复现 11B 模型训练仍需约 20 万美元计算资源,中小团队难以从零复现
适用人群
- 需 Apache-2.0 合规的商用视频生成:与 WAN、Mochi、FLUX.2 [schnell] 并列”最干净许可”阵营,可商用、可修改、可再分发
- 视频生成研究团队:权重+训练代码+数据配方+评估协议四重开放,是从零研究视频扩散模型的黄金基座
- 自建视频生成管线的企业:20 万美元训练成本让中小企业也能拥有商业级视频生成模型,避免被闭源 API 锁定
- 短视频与社交媒体内容创作者:多宽高比(含 9:16 竖屏)、2-16 秒时长、运动强度可控,是 TikTok/Instagram Reels/小红书内容生产的开放权重首选
- 电影与广告预可视化:2.39:1 电影宽银幕比例、Motion Score 控制、种子可复现,适合预可视化与概念验证
- 数据中心级自托管团队:具备多卡 A100/H100 的团队可完全本地部署,数据不出本机
- LoRA 微调与领域适配:基于 ColossalAI 框架微调专属风格、品牌一致性
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| 256px 推理(最低) | 单卡 A100 80GB(52GB+ VRAM),64GB+ 系统内存 |
| 256px 推理(推荐) | 单卡 H100 80GB |
| 768px 推理 | 8×H100/H800(ColossalAI 序列并行) |
| 完整训练复现 | 多卡 H100 集群,约 20 万美元计算成本 |
⚠️ 消费级 GPU(RTX 4090 24GB)无法运行 11B 模型。Open-Sora 目前未发布稳定的小尺寸公开权重,消费级硬件用户建议使用 WAN TI2V-5B 作为替代。
2. 获取模型权重
# 通过 Hugging Face 下载(推荐) pip install "huggingface_hub[cli]" huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./ckpts # 通过 ModelScope 下载(国内镜像) pip install modelscope modelscope download hpcai-tech/Open-Sora-v2 --local_dir ./ckpts
3. 安装依赖
# 克隆仓库 git clone https://github.com/hpcaitech/Open-Sora cd Open-Sora # 创建虚拟环境(Python 3.10+) conda create -n opensora python=3.10 conda activate opensora # 安装(需 torch >= 2.4.0) pip install -v . pip install xformers==0.0.27.post2 --index-url https://download.pytorch.org/whl/cu121 pip install flash-attn --no-build-isolation # 可选:Hopper 架构安装 Flash-Attention 3 加速 # git clone https://github.com/Dao-AILab/flash-attention # cd flash-attention/hopper && python setup.py install
4. 文生视频(T2V,直接生成)
# 256px 单卡生成 torchrun --nproc_per_node 1 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/256px.py \ --prompt "raining, sea" \ --save-dir samples # 768px 多卡生成(8×H100) torchrun --nproc_per_node 8 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/768px.py \ --prompt "raining, sea" \ --save-dir samples
5. 文生图生视频(T2I2V,推荐高质量路径)
# 256px T2I2V 两阶段流水线(先 FLUX 生成图像,再动画化) torchrun --nproc_per_node 1 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/t2i2v_256px.py \ --save-dir samples \ --prompt "raining, sea" # 768px T2I2V 多卡生成 torchrun --nproc_per_node 8 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/t2i2v_768px.py \ --save-dir samples \ --prompt "raining, sea"
💡 T2I2V 两阶段流水线是 Open-Sora 2.0 推荐的高质量 T2V 路径——通过 FLUX 生成强初始帧再动画化,质量显著超越直接 T2V
6. 图生视频(I2V)
# 256px I2V torchrun --nproc_per_node 1 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/256px.py \ --cond_type i2v_head \ --prompt "A plump pig wallows in a muddy pond on a rustic farm, its pink snout poking out as it snorts contentedly. The camera captures the pig's playful splashes, sending ripples through the water under the midday sun."
7. 高级参数控制
# 控制宽高比(16:9 / 9:16 / 1:1 / 2.39:1) # 控制时长(4k+1 帧,如 17/33/65) torchrun --nproc_per_node 1 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/t2i2v_768px.py \ --prompt "a drone flying over a mountain lake at sunset" \ --aspect_ratio 2.39:1 \ --num_frames 65 \ --save-dir samples
8. 通过 ColossalAI 分布式微调
# 使用 ColossalAI 进行序列并行微调 # 详见 Open-Sora 官方文档的 step-by-step 微调指南 # 支持 LoRA、全参微调等多种策略
9. Docker 部署(推荐生产环境)
# 使用官方推荐的 Docker 部署方式 # 单卡 A100 用于原型开发,多卡 H100 用于 768p 生产 docker run --gpus all \ -v $(pwd)/ckpts:/ckpts \ -v $(pwd)/samples:/samples \ hpcaitech/open-sora:latest \ torchrun --nproc_per_node 1 --standalone \ scripts/diffusion/inference.py \ configs/diffusion/inference/t2i2v_256px.py \ --prompt "raining, sea" \ --save-dir /samples
10. 部署前必检清单
- 确认仓库位于
github.com/hpcaitech/Open-Sora(官方组织)与huggingface.co/hpcai-tech/Open-Sora-v2(官方权重) - 商用部署审阅 Apache-2.0 许可(无附加限制,明确授予专利权)
- 单卡部署需 52GB+ VRAM(A100 80GB),消费级 GPU 无法运行 11B 模型
- 768px 生成需 8×H100/H800 多卡集群
- T2V 高质量路径推荐使用 T2I2V 两阶段流水线(需额外部署 FLUX)
- 视频时长上限 16 秒,长视频需分段生成后拼接
- 生成内容完全归创作者所有,无使用限制
相关导航


Qwen

DeepSeek

GLM

SEA-LION

WAN

