Open-Sora翻译站点

3周前更新 16 0 0

HPC-AI Tech 的 Apache-2.0 开放权重视频生成家族,权重+训练代码+评估协议全开源。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20
Open-SoraOpen-Sora

Open-Sora 是 HPC-AI Tech(潞晨科技)开发的开放权重视频生成模型家族,旨在”让所有人都能高效生产视频”。家族采用 Apache-2.0 许可,开放模型权重、训练代码与评估协议,是开放权重视频生成领域中”完全可复现”的代表。当前公开主线 Open-Sora 2.0 为 11B 参数视频扩散模型,支持文生视频(T2V)与图生视频(I2V),256px 至 768px 多分辨率,VBench 评分 81.8%,与 Sora 的差距从 Open-Sora 1.2 的 4.52% 缩小至 0.69%,完整训练成本约 20 万美元。

 

产品概述

Open-Sora 由 HPC-AI Tech(潞晨科技)开发,自 2024 年 3 月首次发布以来,已成为开放权重视频生成领域”完全开放”理念的奠基者——不仅开放模型权重,更开放训练代码、数据配方、评估协议与完整训练管道 。

 

家族演进(具体以 GitHub 仓库实时主线为准):

  • Open-Sora 1.0:首个开放权重视频生成完整方案,含架构、captioning 等基础设施
  • Open-Sora 1.1:多分辨率/时长/宽高比、图像/视频条件控制与编辑、数据预处理
  • Open-Sora 1.2:Rectified Flow、3D-VAE、score condition、评估体系
  • Open-Sora 1.3:Shift-window attention、统一时空 VAE
  • Open-Sora 2.0(当前公开主线):11B 参数视频扩散模型,Apache-2.0 许可,VBench 评分 81.8%,与 Sora 的差距缩小至 0.69%,完整训练成本约 20 万美元

 

当前主线 Open-Sora 2.0 核心参数​ :

  • 架构:11B 参数视频扩散 Transformer(DiT),时空注意力
  • 任务:T2V(文生视频)与 I2V(图生视频)由同一模型支持
  • 分辨率:256px 与 768px
  • 宽高比:16:9、9:16、1:1、2.39:1 电影宽银幕
  • 时长:2-16 秒(帧数遵循 4k+1 模式,如 17/33/65 帧)
  • 许可:Apache-2.0
  • 权重体积:48.41GB(Safetensors 格式)
  • 训练成本:约 20 万美元一次性投入

 

“完全开放”的具体内涵(Open-Sora 与仅”开放权重”模型的根本区别):

  • 开放权重:11B 模型 Apache-2.0 许可,Hugging Face 与 ModelScope 双平台发布
  • 开放训练代码:完整训练管道开源,含数据预处理、captioning、rectified flow、3D-VAE 等
  • 开放评估协议:VBench 评估方案完整开源
  • 开放数据配方:各版本技术报告详细披露数据配方与训练策略
  • 逐步训练指南:提供从零训练或微调自有模型的 step-by-step 文档

 

许可策略(关键):

Open-Sora 全系采用 Apache-2.0 许可​ :

  • 允许商用、修改、再分发、微调,无营收门槛、无月活限制、无署名义务
  • 明确授予专利权(这是与某些开源许可的关键差异)
  • 生成的视频内容完全归创作者所有
  • 与 WAN(Apache-2.0)、Mochi(Apache-2.0)、FLUX.2 [schnell](Apache-2.0)并列”最干净许可”阵营
  • 是开放权重视频生成领域中许可最无争议的模型

💡 Open-Sora 的独特性不在单项基准跑分,而在”完全可复现”——20 万美元即可训练出一个与 Sora 差距仅 0.69% 的商业级视频生成模型,这是开放权重领域”技术平权”的里程碑。与 WAN(任务谱系最完整+消费级 5B 可跑)、Mochi(Apache-2.0+单卡 LoRA 微调友好)形成差异化:Open-Sora 的核心价值在 “权重+代码+协议”三重开放,是视频生成领域”完全开放”理念的奠基者。

 

核心能力

  • 文生视频(T2V):从自然语言 prompt 直接生成视频;Open-Sora 2.0 通过 FLUX 文本生成图像+视频生成的 T2I2V 两阶段流水线,显著提升 T2V 质量
  • 图生视频(I2V):基于输入图像+文本 prompt 生成动态视频,同一 11B 模型支持
  • 视频编辑(V2V):编辑或风格化现有视频片段
  • 多分辨率支持:256px 至 768px 灵活分辨率
  • 多宽高比:16:9 横屏、9:16 竖屏(短视频友好)、1:1 方形、2.39:1 电影宽银幕
  • 2-16 秒时长:帧数遵循 4k+1 模式,适配短视频、广告、社交媒体内容
  • 运动强度控制:Motion Score 参数调节动态程度(1=微动如细雨,7=剧烈如海浪),支持 LLM 动态评估最优运动强度
  • Prompt 自动优化:内置 prompt refinement,使用 LLM(如 GPT-4)将简短 prompt 自动扩展为 50-100 词详细描述
  • 种子可复现:采样与全局执行均支持随机种子设定,确保结果一致性,便于调试与生产
  • 主流框架支持:ColossalAI 序列并行、xFormers、Flash-Attention 3(Hopper 架构加速)

 

优势亮点

  • Apache-2.0 最宽松许可:商用、修改、再分发、微调均无门槛,明确授予专利权,生成的视频完全归创作者所有
  • 完全可复现训练:权重+训练代码+数据配方+评估协议四重开放,20 万美元即可训练商业级视频生成模型
  • VBench 81.8%:Open-Sora 2.0 在 VBench 上得分 81.8%,与 Sora 的差距从 1.2 版本的 4.52% 缩小至 0.69%
  • 人类偏好对标商业模型:人工评测显示 Open-Sora 2.0 与 HunyuanVideo 11B、Step-Video 30B 处于同一水平
  • T2I2V 两阶段流水线:通过 FLUX 生成强初始帧再动画化,T2V 质量显著超越直接 T2V
  • 灵活分辨率与宽高比:从 256px 到 768px,支持横屏/竖屏/方形/电影宽银幕,适配全平台内容需求
  • 运动强度精确控制:Motion Score + LLM 动态评估,让运动强度与场景语义匹配
  • 社区生态活跃:GitHub 29K+ Stars,ColossalAI 生态原生支持,提供完整的微调与分布式训练工具链
  • Hugging Face + ModelScope 双平台:国内外开发者均可高速下载权重

 

局限

  • 单卡 256px 需 52GB+ 显存:官方最低要求单张 CUDA GPU 52GB+ VRAM(如 A100 80GB)、系统内存 64GB+ ;消费级 GPU(RTX 4090 24GB)无法运行 11B 模型,仅能通过 CPU offload 做极限实验
  • 768px 需多卡集群:官方推荐 2-8 张 H100/H800 做 768px 生成
  • 无更小尺寸公开权重:当前 Hugging Face/ModelScope 公开主线为 11B 模型,社区期待的 1.3B 等小模型入口版本并未作为稳定权重发布(仅在第三方资料中提及)
  • 时长上限 16 秒:单次生成视频最长为 16 秒,长视频需分段生成后拼接
  • 无原生音频:Open-Sora 仅生成无声视频,音视频同步需外部方案
  • 与顶级闭源仍有差距:虽与 Sora 差距缩小至 0.69%,但在运动连贯性、长时序一致性、复杂提示词遵循上,与最新闭源视频模型(Veo 3、Sora 2)仍有距离
  • T2V 质量依赖 FLUX 初始帧:直接 T2V 质量不及 T2I2V 两阶段流水线,后者需额外部署 FLUX 文本生成图像模型
  • 训练代码复现门槛高:虽然代码全开放,但完整复现 11B 模型训练仍需约 20 万美元计算资源,中小团队难以从零复现

 

适用人群

  • 需 Apache-2.0 合规的商用视频生成:与 WAN、Mochi、FLUX.2 [schnell] 并列”最干净许可”阵营,可商用、可修改、可再分发
  • 视频生成研究团队:权重+训练代码+数据配方+评估协议四重开放,是从零研究视频扩散模型的黄金基座
  • 自建视频生成管线的企业:20 万美元训练成本让中小企业也能拥有商业级视频生成模型,避免被闭源 API 锁定
  • 短视频与社交媒体内容创作者:多宽高比(含 9:16 竖屏)、2-16 秒时长、运动强度可控,是 TikTok/Instagram Reels/小红书内容生产的开放权重首选
  • 电影与广告预可视化:2.39:1 电影宽银幕比例、Motion Score 控制、种子可复现,适合预可视化与概念验证
  • 数据中心级自托管团队:具备多卡 A100/H100 的团队可完全本地部署,数据不出本机
  • LoRA 微调与领域适配:基于 ColossalAI 框架微调专属风格、品牌一致性

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
256px 推理(最低) 单卡 A100 80GB(52GB+ VRAM),64GB+ 系统内存
256px 推理(推荐) 单卡 H100 80GB
768px 推理 8×H100/H800(ColossalAI 序列并行)
完整训练复现 多卡 H100 集群,约 20 万美元计算成本

⚠️ 消费级 GPU(RTX 4090 24GB)无法运行 11B 模型。Open-Sora 目前未发布稳定的小尺寸公开权重,消费级硬件用户建议使用 WAN TI2V-5B 作为替代。

 

2. 获取模型权重

# 通过 Hugging Face 下载(推荐)
pip install "huggingface_hub[cli]"
huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./ckpts

# 通过 ModelScope 下载(国内镜像)
pip install modelscope
modelscope download hpcai-tech/Open-Sora-v2 --local_dir ./ckpts

 

3. 安装依赖

# 克隆仓库
git clone https://github.com/hpcaitech/Open-Sora
cd Open-Sora

# 创建虚拟环境(Python 3.10+)
conda create -n opensora python=3.10
conda activate opensora

# 安装(需 torch >= 2.4.0)
pip install -v .
pip install xformers==0.0.27.post2 --index-url https://download.pytorch.org/whl/cu121
pip install flash-attn --no-build-isolation

# 可选:Hopper 架构安装 Flash-Attention 3 加速
# git clone https://github.com/Dao-AILab/flash-attention
# cd flash-attention/hopper && python setup.py install

 

4. 文生视频(T2V,直接生成)

# 256px 单卡生成
torchrun --nproc_per_node 1 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/256px.py \
  --prompt "raining, sea" \
  --save-dir samples

# 768px 多卡生成(8×H100)
torchrun --nproc_per_node 8 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/768px.py \
  --prompt "raining, sea" \
  --save-dir samples

 

5. 文生图生视频(T2I2V,推荐高质量路径)

# 256px T2I2V 两阶段流水线(先 FLUX 生成图像,再动画化)
torchrun --nproc_per_node 1 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/t2i2v_256px.py \
  --save-dir samples \
  --prompt "raining, sea"

# 768px T2I2V 多卡生成
torchrun --nproc_per_node 8 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/t2i2v_768px.py \
  --save-dir samples \
  --prompt "raining, sea"

💡 T2I2V 两阶段流水线是 Open-Sora 2.0 推荐的高质量 T2V 路径——通过 FLUX 生成强初始帧再动画化,质量显著超越直接 T2V

 

6. 图生视频(I2V)

# 256px I2V
torchrun --nproc_per_node 1 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/256px.py \
  --cond_type i2v_head \
  --prompt "A plump pig wallows in a muddy pond on a rustic farm, its pink snout poking out as it snorts contentedly. The camera captures the pig's playful splashes, sending ripples through the water under the midday sun."

 

7. 高级参数控制

# 控制宽高比(16:9 / 9:16 / 1:1 / 2.39:1)
# 控制时长(4k+1 帧,如 17/33/65)
torchrun --nproc_per_node 1 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/t2i2v_768px.py \
  --prompt "a drone flying over a mountain lake at sunset" \
  --aspect_ratio 2.39:1 \
  --num_frames 65 \
  --save-dir samples

 

8. 通过 ColossalAI 分布式微调

# 使用 ColossalAI 进行序列并行微调
# 详见 Open-Sora 官方文档的 step-by-step 微调指南
# 支持 LoRA、全参微调等多种策略

 

9. Docker 部署(推荐生产环境)

# 使用官方推荐的 Docker 部署方式
# 单卡 A100 用于原型开发,多卡 H100 用于 768p 生产
docker run --gpus all \
  -v $(pwd)/ckpts:/ckpts \
  -v $(pwd)/samples:/samples \
  hpcaitech/open-sora:latest \
  torchrun --nproc_per_node 1 --standalone \
  scripts/diffusion/inference.py \
  configs/diffusion/inference/t2i2v_256px.py \
  --prompt "raining, sea" \
  --save-dir /samples

 

10. 部署前必检清单

  • 确认仓库位于 github.com/hpcaitech/Open-Sora(官方组织)与 huggingface.co/hpcai-tech/Open-Sora-v2(官方权重)
  • 商用部署审阅 Apache-2.0 许可(无附加限制,明确授予专利权)
  • 单卡部署需 52GB+ VRAM(A100 80GB),消费级 GPU 无法运行 11B 模型
  • 768px 生成需 8×H100/H800 多卡集群
  • T2V 高质量路径推荐使用 T2I2V 两阶段流水线(需额外部署 FLUX)
  • 视频时长上限 16 秒,长视频需分段生成后拼接
  • 生成内容完全归创作者所有,无使用限制

 

相关导航