MOCHI翻译站点

3周前更新 15 0 0

Genmo 的 Apache-2.0 开放权重视频生成模型,10B AsymmDiT 架构,运动质量与提示词遵循双 SOTA。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

MOCHI 是旧金山 AI 研究机构 Genmo 开发的开放权重视频生成模型,于 2024 年 10 月 22 日以”研究预览版”发布,是当时最大规模的开放权重视频模型(10B 参数)。MOCHI 采用 Genmo 自研的 Asymmetric Diffusion Transformer(AsymmDiT)架构,Apache-2.0 许可,可个人与商业使用,480p@30fps 输出、最长 5.4 秒视频片段,以”高保真运动”和”强提示词遵循”两大特性著称,是开放权重视频生成领域中”许可最干净 + 运动质量最高”的代表之一。

 

产品概述

MOCHI 由 Genmo 开发——这家旧金山研究机构由 Paras Jain 与 Ajay Jain(均为 UC Berkeley 博士)于 2022 年创立,团队成员参与过 DDPM、DreamFusion、Emu Video 等奠基性论文 。MOCHI 1 的发布与 Genmo 完成 2840 万美元 A 轮融资同步 ,定位是”开放视频生成的新 SOTA”,旨在大幅缩小闭源与开放视频生成系统的差距 。

 

核心参数​ :

  • 架构:10B 参数 Asymmetric Diffusion Transformer(AsymmDiT)
  • 层数:48 / 注意力头:24 / 视觉维度:3072 / 文本维度:1536
  • 视觉 tokens:44,520 / 文本 tokens:256
  • 视觉流参数量约为文本流的 4 倍(非对称设计的核心)
  • 文本编码器:单个 T5-XXL
  • VAE:AsymmVAE,362M 参数,8×8 空间压缩 + 6× 时间压缩,12 通道潜空间,128× 总压缩比
  • 输出:848×480@30fps,最长 5.4 秒(163 帧)
  • 许可:Apache-2.0

 

AsymmDiT 架构创新(MOCHI 与对称 DiT 的根本差异):

  • 非对称参数分配:视觉流使用更大的隐藏维度(3072 vs 文本 1536),参数量约为文本流的 4 倍——将神经网络容量集中在视觉推理上,文本编码仅用单个 T5-XXL 轻量处理
  • 非方形 QKV 与输出投影:统一的自注意力中,视觉与文本使用不同的 QKV 维度,降低推理内存需求
  • SwiGLU 前馈层 + 查询-键归一化 + Sandwich 归一化:借鉴语言模型 scaling 的最新进展,增强训练稳定性与控制内部激活
  • 3D 全注意力:在时空潜空间上执行全 3D 注意力,确保运动连贯性
  • 简单可黑箱架构:Genmo 明确强调”simple, hackable architecture”——架构简洁,便于社区修改与实验

 

许可策略(关键):

MOCHI 采用 Apache-2.0 许可​ :

  • 允许个人与商业使用、修改、再分发、微调,无营收门槛、无月活限制、无署名义务
  • 明确授予专利权
  • 与 WAN(Apache-2.0)、Open-Sora(Apache-2.0)、FLUX.2 [schnell](Apache-2.0)并列”最干净许可”阵营
  • 是开放权重视频生成领域中许可最无争议的模型之一——HunyuanVideo 是腾讯社区许可(欧盟/英国/韩国不适用),LTX-2 是 LTX-2 Community License(年营收>1000 万美元需付费),CogVideoX 5B 是自定义许可;MOCHI 的 Apache-2.0 是无条件开放

💡 MOCHI 的独特性在”运动质量 + 许可干净”的双重优势——AsymmDiT 的非对称设计让视觉流获得 4 倍于文本流的容量,专门优化运动动态;而 Apache-2.0 许可让这种能力可以被任何人商用。这是与 WAN(任务谱系最完整)、Open-Sora(完全可复现训练)形成差异化的核心定位。

 

核心能力

  • 文生视频(T2V):从自然语言 prompt 生成 480p@30fps 视频,最长 5.4 秒
  • 高保真运动生成:AsymmDiT 专门针对运动质量优化,减少”橡胶人”扭曲伪影,流畅模拟流体动力学、毛发/皮毛运动、人体动作
  • 强提示词遵循:在自动化评测中展现极强的 prompt adherence,能精准控制角色、场景、动作细节
  • 物理真实模拟:能模拟流体动力学、fur and hair simulation,人体动作开始跨越恐怖谷
  • LoRA 微调:2024 年 11 月 26 日官方加入 LoRA 微调支持,单卡 H100/A100 80GB 即可训练专属风格
  • 消费级 GPU 支持:2024 年 11 月 5 日起,ComfyUI 原生支持消费级 GPU 运行 MOCHI
  • 多 GPU 分片:官方仓库支持模型跨多卡切分,单卡不足时可多卡推理
  • Gradio UI + CLI:官方提供 Gradio 交互界面与命令行推理入口
  • Diffusers 集成:Hugging Face Diffusers 原生支持 MOCHI Pipeline,可与 Transformers 生态无缝衔接
  • VAE Tiling:支持 VAE 分块解码,降低显存峰值

 

优势亮点

  • Apache-2.0 最干净许可:与 WAN、Open-Sora 并列”最干净许可”阵营,商用、修改、再分发均无门槛,明确授予专利权——这是与 HunyuanVideo(地域限制)、LTX-2(营收门槛)最本质的差异
  • 运动质量开放权重第一档:AsymmDiT 非对称架构专门优化时序连贯性,在运动保真度上位列开放权重视频模型顶级
  • 提示词遵循强:自动化评测(VLM-as-judge,遵循 DALL-E 3 协议)显示 MOCHI 1 在 prompt adherence 上达到最佳级别
  • 10B 稠密模型,架构简洁:非 MoE 的稠密 10B 模型,所有参数在推理时激活,架构”simple, hackable”,便于研究与修改
  • LoRA 单卡可微调:H100/A100 80GB 单卡即可训练 LoRA,是开放权重视频模型中微调门槛最低的之一
  • 消费级硬件可运行:通过 bf16 量化 + CPU offload + VAE tiling,RTX 4090 24GB 可运行(bf16 变体约 22GB VRAM)
  • 与闭源模型竞争:Genmo 官方评测显示 MOCHI 1 与领先的闭源视频模型”perform very competitively”
  • 完全开放权重:Hugging Face + GitHub + 磁力链接三通道分发,权重、源码、VAE 全部开放

 

局限

  • 480p 分辨率上限:当前公开版本仅支持 480p 输出;Genmo 曾预告 Mochi 1 HD(720p)将在”later this year”推出,但该版本是否正式开放权重需以官方最新公告为准
  • 5.4 秒时长上限:单次生成视频最长 5.4 秒(163 帧),长视频需分段生成后拼接
  • 无原生音频:MOCHI 仅生成无声视频,音视频同步需外部方案——LTX-2、WAN 2.5 等已开始支持原生音频
  • 单卡全精度需 60GB VRAM:官方仓库推荐至少 1 张 H100(80GB);全精度 fp16 需 42GB VRAM,bf16 变体需 22GB VRAM,8-bit 量化可降至 12GB 级别
  • 消费级硬件推理慢:RTX 4090 上 bf16 变体生成 480p/31 帧视频需数分钟/片段,非实时模型
  • 偏写实风格:MOCHI 1 针对 photorealistic 风格优化,在动画内容上表现不佳
  • 极端运动偶有畸变:在极端运动边缘案例中可能出现轻微扭曲与变形
  • 无图生视频(I2V):MOCHI 1 当前公开版本仅支持文生视频,I2V 能力缺失——WAN 2.2 等已支持 I2V/TI2V
  • Genmo 无自营托管 API:Genmo 不提供第一方付费 API,使用者需自托管或通过 Replicate、fal.ai 等第三方推理主机

 

适用人群

  • 需 Apache-2.0 合规的商用视频生成:与 WAN、Open-Sora 并列”最干净许可”阵营,可商用、可修改、再分发零门槛——这是 MOCHI 最核心的差异化优势
  • 运动密集型视频生成:动作序列、摄像机运动、物体交互等运动保真度要求高的场景,MOCHI 的 AsymmDiT 架构是开放权重中的最佳选择
  • LoRA 微调与风格定制:单卡 H100/A100 80GB 即可训练 LoRA,品牌定制、角色一致性的成本门槛低
  • 数据主权敏感的企业:完全本地部署,数据不出本机,适合影视预可视化、游戏开发、合成数据生成
  • 短视频与广告内容创作:480p@30fps、5.4 秒片段,适合社交媒体短视频、广告 TVC 预可视化
  • 视频生成研究团队:10B 稠密模型 + 简洁可黑箱架构 + Apache-2.0,是从零研究视频扩散 Transformer 的黄金基座
  • 消费级硬件探索者:RTX 4090 24GB 通过 bf16 + CPU offload + VAE tiling 可运行,是个人开发者的开放权重视频入门首选

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置 显存占用
全精度 fp16 推理 单卡 A100 80GB 或 H100 ~42GB VRAM
bf16 变体推理(推荐消费级) 单卡 RTX 4090 24GB ~22GB VRAM
8-bit 量化推理 单卡 RTX 4080 16GB / RTX 4070 Ti ~12GB VRAM
CPU offload + VAE tiling 单卡 RTX 3090/4090 + 32GB 系统内存 8-20GB VRAM
官方推荐全能力 单卡 H100(推荐)或 4×H100 ~60GB VRAM
LoRA 微调 单卡 H100/A100 80GB 80GB VRAM

⚠️ 存储需求:模型权重 dit.safetensors 约 19.5GB + VAE decoder.safetensors 约 500MB,总计约 20GB 磁盘空间;使用 CPU offload 时需 32GB+ 系统内存

 

2. 通过 Genmo 官方仓库部署

# 克隆仓库
git clone https://github.com/genmoai/models
cd models

# 安装 uv 与依赖
curl -LsSf https://astral.sh/uv/install.sh | sh
uv venv .venv
source .venv/bin/activate
uv pip install -e .

# 安装 FFMPEG(视频导出必需)
sudo apt install ffmpeg   # Ubuntu/Debian
brew install ffmpeg      # macOS

# 下载权重
python -m scripts.download_weights ./weights

# 启动 Gradio UI
python -m demos.gradio_ui --model_dir ./weights --cpu_offload

# 或通过 CLI 生成
python -m demos.cli --model_dir ./weights --cpu_offload \
  --prompt "a corgi running on a beach, waves crashing, slow motion"

 

3. 通过 Hugging Face Diffusers 推理(全精度,≥42GB VRAM)

import torch
from diffusers import MochiPipeline
from diffusers.utils import export_to_video

pipe = MochiPipeline.from_pretrained("genmo/mochi-1-preview")

# 启用显存优化
pipe.enable_model_cpu_offload()
pipe.vae.enable_tiling()

prompt = "Close-up of a chameleon's eye, with its scaly skin changing color. Ultra high resolution 4k."
with torch.autocast("cuda", torch.bfloat16, cache_enabled=False):
    frames = pipe(prompt, num_frames=85).frames[0]

export_to_video(frames, "mochi.mp4", fps=30)

 

4. 通过 Diffusers 使用 bf16 变体(22GB VRAM,推荐消费级)

import torch
from diffusers import MochiPipeline
from diffusers.utils import export_to_video

pipe = MochiPipeline.from_pretrained(
    "genmo/mochi-1-preview",
    variant="bf16",
    torch_dtype=torch.bfloat16
)

pipe.enable_model_cpu_offload()
pipe.vae.enable_tiling()

prompt = "Close-up of a chameleon's eye, with its scaly skin changing color. Ultra high resolution 4k."
frames = pipe(prompt, num_frames=85).frames[0]
export_to_video(frames, "mochi.mp4", fps=30)

 

5. 8-bit 量化推理(12GB VRAM 可行)

import torch
from diffusers import BitsAndBytesConfig as DiffusersBitsAndBytesConfig
from diffusers import MochiTransformer3DModel, MochiPipeline
from diffusers.utils import export_to_video
from transformers import BitsAndBytesConfig as BitsAndBytesConfig, T5EncoderModel

# 8-bit 量化文本编码器
quant_config = BitsAndBytesConfig(load_in_8bit=True)
text_encoder_8bit = T5EncoderModel.from_pretrained(
    "genmo/mochi-1-preview",
    subfolder="text_encoder",
    quantization_config=quant_config,
    torch_dtype=torch.float16,
)

# 8-bit 量化 DiT
quant_config = DiffusersBitsAndBytesConfig(load_in_8bit=True)
transformer_8bit = MochiTransformer3DModel.from_pretrained(
    "genmo/mochi-1-preview",
    subfolder="transformer",
    quantization_config=quant_config,
    torch_dtype=torch.float16,
)

pipeline = MochiPipeline.from_pretrained(
    "genmo/mochi-1-preview",
    text_encoder=text_encoder_8bit,
    transformer=transformer_8bit,
    torch_dtype=torch.float16,
    device_map="balanced",
)

video = pipeline(
    "Close-up of a cat's eye, with the galaxy reflected in the cat's eye. Ultra high resolution 4k.",
    num_inference_steps=28,
    guidance_scale=3.5
).frames[0]
export_to_video(video, "cat.mp4")

 

6. 通过 ComfyUI 部署(消费级推荐)

ComfyUI 原生支持 MOCHI,社区提供 ComfyUI-MochiWrapper:

  • RTX 4090 24GB:使用 bf16 + VAE tiling 工作流
  • RTX 4080 16GB:使用 4-bit 量化工作流
  • Camenduru 提供的 ComfyUI 工作流可在单卡 H100 上运行

 

7. LoRA 微调(单卡 H100/A100 80GB)

# Genmo 提供官方 LoRA trainer
# 单卡 H100 或 A100 80GB 即可训练
# 详见 GitHub 仓库的 fine-tuning 文档
python -m genmo.mochi_preview.trainers.lora_trainer \
  --data_path your_dataset \
  --model_dir ./weights \
  --lora_rank 64

加载 LoRA 推理:

python -m demos.cli --model_dir ./weights \
  --lora_path path/to/your/lora.safetensors \
  --prompt "your prompt here"

 

8. 第三方托管平台

通过 Replicate、fal.ai、Modal 等第三方推理主机调用 MOCHI:

  • Modal 上单 H100 自托管成本约 $0.33/片段
  • 适合无自有 GPU 的开发者快速试验

 

9. 部署前必检清单

  • 确认仓库位于 github.com/genmoai/models(官方)与 huggingface.co/genmo/mochi-1-preview(官方权重)
  • 商用部署审阅 Apache-2.0 许可(无附加限制,明确授予专利权)
  • 全精度需 42GB+ VRAM;消费级硬件推荐 bf16 变体(22GB VRAM)+ CPU offload + VAE tiling
  • RTX 4090 24GB 可运行 bf16 变体,但生成速度较慢(数分钟/片段)
  • 当前版本仅 480p 输出,最长 5.4 秒;720p HD 版本以 Genmo 官方最新公告为准
  • 仅支持文生视频,无图生视频(I2V)、无原生音频
  • 第三方部署可选 Replicate、fal.ai、Modal 等推理主机

 

相关导航