
MOCHI 是旧金山 AI 研究机构 Genmo 开发的开放权重视频生成模型,于 2024 年 10 月 22 日以”研究预览版”发布,是当时最大规模的开放权重视频模型(10B 参数)。MOCHI 采用 Genmo 自研的 Asymmetric Diffusion Transformer(AsymmDiT)架构,Apache-2.0 许可,可个人与商业使用,480p@30fps 输出、最长 5.4 秒视频片段,以”高保真运动”和”强提示词遵循”两大特性著称,是开放权重视频生成领域中”许可最干净 + 运动质量最高”的代表之一。
产品概述
MOCHI 由 Genmo 开发——这家旧金山研究机构由 Paras Jain 与 Ajay Jain(均为 UC Berkeley 博士)于 2022 年创立,团队成员参与过 DDPM、DreamFusion、Emu Video 等奠基性论文 。MOCHI 1 的发布与 Genmo 完成 2840 万美元 A 轮融资同步 ,定位是”开放视频生成的新 SOTA”,旨在大幅缩小闭源与开放视频生成系统的差距 。
核心参数 :
- 架构:10B 参数 Asymmetric Diffusion Transformer(AsymmDiT)
- 层数:48 / 注意力头:24 / 视觉维度:3072 / 文本维度:1536
- 视觉 tokens:44,520 / 文本 tokens:256
- 视觉流参数量约为文本流的 4 倍(非对称设计的核心)
- 文本编码器:单个 T5-XXL
- VAE:AsymmVAE,362M 参数,8×8 空间压缩 + 6× 时间压缩,12 通道潜空间,128× 总压缩比
- 输出:848×480@30fps,最长 5.4 秒(163 帧)
- 许可:Apache-2.0
AsymmDiT 架构创新(MOCHI 与对称 DiT 的根本差异):
- 非对称参数分配:视觉流使用更大的隐藏维度(3072 vs 文本 1536),参数量约为文本流的 4 倍——将神经网络容量集中在视觉推理上,文本编码仅用单个 T5-XXL 轻量处理
- 非方形 QKV 与输出投影:统一的自注意力中,视觉与文本使用不同的 QKV 维度,降低推理内存需求
- SwiGLU 前馈层 + 查询-键归一化 + Sandwich 归一化:借鉴语言模型 scaling 的最新进展,增强训练稳定性与控制内部激活
- 3D 全注意力:在时空潜空间上执行全 3D 注意力,确保运动连贯性
- 简单可黑箱架构:Genmo 明确强调”simple, hackable architecture”——架构简洁,便于社区修改与实验
许可策略(关键):
MOCHI 采用 Apache-2.0 许可 :
- 允许个人与商业使用、修改、再分发、微调,无营收门槛、无月活限制、无署名义务
- 明确授予专利权
- 与 WAN(Apache-2.0)、Open-Sora(Apache-2.0)、FLUX.2 [schnell](Apache-2.0)并列”最干净许可”阵营
- 是开放权重视频生成领域中许可最无争议的模型之一——HunyuanVideo 是腾讯社区许可(欧盟/英国/韩国不适用),LTX-2 是 LTX-2 Community License(年营收>1000 万美元需付费),CogVideoX 5B 是自定义许可;MOCHI 的 Apache-2.0 是无条件开放
💡 MOCHI 的独特性在”运动质量 + 许可干净”的双重优势——AsymmDiT 的非对称设计让视觉流获得 4 倍于文本流的容量,专门优化运动动态;而 Apache-2.0 许可让这种能力可以被任何人商用。这是与 WAN(任务谱系最完整)、Open-Sora(完全可复现训练)形成差异化的核心定位。
核心能力
- 文生视频(T2V):从自然语言 prompt 生成 480p@30fps 视频,最长 5.4 秒
- 高保真运动生成:AsymmDiT 专门针对运动质量优化,减少”橡胶人”扭曲伪影,流畅模拟流体动力学、毛发/皮毛运动、人体动作
- 强提示词遵循:在自动化评测中展现极强的 prompt adherence,能精准控制角色、场景、动作细节
- 物理真实模拟:能模拟流体动力学、fur and hair simulation,人体动作开始跨越恐怖谷
- LoRA 微调:2024 年 11 月 26 日官方加入 LoRA 微调支持,单卡 H100/A100 80GB 即可训练专属风格
- 消费级 GPU 支持:2024 年 11 月 5 日起,ComfyUI 原生支持消费级 GPU 运行 MOCHI
- 多 GPU 分片:官方仓库支持模型跨多卡切分,单卡不足时可多卡推理
- Gradio UI + CLI:官方提供 Gradio 交互界面与命令行推理入口
- Diffusers 集成:Hugging Face Diffusers 原生支持 MOCHI Pipeline,可与 Transformers 生态无缝衔接
- VAE Tiling:支持 VAE 分块解码,降低显存峰值
优势亮点
- Apache-2.0 最干净许可:与 WAN、Open-Sora 并列”最干净许可”阵营,商用、修改、再分发均无门槛,明确授予专利权——这是与 HunyuanVideo(地域限制)、LTX-2(营收门槛)最本质的差异
- 运动质量开放权重第一档:AsymmDiT 非对称架构专门优化时序连贯性,在运动保真度上位列开放权重视频模型顶级
- 提示词遵循强:自动化评测(VLM-as-judge,遵循 DALL-E 3 协议)显示 MOCHI 1 在 prompt adherence 上达到最佳级别
- 10B 稠密模型,架构简洁:非 MoE 的稠密 10B 模型,所有参数在推理时激活,架构”simple, hackable”,便于研究与修改
- LoRA 单卡可微调:H100/A100 80GB 单卡即可训练 LoRA,是开放权重视频模型中微调门槛最低的之一
- 消费级硬件可运行:通过 bf16 量化 + CPU offload + VAE tiling,RTX 4090 24GB 可运行(bf16 变体约 22GB VRAM)
- 与闭源模型竞争:Genmo 官方评测显示 MOCHI 1 与领先的闭源视频模型”perform very competitively”
- 完全开放权重:Hugging Face + GitHub + 磁力链接三通道分发,权重、源码、VAE 全部开放
局限
- 480p 分辨率上限:当前公开版本仅支持 480p 输出;Genmo 曾预告 Mochi 1 HD(720p)将在”later this year”推出,但该版本是否正式开放权重需以官方最新公告为准
- 5.4 秒时长上限:单次生成视频最长 5.4 秒(163 帧),长视频需分段生成后拼接
- 无原生音频:MOCHI 仅生成无声视频,音视频同步需外部方案——LTX-2、WAN 2.5 等已开始支持原生音频
- 单卡全精度需 60GB VRAM:官方仓库推荐至少 1 张 H100(80GB);全精度 fp16 需 42GB VRAM,bf16 变体需 22GB VRAM,8-bit 量化可降至 12GB 级别
- 消费级硬件推理慢:RTX 4090 上 bf16 变体生成 480p/31 帧视频需数分钟/片段,非实时模型
- 偏写实风格:MOCHI 1 针对 photorealistic 风格优化,在动画内容上表现不佳
- 极端运动偶有畸变:在极端运动边缘案例中可能出现轻微扭曲与变形
- 无图生视频(I2V):MOCHI 1 当前公开版本仅支持文生视频,I2V 能力缺失——WAN 2.2 等已支持 I2V/TI2V
- Genmo 无自营托管 API:Genmo 不提供第一方付费 API,使用者需自托管或通过 Replicate、fal.ai 等第三方推理主机
适用人群
- 需 Apache-2.0 合规的商用视频生成:与 WAN、Open-Sora 并列”最干净许可”阵营,可商用、可修改、再分发零门槛——这是 MOCHI 最核心的差异化优势
- 运动密集型视频生成:动作序列、摄像机运动、物体交互等运动保真度要求高的场景,MOCHI 的 AsymmDiT 架构是开放权重中的最佳选择
- LoRA 微调与风格定制:单卡 H100/A100 80GB 即可训练 LoRA,品牌定制、角色一致性的成本门槛低
- 数据主权敏感的企业:完全本地部署,数据不出本机,适合影视预可视化、游戏开发、合成数据生成
- 短视频与广告内容创作:480p@30fps、5.4 秒片段,适合社交媒体短视频、广告 TVC 预可视化
- 视频生成研究团队:10B 稠密模型 + 简洁可黑箱架构 + Apache-2.0,是从零研究视频扩散 Transformer 的黄金基座
- 消费级硬件探索者:RTX 4090 24GB 通过 bf16 + CPU offload + VAE tiling 可运行,是个人开发者的开放权重视频入门首选
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 | 显存占用 |
|---|---|---|
| 全精度 fp16 推理 | 单卡 A100 80GB 或 H100 | ~42GB VRAM |
| bf16 变体推理(推荐消费级) | 单卡 RTX 4090 24GB | ~22GB VRAM |
| 8-bit 量化推理 | 单卡 RTX 4080 16GB / RTX 4070 Ti | ~12GB VRAM |
| CPU offload + VAE tiling | 单卡 RTX 3090/4090 + 32GB 系统内存 | 8-20GB VRAM |
| 官方推荐全能力 | 单卡 H100(推荐)或 4×H100 | ~60GB VRAM |
| LoRA 微调 | 单卡 H100/A100 80GB | 80GB VRAM |
⚠️ 存储需求:模型权重 dit.safetensors 约 19.5GB + VAE decoder.safetensors 约 500MB,总计约 20GB 磁盘空间;使用 CPU offload 时需 32GB+ 系统内存
2. 通过 Genmo 官方仓库部署
# 克隆仓库 git clone https://github.com/genmoai/models cd models # 安装 uv 与依赖 curl -LsSf https://astral.sh/uv/install.sh | sh uv venv .venv source .venv/bin/activate uv pip install -e . # 安装 FFMPEG(视频导出必需) sudo apt install ffmpeg # Ubuntu/Debian brew install ffmpeg # macOS # 下载权重 python -m scripts.download_weights ./weights # 启动 Gradio UI python -m demos.gradio_ui --model_dir ./weights --cpu_offload # 或通过 CLI 生成 python -m demos.cli --model_dir ./weights --cpu_offload \ --prompt "a corgi running on a beach, waves crashing, slow motion"
3. 通过 Hugging Face Diffusers 推理(全精度,≥42GB VRAM)
import torch
from diffusers import MochiPipeline
from diffusers.utils import export_to_video
pipe = MochiPipeline.from_pretrained("genmo/mochi-1-preview")
# 启用显存优化
pipe.enable_model_cpu_offload()
pipe.vae.enable_tiling()
prompt = "Close-up of a chameleon's eye, with its scaly skin changing color. Ultra high resolution 4k."
with torch.autocast("cuda", torch.bfloat16, cache_enabled=False):
frames = pipe(prompt, num_frames=85).frames[0]
export_to_video(frames, "mochi.mp4", fps=30)
4. 通过 Diffusers 使用 bf16 变体(22GB VRAM,推荐消费级)
import torch
from diffusers import MochiPipeline
from diffusers.utils import export_to_video
pipe = MochiPipeline.from_pretrained(
"genmo/mochi-1-preview",
variant="bf16",
torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
pipe.vae.enable_tiling()
prompt = "Close-up of a chameleon's eye, with its scaly skin changing color. Ultra high resolution 4k."
frames = pipe(prompt, num_frames=85).frames[0]
export_to_video(frames, "mochi.mp4", fps=30)
5. 8-bit 量化推理(12GB VRAM 可行)
import torch
from diffusers import BitsAndBytesConfig as DiffusersBitsAndBytesConfig
from diffusers import MochiTransformer3DModel, MochiPipeline
from diffusers.utils import export_to_video
from transformers import BitsAndBytesConfig as BitsAndBytesConfig, T5EncoderModel
# 8-bit 量化文本编码器
quant_config = BitsAndBytesConfig(load_in_8bit=True)
text_encoder_8bit = T5EncoderModel.from_pretrained(
"genmo/mochi-1-preview",
subfolder="text_encoder",
quantization_config=quant_config,
torch_dtype=torch.float16,
)
# 8-bit 量化 DiT
quant_config = DiffusersBitsAndBytesConfig(load_in_8bit=True)
transformer_8bit = MochiTransformer3DModel.from_pretrained(
"genmo/mochi-1-preview",
subfolder="transformer",
quantization_config=quant_config,
torch_dtype=torch.float16,
)
pipeline = MochiPipeline.from_pretrained(
"genmo/mochi-1-preview",
text_encoder=text_encoder_8bit,
transformer=transformer_8bit,
torch_dtype=torch.float16,
device_map="balanced",
)
video = pipeline(
"Close-up of a cat's eye, with the galaxy reflected in the cat's eye. Ultra high resolution 4k.",
num_inference_steps=28,
guidance_scale=3.5
).frames[0]
export_to_video(video, "cat.mp4")
6. 通过 ComfyUI 部署(消费级推荐)
ComfyUI 原生支持 MOCHI,社区提供 ComfyUI-MochiWrapper:
- RTX 4090 24GB:使用 bf16 + VAE tiling 工作流
- RTX 4080 16GB:使用 4-bit 量化工作流
- Camenduru 提供的 ComfyUI 工作流可在单卡 H100 上运行
7. LoRA 微调(单卡 H100/A100 80GB)
# Genmo 提供官方 LoRA trainer # 单卡 H100 或 A100 80GB 即可训练 # 详见 GitHub 仓库的 fine-tuning 文档 python -m genmo.mochi_preview.trainers.lora_trainer \ --data_path your_dataset \ --model_dir ./weights \ --lora_rank 64
加载 LoRA 推理:
python -m demos.cli --model_dir ./weights \ --lora_path path/to/your/lora.safetensors \ --prompt "your prompt here"
8. 第三方托管平台
通过 Replicate、fal.ai、Modal 等第三方推理主机调用 MOCHI:
- Modal 上单 H100 自托管成本约 $0.33/片段
- 适合无自有 GPU 的开发者快速试验
9. 部署前必检清单
- 确认仓库位于
github.com/genmoai/models(官方)与huggingface.co/genmo/mochi-1-preview(官方权重) - 商用部署审阅 Apache-2.0 许可(无附加限制,明确授予专利权)
- 全精度需 42GB+ VRAM;消费级硬件推荐 bf16 变体(22GB VRAM)+ CPU offload + VAE tiling
- RTX 4090 24GB 可运行 bf16 变体,但生成速度较慢(数分钟/片段)
- 当前版本仅 480p 输出,最长 5.4 秒;720p HD 版本以 Genmo 官方最新公告为准
- 仅支持文生视频,无图生视频(I2V)、无原生音频
- 第三方部署可选 Replicate、fal.ai、Modal 等推理主机
相关导航


Apertus

OLMo

FLUX

DeepSeek

Kimi

GPT-OSS

