
智谱清影是智谱 AI 于 2024 年 7 月 26 日发布的 AI 视频生成工具,以”CogVideoX 开源模型 + 清影 C 端免费不限次 + 4K/60fps 升级 + 中文提示词遵循最强 + 可本地部署”为核心差异化。清影的突破口是”开源可自托管 + C 端零成本试错 + 清华系技术背书“——它不是去拼电影级长片(那是 Veo/Sora/可灵的战场),而是把”开发者友好 + 新手零门槛 + 学术研究可复现“做到国产第一,让用户和企业在”不被锁定”的前提下使用视频生成能力 。
💡 一句话理解智谱清影:它是 智谱 AI 的 C 端视频生成产品(基于 CogVideoX 模型)——以”文生视频/图生视频 + 6 秒 30 秒极速出片(初代)→ 10 秒 4K 60fps + AI 音效(2.0 升级)+ 多风格(卡通3D/油画/黑白/电影感)+ 老照片动起来 + C 端免费不限次 + 付费加速 5元/日或199元/年 + 开放平台 CogVideoX-2 ¥0.5/请求、CogVideoX-3 ¥1/请求 + CogVideoX 权重开源可本地部署(2B 约 16GB 显存)“为核心;与可灵的”长时序”、Runway 的”Motion Brush”、Veo 的”Google 生态”、Sora 的”ChatGPT 生态”、即梦的”剪映闭环”、Pika 的”社交特效”路线均不重叠。清影的差异化在于”开源+免费+清华系+中文遵循最强“——但代价是单次时长偏短(6-10 秒)、排队等待、电影级长片叙事能力弱于可灵。
产品概述
清影是智谱 AI 于 2024 年 7 月 26 日在 Open Day 上发布的 AI 视频生成工具,基于自研 CogVideoX 模型(DiT 架构 + 3D VAE + Expert Transformer)。
模型演进:
- CogVideoX(初代):2024 年 7 月发布,6 秒时长、1440×960 分辨率、16fps,理论上 30 秒出片
- CogVideoX 1.5:2024 年 11 月升级,1360×768 分辨率、16fps、5-10 秒时长
- 清影 2.0(CogVideoX v1.5 驱动):10 秒时长、4K 分辨率、60fps、AI 音效生成(CogSound 同步音频)
- 开源权重:CogVideoX-2B(Apache 2.0,约 16GB 显存可跑)、CogVideoX-5B(CogVideoX License),ICLR 2025 论文收录
视频生成核心规格 :
- 单次时长:C 端 5-10 秒(初代 6 秒 → 2.0 升级 10 秒);开源 2B 约 6 秒
- 最高分辨率:4K(2.0 升级)
- 帧率:60fps(2.0 升级)
- 画幅:3:2(1440×960 初代)→ 支持多画幅
- 输入模态:文本、图像(文生视频/图生视频)
多风格渲染:卡通 3D、黑白、油画、电影感、皮克斯风格、动漫风格、摄影风格 。
入口矩阵:
| 入口 | 受众 | 计费方式 |
|---|---|---|
| chatglm.cn/video(网页端) | C 端创作者主入口 | 免费不限次 + 付费加速 |
| 智谱清言 App / 小程序 | 移动创作者 | 免费不限次 + 付费加速 |
| 开放平台 bigmodel.cn | 开发者/企业 | CogVideoX-2 ¥0.5/请求、CogVideoX-3 ¥1/请求 |
| 开源权重(GitHub/HuggingFace) | 开发者/研究者 | 免费,自托管 |
核心能力
1. 文生视频 / 图生视频
- 文生视频:输入不超过 1000 字的文本描述,生成 5-10 秒动态视频
- 图生视频:上传静态图片,CogVideoX 理解画面语义生成动态效果(如老照片动起来、商品图动态化)
- 老照片动起来:小程序一键让黑白老照片上色 + 动态化
2. 中文提示词遵循(清影的招牌能力)
- CogVideoX 是开源视频模型中对复杂多从句提示词遵循最强的模型
- 清华系技术背书,中文语义理解精准
- 这也是清影相对海外开源模型(HunyuanVideo、Wan)的显著差异化优势
3. 多风格渲染
- 支持卡通 3D、黑白、油画、电影感、皮克斯风格、动漫风格、摄影风格等十余种风格
- 智能风格迁移:一键改变视频整体视觉效果
4. AI 音效生成(CogSound,2.0 升级)
- 2.0 升级后引入 CogSound 模型,视频生成同时输出同步音效
- 10 秒 1080p 输出可带同步音频
4K / 60fps 超高清(2.0 升级)
- 2024 年 11 月 8 日升级后,清影支持生成 10 秒、4K、60fps 超高清视频
- 这是国产视频工具中纸面参数最高的规格之一
6. 运镜控制
- 支持推、拉、平移、跟随等基础运镜
- “相机可以平滑跟随画面中三只狗的移动”——多主体运镜遵循能力
7. 开源与本地部署(清影的独门绝技)
- CogVideoX-2B:Apache 2.0 许可,单张约 16GB 显存消费级 GPU 即可运行(GTX 1080 Ti 亦可)
- CogVideoX-5B:CogVideoX License,开源权重
- CogKit 微调框架:支持 LoRA 微调
- ComfyUI 集成:社区提供数百个工作流
- MIT/Apache 2.0 许可:可商用、可自托管、可微调
- 这是清影相对 Sora(封闭)、可灵(封闭)、Runway(封闭)的根本性差异化——它是 2026 年少数可真正自托管、可微调的开源视频模型
8. 开放平台 API
- CogVideoX-2:¥0.5/请求(批量 ¥0.25/请求)
- CogVideoX-3:¥1/请求
- OpenAI 兼容接口,新账号赠送约 ¥18 测试额度
收费模式
清影采用” C 端免费不限次 + 付费加速 + 开放平台按请求计费 + 开源免费自托管”四轨制 。
1. C 端(chatglm.cn/video / 智谱清言 App)
| 套餐 | 价格 | 权益 |
|---|---|---|
| 免费版 | ¥0 | 不限次生成,但需排队(约 1 分钟起,高峰期 5-18 分钟) |
| 24 小时加速包 | ¥5 | 解锁一天高速通道权益,优先队列 |
| 1 年加速包 | ¥199 | 解锁一年高速通道权益 |
| 会员(第三方渠道参考) | 连续包月 ¥19-39/月、季卡 ¥109、年卡 ¥399 | 优先生成 + 去水印 + 15 秒 4K 60fps 生成 |
💡 关键特点:清影 C 端基础功能完全免费、不限次 ——这是国产视频工具中唯一的”真免费不限次”政策,可灵/即梦都需要消耗积分。
2. 开放平台 API(bigmodel.cn)
| 模型 | 单价 | 批量价 |
|---|---|---|
| CogVideoX-2 | ¥0.5/请求 | ¥0.25/请求 |
| CogVideoX-3 | ¥1/请求 | 不支持批量 |
⚠️ 新账号赠送约 ¥18 测试额度,可生成约 18-36 条视频
3. 自托管成本
- CogVideoX-2B 开源权重免费下载
- 单张 16GB 显存 GPU 即可推理(如 RTX 4060 Ti 16GB、RTX 4080 等消费级显卡)
- 本地部署无按次费用,但需自备硬件
4. 成本对比
| 工具 | 单条 10 秒视频成本(约) |
|---|---|
| 清影 C 端免费版 | ¥0(排队等待) |
| 清影 24h 加速包 | ¥5/天不限次 |
| 清影 API(CogVideoX-2) | ¥0.5/请求 |
| 清影 API(CogVideoX-3) | ¥1/请求 |
| 即梦 AI(基础会员) | 约 ¥3.6 |
| 可灵 AI(国内站黄金) | 首月 ¥46 月费 |
| Runway(Standard $12/月) | 约 $1.2 |
| Veo 3.1 Lite API | $0.50 |
💡 清影是 2026 年国产视频工具中”真免费”的代表——不限次生成 0 成本,付费仅为加速;API 端 ¥0.5-1/请求也是全网最低之一。
优势亮点
🎬 C 端真免费不限次
所有用户均可免费、不限次使用文生视频/图生视频 ——这是相对可灵(每日 6 次免费)、即梦(每日 60 积分)的最大差异化优势。
🎬 开源可自托管(独门绝技)
CogVideoX-2B 以 Apache 2.0 许可开源,消费级 GPU(16GB 显存)即可本地部署 ——对数据隐私有要求的企业、高校、科研机构,这是除 Wan2.1 外唯一可行的国产开源选项 。
🎬 中文提示词遵循最强
CogVideoX 是开源视频模型中对复杂多从句中文提示词遵循最强的模型 ——清华系技术积累的体现。
🎬 4K / 60fps 纸面规格最高
2.0 升级后支持 10 秒 4K 60fps 输出 ——国产视频工具中纸面参数最高 。
🎬 CogSound 同步音效
2.0 升级引入 CogSound,视频生成同时输出同步音效 ——具备音画同步能力。
🎬 多风格渲染
卡通 3D、油画、黑白、电影感、皮克斯、动漫、摄影等十余种风格 ——创意表达最多元。
🎬 老照片动起来
“老照片动起来”小程序一键让黑白老照片上色 + 动态化 ——怀旧、亲情、教育场景的杀手锏功能 。
🎬 API 极便宜
CogVideoX-2 ¥0.5/请求、CogVideoX-3 ¥1/请求 ——开发者批量调用成本全网最低之一 。
🎬 清华系学术背书
ICLR 2025 收录,GitHub 超 12,700 stars ——学术认可度国产最高 。
局限与风险
⚠️ 单次时长偏短
C 端最长 10 秒(2.0 升级后),开源 2B 仅 6 秒 ——远不及可灵(15 秒+续写 3 分钟)、Runway(60 秒)、Veo 3.1(场景延展 148 秒)。不适合长视频叙事 。
⚠️ 排队等待
免费用户需要排队,约 1 分钟起,高峰期 18 分钟甚至更久 ——生产效率受限,必须购买加速包 。
⚠️ 电影级写实质感弱于可灵/Veo/Sora
清影输出质量”competitive but not category-leading” ——极限电影写实场景仍首选可灵 3.0 / Veo 3.1 / Sora 2。
⚠️ 人物生成质量偏弱
CogVideoX 开源模型在人体真实感、运动合理性维度弱于场景/物体生成 ——人物特写、复杂动作易崩 。
⚠️ 角色一致性跨镜头会漂移
3 分钟成片测试中,清影角色崩坏率 13.9% ——虽然优于多数付费工具,但跨 20 段拼接后人物连续性丢失严重 。
⚠️ 功能基础,缺少专业级控制
没有 Motion Brush、没有首尾帧锁定、没有多镜头叙事编排 ——专业影视工作流仍需可灵/Runway 。
⚠️ 画风选择少,迭代速度慢
相对即梦 Seedance 2.5 的快速迭代,清影的模型更新节奏偏慢 。
⚠️ 开源模型仅接受英文提示词
开源 CogVideoX 权重只接受英文提示词(224-226 token 限制)——中文用户需用 C 端清影产品(内置翻译)或外部翻译工具 。
⚠️ 会员体系不统一
C 端付费加速(5 元/日、199 元/年)与第三方渠道会员(¥19-39/月)并存,权益边界不清晰 。
适用场景
核心用户:AI 视频新手、零成本试错用户、教育/科研机构、需要本地部署的企业、开发者/研究人员、老照片动态化需求者、轻量级内容创作者 。
最佳适用场景 ✅:
- 新手零成本试错:免费不限次,无需积分焦虑
- 教育与科研:CogVideoX 开源可复现,高校 AI 视频课程首选
- 企业本地部署:数据不出本地,满足合规要求(16GB 显存即可)
- 老照片/老素材活化:”老照片动起来”小程序一键上色+动态化
- 中文多从句提示词场景:CogVideoX 对复杂中文提示词遵循最强
- 轻量级短视频:风景、动物、超现实、人文历史类内容(清影的强项领域)
- 开发者批量调用:API ¥0.5-1/请求,成本极低
- 快速概念验证:AI 短剧/广告前期 30 秒出片验证创意
不适用场景 ❌:
- 电影级写实长片 → 可灵 3.0 / Veo 3.1 / Sora 2 更强
- >30 秒长视频叙事 → 可灵(3 分钟续写)/ Runway(60 秒)
- 导演级运动控制 → Runway Motion Brush
- 抖音/视频号一站式闭环 → 即梦(剪映生态)
- 社交爆款特效 → Pika(Pikaffects)
- 复杂人物/多人互动 → 清影人物生成质量偏弱
- 4K 商业广告 → 虽然清影纸面支持 4K,但实际写实质感弱于可灵 3.0 / Veo 3.1







