智谱清影

2周前发布 19 0 0

智谱 AI 基于 CogVideoX 模型的 C 端视频生成产品

所在地:
中国
语言:
中文
收录时间:
2026-08-30
智谱清影智谱清影

智谱清影是智谱 AI 于 2024 年 7 月 26 日发布的 AI 视频生成工具,以”CogVideoX 开源模型 + 清影 C 端免费不限次 + 4K/60fps 升级 + 中文提示词遵循最强 + 可本地部署”为核心差异化。清影的突破口是”开源可自托管 + C 端零成本试错 + 清华系技术背书“——它不是去拼电影级长片(那是 Veo/Sora/可灵的战场),而是把”开发者友好 + 新手零门槛 + 学术研究可复现“做到国产第一,让用户和企业在”不被锁定”的前提下使用视频生成能力 。

💡 一句话理解智谱清影:它是 智谱 AI 的 C 端视频生成产品(基于 CogVideoX 模型)——以”文生视频/图生视频 + 6 秒 30 秒极速出片(初代)→ 10 秒 4K 60fps + AI 音效(2.0 升级)+ 多风格(卡通3D/油画/黑白/电影感)+ 老照片动起来 + C 端免费不限次 + 付费加速 5元/日或199元/年 + 开放平台 CogVideoX-2 ¥0.5/请求、CogVideoX-3 ¥1/请求 + CogVideoX 权重开源可本地部署(2B 约 16GB 显存)“为核心;与可灵的”长时序”、Runway 的”Motion Brush”、Veo 的”Google 生态”、Sora 的”ChatGPT 生态”、即梦的”剪映闭环”、Pika 的”社交特效”路线均不重叠。清影的差异化在于”开源+免费+清华系+中文遵循最强“——但代价是单次时长偏短(6-10 秒)、排队等待、电影级长片叙事能力弱于可灵

 

产品概述

清影是智谱 AI 于 2024 年 7 月 26 日在 Open Day 上发布的 AI 视频生成工具,基于自研 CogVideoX 模型(DiT 架构 + 3D VAE + Expert Transformer)

模型演进

  • CogVideoX(初代):2024 年 7 月发布,6 秒时长、1440×960 分辨率、16fps,理论上 30 秒出片
  • CogVideoX 1.5:2024 年 11 月升级,1360×768 分辨率、16fps、5-10 秒时长
  • 清影 2.0(CogVideoX v1.5 驱动)10 秒时长、4K 分辨率、60fps、AI 音效生成(CogSound 同步音频)
  • 开源权重:CogVideoX-2B(Apache 2.0,约 16GB 显存可跑)、CogVideoX-5B(CogVideoX License),ICLR 2025 论文收录

视频生成核心规格​ :

  • 单次时长:C 端 5-10 秒(初代 6 秒 → 2.0 升级 10 秒);开源 2B 约 6 秒
  • 最高分辨率:4K(2.0 升级)
  • 帧率:60fps(2.0 升级)
  • 画幅:3:2(1440×960 初代)→ 支持多画幅
  • 输入模态:文本、图像(文生视频/图生视频)

多风格渲染:卡通 3D、黑白、油画、电影感、皮克斯风格、动漫风格、摄影风格 。

入口矩阵

入口 受众 计费方式
chatglm.cn/video(网页端) C 端创作者主入口 免费不限次 + 付费加速
智谱清言 App / 小程序 移动创作者 免费不限次 + 付费加速
开放平台 bigmodel.cn 开发者/企业 CogVideoX-2 ¥0.5/请求、CogVideoX-3 ¥1/请求
开源权重(GitHub/HuggingFace) 开发者/研究者 免费,自托管

 

核心能力

1. 文生视频 / 图生视频

  • 文生视频:输入不超过 1000 字的文本描述,生成 5-10 秒动态视频
  • 图生视频:上传静态图片,CogVideoX 理解画面语义生成动态效果(如老照片动起来、商品图动态化)
  • 老照片动起来:小程序一键让黑白老照片上色 + 动态化

2. 中文提示词遵循(清影的招牌能力)

  • CogVideoX 是开源视频模型中对复杂多从句提示词遵循最强的模型
  • 清华系技术背书,中文语义理解精准
  • 这也是清影相对海外开源模型(HunyuanVideo、Wan)的显著差异化优势

3. 多风格渲染

  • 支持卡通 3D、黑白、油画、电影感、皮克斯风格、动漫风格、摄影风格等十余种风格
  • 智能风格迁移:一键改变视频整体视觉效果

4. AI 音效生成(CogSound,2.0 升级)

  • 2.0 升级后引入 CogSound 模型,视频生成同时输出同步音效
  • 10 秒 1080p 输出可带同步音频

4K / 60fps 超高清(2.0 升级)

  • 2024 年 11 月 8 日升级后,清影支持生成 10 秒、4K、60fps​ 超高清视频
  • 这是国产视频工具中纸面参数最高的规格之一

6. 运镜控制

  • 支持推、拉、平移、跟随等基础运镜
  • “相机可以平滑跟随画面中三只狗的移动”——多主体运镜遵循能力

7. 开源与本地部署(清影的独门绝技)

  • CogVideoX-2B:Apache 2.0 许可,单张约 16GB 显存消费级 GPU 即可运行(GTX 1080 Ti 亦可)
  • CogVideoX-5B:CogVideoX License,开源权重
  • CogKit 微调框架:支持 LoRA 微调
  • ComfyUI 集成:社区提供数百个工作流
  • MIT/Apache 2.0 许可:可商用、可自托管、可微调
  • 这是清影相对 Sora(封闭)、可灵(封闭)、Runway(封闭)的根本性差异化——它是 2026 年少数可真正自托管、可微调的开源视频模型

8. 开放平台 API

  • CogVideoX-2:¥0.5/请求(批量 ¥0.25/请求)
  • CogVideoX-3:¥1/请求
  • OpenAI 兼容接口,新账号赠送约 ¥18 测试额度

 

收费模式

清影采用” C 端免费不限次 + 付费加速 + 开放平台按请求计费 + 开源免费自托管”四轨制​ 。

1. C 端(chatglm.cn/video / 智谱清言 App)

套餐 价格 权益
免费版 ¥0 不限次生成,但需排队(约 1 分钟起,高峰期 5-18 分钟)
24 小时加速包 ¥5 解锁一天高速通道权益,优先队列
1 年加速包 ¥199 解锁一年高速通道权益
会员(第三方渠道参考) 连续包月 ¥19-39/月、季卡 ¥109、年卡 ¥399 优先生成 + 去水印 + 15 秒 4K 60fps 生成

💡 关键特点:清影 C 端基础功能完全免费、不限次​ ——这是国产视频工具中唯一的”真免费不限次”政策,可灵/即梦都需要消耗积分。

2. 开放平台 API(bigmodel.cn)

模型 单价 批量价
CogVideoX-2 ¥0.5/请求 ¥0.25/请求
CogVideoX-3 ¥1/请求 不支持批量

⚠️ 新账号赠送约 ¥18 测试额度,可生成约 18-36 条视频

3. 自托管成本

  • CogVideoX-2B 开源权重免费下载
  • 单张 16GB 显存 GPU 即可推理(如 RTX 4060 Ti 16GB、RTX 4080 等消费级显卡)
  • 本地部署无按次费用,但需自备硬件

4. 成本对比

工具 单条 10 秒视频成本(约)
清影 C 端免费版 ¥0(排队等待)
清影 24h 加速包 ¥5/天不限次
清影 API(CogVideoX-2) ¥0.5/请求
清影 API(CogVideoX-3) ¥1/请求
即梦 AI(基础会员) 约 ¥3.6
可灵 AI(国内站黄金) 首月 ¥46 月费
Runway(Standard $12/月) 约 $1.2
Veo 3.1 Lite API $0.50

💡 清影是 2026 年国产视频工具中”真免费”的代表——不限次生成 0 成本,付费仅为加速;API 端 ¥0.5-1/请求也是全网最低之一。

 

优势亮点

🎬 C 端真免费不限次

所有用户均可免费、不限次使用文生视频/图生视频 ——这是相对可灵(每日 6 次免费)、即梦(每日 60 积分)的最大差异化优势。

🎬 开源可自托管(独门绝技)

CogVideoX-2B 以 Apache 2.0 许可开源,消费级 GPU(16GB 显存)即可本地部署​ ——对数据隐私有要求的企业、高校、科研机构,这是除 Wan2.1 外唯一可行的国产开源选项​ 。

🎬 中文提示词遵循最强

CogVideoX 是开源视频模型中对复杂多从句中文提示词遵循最强的模型 ——清华系技术积累的体现。

🎬 4K / 60fps 纸面规格最高

2.0 升级后支持 10 秒 4K 60fps 输出 ——国产视频工具中纸面参数最高 。

🎬 CogSound 同步音效

2.0 升级引入 CogSound,视频生成同时输出同步音效 ——具备音画同步能力。

🎬 多风格渲染

卡通 3D、油画、黑白、电影感、皮克斯、动漫、摄影等十余种风格 ——创意表达最多元。

🎬 老照片动起来

“老照片动起来”小程序一键让黑白老照片上色 + 动态化 ——怀旧、亲情、教育场景的杀手锏功能 。

🎬 API 极便宜

CogVideoX-2 ¥0.5/请求、CogVideoX-3 ¥1/请求 ——开发者批量调用成本全网最低之一 。

🎬 清华系学术背书

ICLR 2025 收录,GitHub 超 12,700 stars ——学术认可度国产最高 。

 

局限与风险

⚠️ 单次时长偏短

C 端最长 10 秒(2.0 升级后),开源 2B 仅 6 秒 ——远不及可灵(15 秒+续写 3 分钟)、Runway(60 秒)、Veo 3.1(场景延展 148 秒)。不适合长视频叙事 。

⚠️ 排队等待

免费用户需要排队,约 1 分钟起,高峰期 18 分钟甚至更久​ ——生产效率受限,必须购买加速包 。

⚠️ 电影级写实质感弱于可灵/Veo/Sora

清影输出质量”competitive but not category-leading” ——极限电影写实场景仍首选可灵 3.0 / Veo 3.1 / Sora 2。

⚠️ 人物生成质量偏弱

CogVideoX 开源模型在人体真实感、运动合理性维度弱于场景/物体生成 ——人物特写、复杂动作易崩 。

⚠️ 角色一致性跨镜头会漂移

3 分钟成片测试中,清影角色崩坏率 13.9% ——虽然优于多数付费工具,但跨 20 段拼接后人物连续性丢失严重 。

⚠️ 功能基础,缺少专业级控制

没有 Motion Brush、没有首尾帧锁定、没有多镜头叙事编排 ——专业影视工作流仍需可灵/Runway 。

⚠️ 画风选择少,迭代速度慢

相对即梦 Seedance 2.5 的快速迭代,清影的模型更新节奏偏慢 。

⚠️ 开源模型仅接受英文提示词

开源 CogVideoX 权重只接受英文提示词(224-226 token 限制)——中文用户需用 C 端清影产品(内置翻译)或外部翻译工具 。

⚠️ 会员体系不统一

C 端付费加速(5 元/日、199 元/年)与第三方渠道会员(¥19-39/月)并存,权益边界不清晰 。

 

适用场景

核心用户:AI 视频新手、零成本试错用户、教育/科研机构、需要本地部署的企业、开发者/研究人员、老照片动态化需求者、轻量级内容创作者 。

最佳适用场景​ ✅:

  • 新手零成本试错:免费不限次,无需积分焦虑
  • 教育与科研:CogVideoX 开源可复现,高校 AI 视频课程首选
  • 企业本地部署:数据不出本地,满足合规要求(16GB 显存即可)
  • 老照片/老素材活化:”老照片动起来”小程序一键上色+动态化
  • 中文多从句提示词场景:CogVideoX 对复杂中文提示词遵循最强
  • 轻量级短视频:风景、动物、超现实、人文历史类内容(清影的强项领域)
  • 开发者批量调用:API ¥0.5-1/请求,成本极低
  • 快速概念验证:AI 短剧/广告前期 30 秒出片验证创意

不适用场景​ ❌:

  • 电影级写实长片​ → 可灵 3.0 / Veo 3.1 / Sora 2 更强
  • >30 秒长视频叙事​ → 可灵(3 分钟续写)/ Runway(60 秒)
  • 导演级运动控制​ → Runway Motion Brush
  • 抖音/视频号一站式闭环​ → 即梦(剪映生态)
  • 社交爆款特效​ → Pika(Pikaffects)
  • 复杂人物/多人互动​ → 清影人物生成质量偏弱
  • 4K 商业广告​ → 虽然清影纸面支持 4K,但实际写实质感弱于可灵 3.0 / Veo 3.1

相关导航