
Colossal-AI是潞晨科技(HPCDLab)开源的集成式大模型训练系统,以多维分布式并行与异构内存管理为核心,覆盖混合精度、梯度累积、数据/张量/流水线并行、卸载等训练方法,并提供LoRA SFT与PPO/GRPO/DPO等后训练工具链,许可与最新版本以GitHub仓库为准。
项目概述
Colossal-AI由新加坡国立大学Ching Leung team与潞晨科技(HPCDLab)联合开发,GitHub Star近4万 ,是”站在巨人肩膀上”通过集成各类SOTA训练优化技术,让大模型训练更低成本、方便易用、高效扩展的系统化框架。
核心设计哲学:Colossal-AI是一个集成的系统,为用户提供一套综合的训练方法——既包含混合精度训练、梯度累积等常见训练方法,也提供数据并行、张量并行、流水线并行等多维并行技术,并通过异构内存卸载进一步优化训练效率 。
官方工作流(三段式):
- 准备配置文件:指定要使用的功能和参数
- 初始化分布式:用
colossalai.launch初始化分布式后端 - 注入训练特征:用
colossalai.booster将训练特征注入模型、优化器等训练组件,进行训练和测试
并行技术矩阵:
- 数据并行(Data Parallelism):多GPU数据并行训练
- 张量并行(Tensor Parallelism):通过不同的多维分布式矩阵乘法算法优化
- 流水线并行(Pipeline Parallelism):不同的流水线并行方法,跨节点有效扩展模型
- 专家并行(Expert Parallelism):MoE模型的专家并行
- ZeRO与Offload:灵活配置ZeRO优化与CPU/NVMe卸载策略
异构内存管理:
Colossal-AI提供先进的卸载(Offload)技术,将优化器状态、梯度、参数卸载至CPU内存或NVMe,使单GPU可训练比传统方法大数十倍的模型——官方展示用相同硬件训练20倍大的GPT-2、120倍大的模型(RTX 3080)、34倍大的PaLM 。
后训练工具链(ColossalChat):
- 低成本SFT:DeepSeek V3/R1满血671B LoRA低成本微调
- 完整RL工具链:PPO、GRPO、DPO、SimPO等偏好对齐算法
- HuggingFace兼容:无缝适配DeepSeek系列蒸馏模型在内的HF开源模型
- 硬件兼容:支持NVIDIA GPU、华为昇腾NPU等多种硬件
- 训练加速:混合精度训练、gradient checkpoint等
- 灵活配置:自定义奖励函数、损失函数、并行策略
典型性能数据 :
- 单机训练速度最高提升7.73倍
- 单卡推理速度提升1.42倍
- 单卡模型容量最多提升10.3倍
- 最小demo训练流程最低仅需1.62GB显存(任意消费级GPU)
- 单卡微调模型容量提升3.7倍
- Stable Diffusion训练显存消耗减少5.6倍,硬件成本最高降低46倍(从A100到RTX 3060)
许可与版本:以GitHub仓库 hpcaitech/ColossalAI 的 LICENSE 文件与最新 Release 为准。
💡 Colossal-AI的独特定位:它是”训练&微调”子分类中集成度最高的训练系统。与Megatron-Core(NVIDIA并行策略参考实现)、DeepSpeed(微软ZeRO优化器标杆)形成互补——Colossal-AI将二者能力以及其他SOTA优化技术集成到一个统一框架中,让用户通过配置文件即可启用多维并行、异构卸载、混合精度等优化。虽然Colossal-AI历史文档中包含推理优化(Energon-AI),但其核心职责是训练与后训练,不应归入”推理引擎”子分类。ColossalChat进一步提供LoRA SFT与PPO/GRPO/DPO等后训练工具链 ,使其兼具底层训练引擎与上层后训练框架的双重属性,但边界始终在”训练&微调”范畴内。
核心能力
- 多维并行集成:数据并行+张量并行+流水线并行+专家并行统一配置
- 异构内存卸载:CPU/NVMe卸载优化器状态、梯度、参数,单GPU训练超大模型
- 混合精度与梯度累积:FP16/BF16混合精度训练、梯度累积等常见训练方法
- Booster API:
colossalai.booster一行代码将训练特征注入模型与优化器,对用户代码零侵入 - LoRA低成本SFT:DeepSeek V3/R1 671B满血版LoRA低成本微调,仅需JSONL数据集
- 完整RL工具链:PPO、GRPO、DPO、SimPO等偏好对齐算法
- HuggingFace无缝适配:兼容DeepSeek系列蒸馏模型在内的HF开源模型
- 多硬件支持:NVIDIA GPU、华为昇腾NPU原生适配
- 训练加速技术:Gradient checkpoint、CUDA kernel fusion、混合精度等
- 灵活配置接口:自定义奖励函数、损失函数、并行策略
- AIGC训练优化:Stable Diffusion v1/v2训练显存减少5.6倍,硬件成本降低46倍
- 生物医药扩展:FastFold加速AlphaFold训练与推理,xTrimoMultimer 11倍加速蛋白质结构预测
优势亮点
- 集成度最高:将多维并行、异构卸载、混合精度、梯度累积等SOTA技术集成到统一框架,配置文件驱动
- 单GPU极致性价比:异构卸载让单张RTX 3080可训练120倍大的模型,消费级硬件训练门槛极低
- 后训练工具链完整:ColossalChat提供从LoRA SFT到PPO/GRPO/DPO的Full RLHF流水线
- DeepSeek 671B微调标杆:满血版DeepSeek V3/R1 LoRA低成本微调的开源参考实现
- 国产硬件原生支持:昇腾NPU适配,信创场景首选
- 性能数据亮眼:单机训练速度最高7.73倍提升,单卡模型容量10.3倍提升
- 跨领域扩展:除LLM外,AIGC(Stable Diffusion)、生物医药(AlphaFold)等领域均有深度优化
- GitHub近4万Star:社区活跃度高,HPCDLab持续维护
- 与Megatron-Core/DeepSpeed互补:既可独立使用,也可作为上层封装集成二者能力
局限
- 系统复杂度高:多维并行+异构卸载的组合配置需要深厚的分布式训练知识
- 文档与Megatron-Core/DeepSpeed有差距:作为集成框架,底层细节文档不如单一职责库完善
- Windows/macOS支持有限:官方仅验证Linux操作系统
- 最新版本与许可需查仓库:以GitHub仓库LICENSE与Release为准,本文不预设具体版本号
- 超大规模预训练生态:在万亿参数预训练场景,Megatron-Core仍是更多大厂的首选参考实现
- 推理能力非核心:虽有Energon-AI推理优化历史,但生产推理建议使用vLLM、SGLang等专用推理引擎
- Booster API学习成本:虽然对用户代码侵入小,但要充分发挥能力需理解Booster的封装机制
适用人群
- 追求单GPU极致性价比的团队:异构卸载让消费级硬件(RTX 3080)训练120倍大的模型
- DeepSeek 671B微调需求:满血版LoRA低成本SFT的开源参考实现
- 国产硬件(昇腾NPU)用户:原生适配,信创场景首选
- 需要完整RLHF流水线的团队:ColossalChat提供PPO/GRPO/DPO/SimPO全工具链
- AIGC训练场景:Stable Diffusion训练显存减少5.6倍,硬件成本降低46倍
- 生物医药AI:FastFold、xTrimoMultimer等扩展优化
- 框架开发者:可基于Colossal-AI的并行与卸载能力构建自定义训练框架
- 多硬件环境:NVIDIA GPU+昇腾NPU混合集群的统一训练框架
安装与部署
1. 环境要求
- Linux操作系统(官方仅验证Linux)
- Python 3.10+
- CUDA 12.x(GPU训练)
- PyTorch 2.x
2. 安装
# 从PyPI安装 pip install colossalai # 源码安装(启用CUDA kernel fusion,推荐) git clone https://github.com/hpcaitech/ColossalAI.git cd ColossalAI CUDA_EXT=1 pip install .
3. 官方三段式工作流
# 1. 准备配置文件(config.py)
# 指定并行策略、精度、卸载等参数
# 2. 初始化分布式(train.py)
import colossalai
parser = colossalai.get_default_parser()
args = parser.parse_args()
colossalai.launch(
rank=args.rank,
world_size=args.world_size,
host=args.host,
port=args.port,
backend=args.backend # 默认nccl
)
# 3. 注入训练特征
from colossalai import booster
from colossalai.booster import Booster
from colossalai.booster.plugins import GeminiPlugin, HybridParallelPlugin
# 配置插件(如HybridParallelPlugin支持TP/PP/SP组合)
plugin = HybridParallelPlugin(
tp_size=8,
pp_size=4,
sp_size=2,
zero_stage=1,
precision='bf16',
)
booster = Booster(plugin=plugin)
model, optimizer, dataloader, _, _ = booster.boost(model, optimizer, dataloader)
# 4. 训练循环
for data in dataloader:
outputs = model(data)
loss = outputs.mean()
booster.backward(loss, optimizer)
optimizer.step()
4. 分布式启动
# 单节点多卡 colossalai run --nproc_per_node=8 train.py # 多节点训练 colossalai run --nproc_per_node=8 --nnodes=2 \ --master_addr=192.168.0.1 --master_port=29500 train.py
5. DeepSeek V3/R1 671B LoRA SFT(ColossalChat)
# 1. 准备JSONL数据集
# 每行格式:
# [{"role": "user", "content": "你好,最近怎么样?"},
# {"role": "assistant", "content": "我很好.今天有什么可以帮你的吗?"}]
# 2. 运行LoRA SFT脚本
cd applications/ColossalChat/examples/training_scripts
bash lora_sft_deepseek_671b.sh
6. PPO/GRPO/DPO训练(ColossalChat)
# PPO训练 bash ppo_train.sh # GRPO训练(推理模型对齐) bash grpo_train.sh # DPO训练 bash dpo_train.sh
7. 异构卸载配置示例
from colossalai.booster.plugins import GeminiPlugin
# GeminiPlugin自动管理CPU/NVMe卸载
plugin = GeminiPlugin(
precision='bf16',
zero_stage=3,
offload_optim_placeholder=True, # 优化器卸载至CPU
)
8. Stable Diffusion训练加速
cd examples/images/diffusion # 显存减少5.6倍,硬件成本降低46倍(A100→RTX 3060) python train_stable_diffusion.py --plugin colossalai
9. 部署前必检清单
- 确认仓库位于
github.com/hpcaitech/ColossalAI(官方) - 许可与最新版本以GitHub仓库LICENSE与Release为准
- 官方仅验证Linux操作系统,Windows/macOS未经测试
- 推荐源码安装并启用CUDA_EXT=1以开启CUDA kernel fusion
- 单GPU极致性价比场景:使用GeminiPlugin异构卸载
- 多卡训练:使用HybridParallelPlugin配置TP/PP/SP组合
- DeepSeek 671B LoRA SFT参考ColossalChat应用脚本
- 生产环境推理部署需配合vLLM、SGLang等专用推理引擎——Colossal-AI核心职责是训练与后训练
相关导航


DeepSpeed
OpenRLHF

PEFT

TorchTune

LlamaFactory

TRL

