阿里达摩院出品,支持600+ LLM与400+多模态模型的CPT/SFT/DPO/GRPO全流程。提供swift sft/rlhf/infer/deploy/eval/export完整CLI,集成Megatron-SWIFT超大规模并行,国产模型友好,Apache-2.0许可。
产品概述
MS-SWIFT(简称 swift)是阿里云 ModelScope 社区与达摩院联合开发的大模型统一训练与部署框架,以 AAAI 2025 论文为学术背书。框架定位为”模型即服务”时代的训练基础设施,覆盖从预训练(CPT)、指令微调(SFT)、偏好对齐(DPO/GRPO)到推理部署的完整链路,尤其擅长多模态模型与国产芯片适配。
支持的模型规模:
- 600+ 大语言模型(Qwen、DeepSeek、ChatGLM、Yi、Baichuan、InternLM、Llama、Mistral、Gemma 等)
- 400+ 多模态模型(Qwen-VL、InternVL、LLaVA、CogVLM、Florence-2、MiniCPM-V 等)
- 支持 MoE 架构(DeepSeek-V2/V3、Qwen2-MoE、Mixtral)
支持的训练范式:
- CPT:继续预训练(Continue Pre-Training)
- SFT:监督微调(Supervised Fine-Tuning)
- DPO/CPO/ORPO/KTO:偏好对齐
- GRPO:群体相对策略优化(推理模型训练关键)
- RLHF:基于人类反馈的强化学习(PPO)
支持的微调方法:
- LoRA / QLoRA / DoRA / LoRA+
- GaLore / BAdam / APOLLO
- 全参数微调(Full)
- 冻结微调(Freeze)
分布式训练引擎:
- Megatron-SWIFT:基于 Megatron-Core 的超大规模并行训练,支持张量并行+流水线并行+序列并行+专家并行
- DeepSpeed:ZeRO-1/2/3
- FSDP / FSDP2
量化与推理:
- 训练量化:QLoRA 2/3/4/5/6/8-bit
- 导出量化:GPTQ、AWQ、bitsandbytes
- 推理引擎:vLLM、SGLang、LMDeploy
许可策略:Apache-2.0 许可,允许商用、修改、再分发。
💡 MS-SWIFT 的独特定位:它是阿里云生态下最全面的训练框架,与 LlamaFactory(北航社区驱动)形成互补。MS-SWIFT 的优势在于阿里云基础设施深度集成(PAI、DashScope)、多模态模型支持数量最多(400+)、以及 Megatron-SWIFT 超大规模并行能力。框架附带的推理/部署能力仅作为训练后的测试验证工具,不应归入”推理引擎”或”API封装”子分类。
核心能力
- 600+ LLM + 400+ 多模态统一入口:同一套 CLI 命令训练不同架构模型,自动匹配对话模板与 LoRA 目标层
- 完整训练生命周期:CPT → SFT → DPO/GRPO → 评估 → 导出 → 部署
- Megatron-SWIFT 超大规模并行:支持千亿参数模型的张量/流水线/序列/专家并行训练
- 多模态训练专长:Qwen-VL、InternVL、LLaVA、CogVLM 等图文模型训练流程深度优化
- GRPO 推理模型训练:支持 DeepSeek-R1 风格的群体相对策略优化,是推理模型微调的关键能力
- 国产芯片适配:昇腾 NPU、寒武纪、昆仑芯等国产硬件原生支持
- 50+ 内置数据集:含中文数据集(alpaca_zh、firefly、moss 等),支持自定义数据集
- 一键部署:训练完成后可直接启动 vLLM/SGLang 推理服务
- 模型评估:集成 eval 模块,支持标准 benchmark 评测
- 模型导出:合并 LoRA、量化导出、HuggingFace 格式
优势亮点
- 阿里云生态深度集成:与 PAI(机器学习平台)、DashScope(模型服务)无缝对接,企业级部署路径清晰
- 多模态模型支持最广:400+ 多模态模型,覆盖视觉、文档、图表、OCR 等各类图文理解任务
- Megatron-SWIFT 超大规模并行:基于 Megatron-Core 的工业级并行方案,千亿参数训练稳定
- GRPO 支持:推理模型微调(如 DeepSeek-R1 风格)的关键能力,领先多数社区框架
- 国产芯片原生适配:昇腾、寒武纪、昆仑芯等国产硬件 Day-0 支持,国产算力场景首选
- Apache-2.0 最干净许可:商用无门槛,与 LlamaFactory、Axolotl 并列
- AAAI 2025 学术背书:论文提供学术严谨性保证
- ModelScope 社区生态:与 ModelScope 模型库深度绑定,模型下载、数据集管理、社区交流一体化
局限
- 社区活跃度不及 LlamaFactory:GitHub Stars 约 6K+,Issues 响应速度较慢
- 文档中英文混杂:部分文档仅有中文,国际化体验待提升
- WebUI 不如 LlamaBoard 成熟:虽然有 Gradio 界面,但功能与易用性不及 LlamaFactory
- 超大规模预训练仍需 Megatron-Core 原生:Megatron-SWIFT 是对接层,复杂训练策略仍需直接操作 Megatron-Core
- 消费级硬件文档较少:QLoRA 微调的消费级硬件配置指南不如 LlamaFactory 详尽
- 某些前沿算法滞后:最新 RL 算法(如 DAPO、REINFORCE++)可能滞后 veRL 等专职框架
适用人群
- 阿里云企业用户:已使用阿里云 PAI、DashScope 的企业,MS-SWIFT 是最佳集成方案
- 多模态模型微调团队:400+ 多模态模型支持,视觉语言模型定制首选
- 国产算力用户:昇腾、寒武纪等国产芯片原生适配,信创场景首选
- 千亿参数超大规模训练:Megatron-SWIFT 提供工业级并行方案
- 推理模型(R1风格)微调:GRPO 支持,适合研究 DeepSeek-R1 训练方法
- ModelScope 生态用户:与 ModelScope 模型库深度绑定,模型下载与管理便捷
安装与部署
1. 硬件需求参考
| 训练方法 |
7B |
14B |
70B |
| 全参 BF16 |
120GB |
240GB |
1200GB |
| LoRA 16-bit |
16GB |
32GB |
160GB |
| QLoRA 4-bit |
6GB |
12GB |
48GB |
2. 安装
pip install ms-swift
# 或源码安装
git clone https://github.com/modelscope/ms-swift.git
cd ms-swift
pip install -e .
3. SFT 微调示例
# Qwen2.5-7B-Instruct LoRA SFT
swift sft \
--model_type qwen2_5-7b-instruct \
--dataset alpaca_zh \
--sft_type lora \
--output_dir output
4. DPO 对齐
swift rlhf \
--rlhf_type dpo \
--model_type qwen2_5-7b-instruct \
--dataset hh_rlhf_cn \
--sft_type lora \
--output_dir output-dpo
5. GRPO 训练(推理模型)
swift rlhf \
--rlhf_type grpo \
--model_type qwen2_5-7b-instruct \
--dataset math_grpo \
--output_dir output-grpo
6. 多模态模型微调
swift sft \
--model_type qwen-vl-chat \
--dataset coco-en-mini \
--sft_type lora \
--output_dir output-vl
7. 部署为 API
swift deploy \
--model_type qwen2_5-7b-instruct \
--sft_type lora \
--ckpt_dir output/vx-xxx/checkpoint-xxx
8. 部署前必检清单
- 确认仓库位于
github.com/modelscope/ms-swift
- 商用部署:Apache-2.0 允许商用
- 国产芯片用户参考官方 Ascend 安装文档
- 多模态模型训练需注意显存占用(VL 模型通常更大)