MS-SWIFT翻译站点

3周前发布 15 0 0

阿里达摩院开源,600+模型统一训练与部署的全栈框架。

所在地:
美国
语言:
英文
收录时间:
2026-08-21
MS-SWIFTMS-SWIFT

阿里达摩院出品,支持600+ LLM与400+多模态模型的CPT/SFT/DPO/GRPO全流程。提供swift sft/rlhf/infer/deploy/eval/export完整CLI,集成Megatron-SWIFT超大规模并行,国产模型友好,Apache-2.0许可。

 

产品概述

MS-SWIFT(简称 swift)是阿里云 ModelScope 社区与达摩院联合开发的大模型统一训练与部署框架,以 AAAI 2025 论文为学术背书。框架定位为”模型即服务”时代的训练基础设施,覆盖从预训练(CPT)、指令微调(SFT)、偏好对齐(DPO/GRPO)到推理部署的完整链路,尤其擅长多模态模型与国产芯片适配。

 

支持的模型规模

  • 600+ 大语言模型(Qwen、DeepSeek、ChatGLM、Yi、Baichuan、InternLM、Llama、Mistral、Gemma 等)
  • 400+ 多模态模型(Qwen-VL、InternVL、LLaVA、CogVLM、Florence-2、MiniCPM-V 等)
  • 支持 MoE 架构(DeepSeek-V2/V3、Qwen2-MoE、Mixtral)

 

支持的训练范式

  • CPT:继续预训练(Continue Pre-Training)
  • SFT:监督微调(Supervised Fine-Tuning)
  • DPO/CPO/ORPO/KTO:偏好对齐
  • GRPO:群体相对策略优化(推理模型训练关键)
  • RLHF:基于人类反馈的强化学习(PPO)

 

支持的微调方法

  • LoRA / QLoRA / DoRA / LoRA+
  • GaLore / BAdam / APOLLO
  • 全参数微调(Full)
  • 冻结微调(Freeze)

 

分布式训练引擎

  • Megatron-SWIFT:基于 Megatron-Core 的超大规模并行训练,支持张量并行+流水线并行+序列并行+专家并行
  • DeepSpeed:ZeRO-1/2/3
  • FSDP / FSDP2

 

量化与推理

  • 训练量化:QLoRA 2/3/4/5/6/8-bit
  • 导出量化:GPTQ、AWQ、bitsandbytes
  • 推理引擎:vLLM、SGLang、LMDeploy

 

许可策略:Apache-2.0 许可,允许商用、修改、再分发。

💡 MS-SWIFT 的独特定位:它是阿里云生态下最全面的训练框架,与 LlamaFactory(北航社区驱动)形成互补。MS-SWIFT 的优势在于阿里云基础设施深度集成(PAI、DashScope)、多模态模型支持数量最多(400+)、以及 Megatron-SWIFT 超大规模并行能力。框架附带的推理/部署能力仅作为训练后的测试验证工具,不应归入”推理引擎”或”API封装”子分类。

 

核心能力

  • 600+ LLM + 400+ 多模态统一入口:同一套 CLI 命令训练不同架构模型,自动匹配对话模板与 LoRA 目标层
  • 完整训练生命周期:CPT → SFT → DPO/GRPO → 评估 → 导出 → 部署
  • Megatron-SWIFT 超大规模并行:支持千亿参数模型的张量/流水线/序列/专家并行训练
  • 多模态训练专长:Qwen-VL、InternVL、LLaVA、CogVLM 等图文模型训练流程深度优化
  • GRPO 推理模型训练:支持 DeepSeek-R1 风格的群体相对策略优化,是推理模型微调的关键能力
  • 国产芯片适配:昇腾 NPU、寒武纪、昆仑芯等国产硬件原生支持
  • 50+ 内置数据集:含中文数据集(alpaca_zh、firefly、moss 等),支持自定义数据集
  • 一键部署:训练完成后可直接启动 vLLM/SGLang 推理服务
  • 模型评估:集成 eval 模块,支持标准 benchmark 评测
  • 模型导出:合并 LoRA、量化导出、HuggingFace 格式

 

优势亮点

  • 阿里云生态深度集成:与 PAI(机器学习平台)、DashScope(模型服务)无缝对接,企业级部署路径清晰
  • 多模态模型支持最广:400+ 多模态模型,覆盖视觉、文档、图表、OCR 等各类图文理解任务
  • Megatron-SWIFT 超大规模并行:基于 Megatron-Core 的工业级并行方案,千亿参数训练稳定
  • GRPO 支持:推理模型微调(如 DeepSeek-R1 风格)的关键能力,领先多数社区框架
  • 国产芯片原生适配:昇腾、寒武纪、昆仑芯等国产硬件 Day-0 支持,国产算力场景首选
  • Apache-2.0 最干净许可:商用无门槛,与 LlamaFactory、Axolotl 并列
  • AAAI 2025 学术背书:论文提供学术严谨性保证
  • ModelScope 社区生态:与 ModelScope 模型库深度绑定,模型下载、数据集管理、社区交流一体化

 

局限

  • 社区活跃度不及 LlamaFactory:GitHub Stars 约 6K+,Issues 响应速度较慢
  • 文档中英文混杂:部分文档仅有中文,国际化体验待提升
  • WebUI 不如 LlamaBoard 成熟:虽然有 Gradio 界面,但功能与易用性不及 LlamaFactory
  • 超大规模预训练仍需 Megatron-Core 原生:Megatron-SWIFT 是对接层,复杂训练策略仍需直接操作 Megatron-Core
  • 消费级硬件文档较少:QLoRA 微调的消费级硬件配置指南不如 LlamaFactory 详尽
  • 某些前沿算法滞后:最新 RL 算法(如 DAPO、REINFORCE++)可能滞后 veRL 等专职框架

 

适用人群

  • 阿里云企业用户:已使用阿里云 PAI、DashScope 的企业,MS-SWIFT 是最佳集成方案
  • 多模态模型微调团队:400+ 多模态模型支持,视觉语言模型定制首选
  • 国产算力用户:昇腾、寒武纪等国产芯片原生适配,信创场景首选
  • 千亿参数超大规模训练:Megatron-SWIFT 提供工业级并行方案
  • 推理模型(R1风格)微调:GRPO 支持,适合研究 DeepSeek-R1 训练方法
  • ModelScope 生态用户:与 ModelScope 模型库深度绑定,模型下载与管理便捷

 

安装与部署

 

1. 硬件需求参考

训练方法 7B 14B 70B
全参 BF16 120GB 240GB 1200GB
LoRA 16-bit 16GB 32GB 160GB
QLoRA 4-bit 6GB 12GB 48GB

 

2. 安装

pip install ms-swift

# 或源码安装
git clone https://github.com/modelscope/ms-swift.git
cd ms-swift
pip install -e .

 

3. SFT 微调示例

# Qwen2.5-7B-Instruct LoRA SFT
swift sft \
  --model_type qwen2_5-7b-instruct \
  --dataset alpaca_zh \
  --sft_type lora \
  --output_dir output

 

4. DPO 对齐

swift rlhf \
  --rlhf_type dpo \
  --model_type qwen2_5-7b-instruct \
  --dataset hh_rlhf_cn \
  --sft_type lora \
  --output_dir output-dpo

 

5. GRPO 训练(推理模型)

swift rlhf \
  --rlhf_type grpo \
  --model_type qwen2_5-7b-instruct \
  --dataset math_grpo \
  --output_dir output-grpo

 

6. 多模态模型微调

swift sft \
  --model_type qwen-vl-chat \
  --dataset coco-en-mini \
  --sft_type lora \
  --output_dir output-vl

 

7. 部署为 API

swift deploy \
  --model_type qwen2_5-7b-instruct \
  --sft_type lora \
  --ckpt_dir output/vx-xxx/checkpoint-xxx

 

8. 部署前必检清单

  • 确认仓库位于 github.com/modelscope/ms-swift
  • 商用部署:Apache-2.0 允许商用
  • 国产芯片用户参考官方 Ascend 安装文档
  • 多模态模型训练需注意显存占用(VL 模型通常更大)

相关导航