
Axolotl是Apache-2.0许可的开源LLM微调框架,单一YAML贯穿数据预处理、训练、评估、量化与推理。支持全参/LoRA/QLoRA、SFT、DPO/KTO/ORPO、GRPO、奖励建模及多模态训练,FSDP/DeepSpeed多卡多节点,覆盖100+模型架构。
项目概述
Axolotl由Wing Lian主导开发,目前由Axolotl AI Cloud与OpenAccess AI Collective组织维护,2023年首次发布,最新版本v0.17.0(2026-06-03),Apache-2.0许可,GitHub 12.2K Stars,170+贡献者 。
核心设计哲学:YAML即一切
Axolotl的核心抽象是”单一YAML配置文件贯穿整个微调流水线”——数据集预处理、训练、评估、量化、推理全部由一个YAML文件描述 。这种设计让训练任务成为可提交git、可分享、可交给CI/CD管道的”可复现制品” ,是与LlamaFactory(WebUI导向)、MS-SWIFT(CLI导向)最本质的差异。
支持的模型架构(100+):
- 主流LLM:Llama 4、Mistral Small 4、Qwen3、Gemma 4、Granite 4、GPT-OSS、DeepSeek、ChatGLM、GLM-4.6V、Falcon、Pythia、MPT、RWKV、Phi、Jamba、OLMo3、Apertus、Seed-OSS、HunYuan、MiMo、Kimi-Linear等
- 视觉语言模型(VLM):LLaMA-Vision、Qwen2-VL、Qwen3-VL、Pixtral、LLaVA、SmolVLM2、GLM-4.6V、InternVL 3.5、Gemma 3n、PaddleOCR-VL
- 音频模型:Voxtral(图像/视频/音频多模态支持)
- MoE架构:Mixtral-MoE、Qwen3MoE、NVFP4 4-bit MoE LoRA
支持的训练方法:
- 全参微调:Full Fine-tuning
- 参数高效微调:LoRA、QLoRA、ReLoRA
- 量化感知训练(QAT):int8/int4/FP8/NVFP4/MXFP4
- 偏好对齐:DPO、IPO、KTO、ORPO
- 强化学习:GRPO、GDPO
- 奖励建模:RM(Reward Modeling)、PRM(Process Reward Modeling)
分布式训练引擎:
- FSDP1 / FSDP2:PyTorch原生全分片数据并行
- DeepSpeed:ZeRO系列优化器
- 多节点:Torchrun、Ray
- 专家并行(EP):DeepEP驱动MoE分布式训练
- 多维并行(ND Parallelism):上下文并行(CP)+ 张量并行(TP)+ FSDP组合
性能优化技术:
Flash Attention 2/3/4、Xformers、Flex Attention、SageAttention、Liger Kernel、Cut Cross Entropy、ScatterMoE、Sequence Parallelism(SP)、Multipacking(样本打包)、BitNet 1.58-bit微调、EAFT(熵感知焦点训练)、可扩展Softmax
许可策略:Apache-2.0许可 ,允许商用、修改、再分发。但需要注意:微调后模型的许可取决于基座模型与训练数据的许可——例如基于Llama 4(Meta社区许可)微调的产出模型需遵守Meta许可条款,基于Qwen(Apache-2.0)微调的产出模型可自由商用。
💡 Axolotl的独特定位:YAML驱动的”可复现微调制品”。与LlamaFactory(WebUI零代码导向)、MS-SWIFT(阿里云生态CLI导向)形成”综合型微调框架三巨头”的差异化:Axolotl用单一YAML文件封装整个训练流水线,使微调任务成为可版本控制、可CI/CD、可团队协作的标准化制品。虽然Axolotl支持训练后的推理与评估,但生产环境推理部署明确超出其范畴——官方文档明确指出生产推理需要使用vLLM、TensorRT-LLM等独立工具 ,因此Axolotl应严格归入”训练&微调”子分类,而非”推理引擎”或”API封装”。
核心能力
- YAML单一配置:一个YAML文件贯穿数据预处理→训练→评估→量化→推理全流程,可git版本化、可CI/CD、可复现
- 100+模型架构支持:Llama 4、Mistral、Qwen3、Gemma 4、GPT-OSS、DeepSeek、ChatGLM、GLM-4.6V、OLMo3、Apertus等全覆盖
- 多模态训练:LLaMA-Vision、Qwen2-VL、Pixtral、LLaVA、SmolVLM2、InternVL 3.5、Gemma 3n、PaddleOCR-VL、Voxtral(图像/视频/音频)
- 完整训练方法矩阵:全参/LoRA/QLoRA/ReLoRA + DPO/IPO/KTO/ORPO + GRPO/GDPO + RM/PRM + QAT
- MoE专项训练:ScatterMoE LoRA、NVFP4 4-bit MoE LoRA、专家并行(EP)、MoE专家量化
- 多维并行:FSDP1/FSDP2、DeepSpeed、上下文并行(CP)、张量并行(TP)、专家并行(EP)、ND Parallelism组合
- 多节点训练:Torchrun、Ray原生支持
- 量化感知训练:int8/int4/FP8/NVFP4/MXFP4全精度矩阵
- 最新算法前沿:GRPO(2025/02)、RM/PRM(2025/01)、LoRA优化(2025/02)、序列并行(2025/03)、文本扩散训练(2025/09)、BitNet 1.58-bit微调(2026/06)
- 性能优化全家桶:Flash Attention 2/3/4、Xformers、Flex Attention、SageAttention、Liger Kernel、Cut Cross Entropy、Multipacking、RoPE Scaling
- 灵活数据源:本地、HuggingFace Hub、云端(S3、Azure、GCP、OCI)
- 实验监控:WandB、MLflow、Comet集成
- 云原生部署:官方Docker镜像,原生支持Modal、RunPod、Vast.ai、PRIME Intellect、JarvisLabs.ai、Latitude.sh等云平台
优势亮点
- YAML可复现性:单一配置文件使训练任务成为标准化制品,是Axolotl最核心的差异化优势,适合工程化、CI/CD、团队协作
- Apache-2.0最干净许可:框架本身商用无门槛,与LlamaFactory、MS-SWIFT并列”最干净许可”阵营
- 算法覆盖最广:从LoRA到GRPO、从DPO到PRM、从FP8到NVFP4,是开源微调框架中训练方法覆盖最全面的之一
- 多模态训练成熟:LLaMA-Vision、Qwen-VL、Pixtral、InternVL 3.5等VLM模型原生支持,是VLM微调的主流选择
- MoE训练专项优化:ScatterMoE LoRA、专家并行、MoE专家量化,是MoE架构微调的领先框架
- 前沿算法Day-0支持:GRPO(2025/02)、RM/PRM(2025/01)、序列并行(2025/03)、ND Parallelism(2025/07)、BitNet 1.58-bit(2026/06)、NVFP4 MoE LoRA(2026/07),算法迭代速度领先
- 多维并行生产级:FSDP1/FSDP2 + DeepSpeed + CP + TP + EP组合,支持干亿参数模型训练
- 云生态成熟:Modal、RunPod、Vast.ai、PRIME Intellect等主流GPU云原生集成,云端训练零摩擦
- 社区驱动活跃:170+贡献者,OpenAccess AI Collective维护,Discord社区活跃
- HuggingFace深度集成:与Transformers、PEFT、TRL深度协同,模型权重标准兼容
局限
- 学习曲线陡峭:YAML配置强大但复杂,新手编写有效配置+数据准备需要数小时;官方明确说”不是无代码解决方案”
- 无WebUI:与LlamaFactory的LlamaBoard不同,Axolotl没有零代码GUI,非技术用户不友好
- 生产推理需外部工具:Axolotl训练与导出模型,但生产推理部署明确超出其范畴,需配合vLLM、TensorRT-LLM等
- 超大规模预训练非目标:Axolotl定位是”后训练与微调”,1B+参数模型的全量预训练需要Megatron-Core等更专业的工具
- 自定义架构需代码扩展:虽支持100+模型架构,但非常新型或专有架构可能需要代码级扩展
- GPU基础设施自管:零托管基础设施,用户需自备GPU或付费云算力
- 微调后模型许可依赖基座:Apache-2.0仅覆盖框架本身,微调产出的模型许可取决于基座模型(如Llama 4需遵守Meta社区许可)
适用人群
- ML工程师与研究人员:需要完全控制训练流程、追求可复现性的专业团队
- 偏好对齐算法研究:DPO/IPO/KTO/ORPO/GRPO/GDPO/RM/PRM全方法覆盖,是偏好对齐研究的最佳平台
- MoE模型微调:ScatterMoE LoRA、专家并行、MoE专家量化,MoE架构微调的领先选择
- 多模态/VLM微调:LLaMA-Vision、Qwen-VL、Pixtral、InternVL 3.5等VLM训练流程成熟
- CI/CD集成团队:YAML可版本化使Axolotl成为MLOps流水线的理想组件
- 云端GPU训练用户:Modal、RunPod、Vast.ai、PRIME Intellect原生支持,云端训练零摩擦
- 追求最新算法的团队:GRPO、序列并行、ND Parallelism、BitNet 1.58-bit等算法Day-0支持
- HuggingFace生态深度用户:与Transformers/PEFT/TRL深度协同,模型权重标准兼容
安装与部署
1. 硬件需求参考
| 训练方法 | 7B | 14B | 70B |
|---|---|---|---|
| 全参 BF16 | 120GB | 240GB | 1200GB |
| LoRA 16-bit | 16GB | 32GB | 160GB |
| QLoRA 4-bit | 6GB | 12GB | 48GB |
💡 消费级推荐:RTX 4090 24GB通过QLoRA 4-bit可微调7B模型
2. 安装(uv推荐,Python 3.12)
# 安装uv curl -LsSf https://astral.sh/uv/install.sh | sh # 设置PyTorch后端 export UV_TORCH_BACKEND=cu130 # 创建虚拟环境 uv venv --python 3.12 source .venv/bin/activate # 安装PyTorch uv pip install torch==2.12.0 torchvision # 安装Axolotl(含DeepSpeed) uv pip install --no-build-isolation axolotl[deepspeed] # 下载示例配置 axolotl fetch examples axolotl fetch deepspeed_configs
3. Docker部署(推荐)
docker run --gpus '"all"' --ipc=host --rm -it \ axolotlai/axolotl:main-latest
4. LoRA SFT示例(YAML驱动)
# 使用官方示例配置训练Llama-3 1B LoRA axolotl train examples/llama-3/lora-1b.yml
YAML配置示例(examples/llama-3/lora-1b.yml):
base_model: meta-llama/Llama-3-8B
model_type: AutoModelForCausalLM
tokenizer_type: AutoTokenizer
load_in_4bit: true
load_in_8bit: false
bf16: auto
tf32: true
datasets:
- path: alpaca_encoded
type: alpaca
dataset_prepared_path: ./last_run_prepared
val_set_size: 0.02
output_dir: ./outputs/qlora-llama3
sequence_len: 2048
sample_packing: false
pad_to_sequence_len: false
adapter: qlora
lora_r: 8
lora_alpha: 16
lora_dropout: 0.05
lora_target_modules:
- q_proj
- k_proj
- v_proj
- o_proj
gradient_accumulation_steps: 4
micro_batch_size: 2
num_epochs: 3
optimizer: adamw_bnb_8bit
lr_scheduler: cosine
learning_rate: 0.0002
flash_attention: true
5. QLoRA 4-bit微调(消费级硬件)
# 下载QLoRA示例 axolotl fetch examples # 训练Mistral 7B QLoRA axolotl train examples/mistral-7b/qlora.yml
6. DPO偏好对齐
axolotl train examples/llama-3/dpo-qlora-1b.yml
DPO YAML关键配置:
rl: dpo
dpo_beta: 0.1
pref_loss: sigmoid
datasets:
- path: your_dpo_dataset
type: dpo
7. GRPO强化学习(2025/02起支持)
axolotl train examples/llama-3/grpo-qlora-1b.yml
GRPO YAML关键配置:
rl: grpo
reward_model: your_reward_model
datasets:
- path: your_grpo_dataset
type: grpo
8. 多模态训练(VLM)
# 微调Qwen2-VL axolotl train examples/qwen2-vl/qlora.yml
9. 多卡分布式训练(FSDP2)
# 单机多卡FSDP2 torchrun --nproc_per_node=8 --standalone \ axolotl train your_config.yml # 多节点训练 torchrun --nnodes=2 --node_rank=0 --master_addr=192.168.0.1 --master_port=29500 \ --nproc_per_node=8 \ axolotl train your_config.yml
10. MoE模型微调(ScatterMoE LoRA)
# NVFP4 4-bit MoE LoRA训练(2026/07起支持) axolotl train examples/mixtral/scattermoe-qlora.yml
11. 训练后推理测试
axolotl inference your_config.yml \ --lora_checkpoint outputs/qlora-llama3/checkpoint-100 \ --prompt "What is the capital of Japan?"
12. 部署前必检清单
- 确认仓库位于
github.com/axolotl-ai-cloud/axolotl - 框架本身Apache-2.0许可,但微调产出模型的许可取决于基座模型与训练数据
- YAML配置是Axolotl的核心抽象,建议深入理解配置结构
- 消费级硬件推荐QLoRA 4-bit;70B模型微调建议FSDP+QLoRA或DeepSpeed ZeRO-3
- 生产环境推理部署需配合vLLM、TensorRT-LLM等独立工具——Axolotl本身不提供生产推理服务
- 云端训练推荐使用Modal、RunPod、Vast.ai、PRIME Intellect等原生支持的GPU云
- 最新算法(GRPO、RM/PRM、序列并行、ND Parallelism、BitNet 1.58-bit)需使用最新版本(v0.17.0+)
相关导航


veRL

LlamaFactory

DeepSpeed

MS-SWIFT

TRL

