
LocalAI 是一个免费开源的模块化 AI 全栈运行时,定位为 OpenAI 和 Anthropic API 的本地平替——把数据留在自有硬件上,无需云端、无需 GPU 也能跑。
核心是一个小体积二进制(或容器),通过 OpenAI 兼容 API 暴露能力,每个模型后端按需以独立 gRPC 服务加载,后端涵盖 llama.cpp、vLLM、Transformers、whisper.cpp、diffusers、MLX 等 36+ 引擎。除 LLM 外还支持图像/视频生成、TTS/STT、视觉、Embedding、Rerank 等多模态能力。内置 Web UI 提供聊天、模型管理、智能体创建、系统监控。MIT 协议,社区驱动。
产品概述
LocalAI 由 Ettore Di Giacinto 创立,设计哲学是”小而组合”——核心保持轻量,后端作为独立 OCI 容器按需拉取,故障隔离,互不干扰。
2026 年密集迭代:1 月 3.10.0 加入 Anthropic API 兼容、Open Responses API、视频与图像生成;3 月新增智能体管理、React UI、WebRTC、MLX 分布式 P2P/RDMA、MCP Apps;4 月新增语音识别、人脸识别、Ollama API 兼容、sglang/ik-llama-cpp/TurboQuant 等新后端。GPU 加速方面,LocalAI 可根据硬件自动选择 CUDA/ROCm/SYCL/Metal/Vulkan 后端,多 GPU 场景下 llama.cpp 后端会自动跨卡分配层。
无 GPU 时在 CPU 上运行消费级硬件即可,是对”无 GPU 要求”贯彻最彻底的本地 AI 运行时之一。LocalAI 与 Ollama 的差异在于:Ollama 专注 LLM 且开发者体验优先,LocalAI 则是”多模态 + 多后端 + 智能体”的全栈平替,更接近”自建 OpenAI”。
核心能力
- OpenAI 兼容 API:Chat/Completions/Embeddings/Images/Audio/Rerank 等端点,兼容现有 OpenAI SDK
- Anthropic Messages API 兼容:支持 Claude 兼容请求格式
- Open Responses API:支持后台处理、流式输出等高级特性
- 多后端推理:llama.cpp、vLLM、Transformers、whisper.cpp、diffusers、MLX、sglang 等 36+ 后端
- 自动后端检测:安装模型时自动检测系统 GPU 能力并下载匹配后端
- 多模态:文本、图像、视频、音频、视觉、Embedding 全模态覆盖
- 内置智能体:通过 MCP 工具调用,UI 内直接创建自治智能体
- 分布式模式:P2P 联邦或多节点生产部署,横向扩展
- 模型库(Gallery):内置模型目录一键安装,支持 HuggingFace/Ollama/OCI/本地 YAML
优势亮点
- OpenAI/Anthropic 双兼容:现有 GPT 代码改 base_url 即可无缝迁移到本地
- MIT 协议:免费商用,无 AGPL 传染风险
- 无 GPU 要求:消费级 CPU 即可运行,降低本地 AI 门槛
- 后端按需加载:核心轻量,每个后端独立 gRPC 服务,故障隔离
- 36+ 后端覆盖:从 llama.cpp 到 vLLM 到 MLX,几乎囊括所有开源推理引擎
- 多模态全栈:文本/图像/视频/音频/视觉/Embedding 一体提供
- 自动 GPU 检测:安装模型时自动匹配 CUDA/ROCm/SYCL/Metal/Vulkan 后端
- 内置智能体与记忆:LocalAGI 智能体平台 + LocalRecall 语义记忆,无需额外安装
- 分布式就绪:P2P 联邦、多节点生产模式,可横向扩展
- Docker 容器化:官方提供 CPU/GPU 各硬件变体镜像,部署极简
短板
- 首次安装某模型时会触发后端下载,冷启动较慢
- 全栈特性带来一定资源开销,纯 LLM 场景比 Ollama 重
- 智能体/分布式等高级特性配置复杂,需要一定学习成本
- 社区生态规模不及 Ollama(但企业特性更完整)
- 自动后端检测偶尔会选错后端,需手动指定 YAML 配置覆盖
- 文档虽全面但对新手不够友好,概念较多
适用人群
需要 OpenAI 兼容本地 API 的开发者、希望一站式获取”多模态+智能体+向量”全栈能力的团队、隐私敏感企业、无 GPU 但想跑本地 AI 的个人、需要 Anthropic API 本地平替的场景、分布式多节点部署需求。
安装与快速开始
Step 1:Docker 启动(推荐)
CPU 版本:
docker run -p 8080:8080 --name local-ai -ti localai/localai:latest-cpu
NVIDIA GPU 版本:
docker run -p 8080:8080 --gpus all --name local-ai -ti localai/localai:latest-gpu-nvidia-cuda-12
AMD GPU 版本:
docker run -p 8080:8080 --device /dev/dri --device /dev/kfd --name local-ai -ti localai/localai:latest-gpu-hipblas
服务默认监听 http://localhost:8080。
Step 2:安装模型并聊天
打开 http://localhost:8080,在 Models 页面搜索 qwen3-4b,点击 Install。安装完成后到 Chat 页面选择模型即可对话。
或者通过 CLI 安装模型:
local-ai run qwen3-4b local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf local-ai run ollama://gemma:2b
Step 3:调用 API(任选一种方式)
curl 调用:
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-4b",
"messages": [{"role": "user", "content": "Hello!"}]
}'
Python 调用:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8080/v1",
api_key="sk-no-auth" # 本地无需真实 key,可设 LOCALAI_API_KEY 启用鉴权
)
response = client.chat.completions.create(
model="qwen3-4b",
messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)
硬件配置参考
| 部署场景 | 推荐配置 |
|---|---|
| CPU 仅推理(qwen3-4b 级别) | 8GB 内存,纯 CPU 可跑 |
| 单 GPU 推理(7B-14B 模型) | NVIDIA RTX 4090 / AMD RX 7900 XTX,16GB+ 显存 |
| 多 GPU 分布式 | 2+ NVIDIA GPU,CUDA_VISIBLE_DEVICES 控制可见设备 |
| 生产环境 | Docker + 反向代理 + LOCALAI_AUTH=true 启用多用户鉴权 |
💡 最佳实践:首次部署用
latest-cpu镜像快速验证;生产环境根据硬件选择对应 GPU 镜像;启用鉴权用LOCALAI_API_KEY或LOCALAI_AUTH=true;多 GPU 场景 llama.cpp 后端自动跨卡分配,也可用CUDA_VISIBLE_DEVICES=0,1控制;模型安装支持 Gallery/HuggingFace/Ollama/OCI/YAML 五种来源。
相关导航


vLLM

MLC LLM

PocketPal AI

Ollama

GPT4All

Jan

