LocalAI翻译站点

3天前更新 4 0 0

开源OpenAI API本地替代推理服务,Docker一条命令启动,MIT许可。

语言:
英文
收录时间:
2026-07-27
核心定位:开源OpenAI API本地替代
开源协议:MIT
核心能力:OpenAI兼容,多后端,智能体,语义记忆
特色功能:TTS,图像生成,嵌入,Rerank
GPU 必需:可选(CPU/GPU皆可)

LocalAI 是一个免费开源的模块化 AI 全栈运行时,定位为 OpenAI 和 Anthropic API 的本地平替——把数据留在自有硬件上,无需云端、无需 GPU 也能跑。

核心是一个小体积二进制(或容器),通过 OpenAI 兼容 API 暴露能力,每个模型后端按需以独立 gRPC 服务加载,后端涵盖 llama.cpp、vLLM、Transformers、whisper.cpp、diffusers、MLX 等 36+ 引擎。除 LLM 外还支持图像/视频生成、TTS/STT、视觉、Embedding、Rerank 等多模态能力。内置 Web UI 提供聊天、模型管理、智能体创建、系统监控。MIT 协议,社区驱动。

 

产品概述

LocalAI 由 Ettore Di Giacinto 创立,设计哲学是”小而组合”——核心保持轻量,后端作为独立 OCI 容器按需拉取,故障隔离,互不干扰。

2026 年密集迭代:1 月 3.10.0 加入 Anthropic API 兼容、Open Responses API、视频与图像生成;3 月新增智能体管理、React UI、WebRTC、MLX 分布式 P2P/RDMA、MCP Apps;4 月新增语音识别、人脸识别、Ollama API 兼容、sglang/ik-llama-cpp/TurboQuant 等新后端。GPU 加速方面,LocalAI 可根据硬件自动选择 CUDA/ROCm/SYCL/Metal/Vulkan 后端,多 GPU 场景下 llama.cpp 后端会自动跨卡分配层。

无 GPU 时在 CPU 上运行消费级硬件即可,是对”无 GPU 要求”贯彻最彻底的本地 AI 运行时之一。LocalAI 与 Ollama 的差异在于:Ollama 专注 LLM 且开发者体验优先,LocalAI 则是”多模态 + 多后端 + 智能体”的全栈平替,更接近”自建 OpenAI”。

 

核心能力

  • OpenAI 兼容 API:Chat/Completions/Embeddings/Images/Audio/Rerank 等端点,兼容现有 OpenAI SDK
  • Anthropic Messages API 兼容:支持 Claude 兼容请求格式
  • Open Responses API:支持后台处理、流式输出等高级特性
  • 多后端推理:llama.cpp、vLLM、Transformers、whisper.cpp、diffusers、MLX、sglang 等 36+ 后端
  • 自动后端检测:安装模型时自动检测系统 GPU 能力并下载匹配后端
  • 多模态:文本、图像、视频、音频、视觉、Embedding 全模态覆盖
  • 内置智能体:通过 MCP 工具调用,UI 内直接创建自治智能体
  • 分布式模式:P2P 联邦或多节点生产部署,横向扩展
  • 模型库(Gallery):内置模型目录一键安装,支持 HuggingFace/Ollama/OCI/本地 YAML

 

优势亮点

  • OpenAI/Anthropic 双兼容:现有 GPT 代码改 base_url 即可无缝迁移到本地
  • MIT 协议:免费商用,无 AGPL 传染风险
  • 无 GPU 要求:消费级 CPU 即可运行,降低本地 AI 门槛
  • 后端按需加载:核心轻量,每个后端独立 gRPC 服务,故障隔离
  • 36+ 后端覆盖:从 llama.cpp 到 vLLM 到 MLX,几乎囊括所有开源推理引擎
  • 多模态全栈:文本/图像/视频/音频/视觉/Embedding 一体提供
  • 自动 GPU 检测:安装模型时自动匹配 CUDA/ROCm/SYCL/Metal/Vulkan 后端
  • 内置智能体与记忆:LocalAGI 智能体平台 + LocalRecall 语义记忆,无需额外安装
  • 分布式就绪:P2P 联邦、多节点生产模式,可横向扩展
  • Docker 容器化:官方提供 CPU/GPU 各硬件变体镜像,部署极简

 

短板

  • 首次安装某模型时会触发后端下载,冷启动较慢
  • 全栈特性带来一定资源开销,纯 LLM 场景比 Ollama 重
  • 智能体/分布式等高级特性配置复杂,需要一定学习成本
  • 社区生态规模不及 Ollama(但企业特性更完整)
  • 自动后端检测偶尔会选错后端,需手动指定 YAML 配置覆盖
  • 文档虽全面但对新手不够友好,概念较多

 

适用人群

需要 OpenAI 兼容本地 API 的开发者、希望一站式获取”多模态+智能体+向量”全栈能力的团队、隐私敏感企业、无 GPU 但想跑本地 AI 的个人、需要 Anthropic API 本地平替的场景、分布式多节点部署需求。

 


安装与快速开始

 

Step 1:Docker 启动(推荐)

CPU 版本

docker run -p 8080:8080 --name local-ai -ti localai/localai:latest-cpu

NVIDIA GPU 版本

docker run -p 8080:8080 --gpus all --name local-ai -ti localai/localai:latest-gpu-nvidia-cuda-12

AMD GPU 版本

docker run -p 8080:8080 --device /dev/dri --device /dev/kfd --name local-ai -ti localai/localai:latest-gpu-hipblas

服务默认监听 http://localhost:8080

 

Step 2:安装模型并聊天

打开 http://localhost:8080,在 Models​ 页面搜索 qwen3-4b,点击 Install。安装完成后到 Chat​ 页面选择模型即可对话。

或者通过 CLI 安装模型:

local-ai run qwen3-4b
local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf
local-ai run ollama://gemma:2b

 

Step 3:调用 API(任选一种方式)

curl 调用

curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-4b",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

Python 调用

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8080/v1",
    api_key="sk-no-auth"  # 本地无需真实 key,可设 LOCALAI_API_KEY 启用鉴权
)

response = client.chat.completions.create(
    model="qwen3-4b",
    messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)

 

硬件配置参考

部署场景 推荐配置
CPU 仅推理(qwen3-4b 级别) 8GB 内存,纯 CPU 可跑
单 GPU 推理(7B-14B 模型) NVIDIA RTX 4090 / AMD RX 7900 XTX,16GB+ 显存
多 GPU 分布式 2+ NVIDIA GPU,CUDA_VISIBLE_DEVICES 控制可见设备
生产环境 Docker + 反向代理 + LOCALAI_AUTH=true 启用多用户鉴权

💡 最佳实践:首次部署用 latest-cpu 镜像快速验证;生产环境根据硬件选择对应 GPU 镜像;启用鉴权用 LOCALAI_API_KEYLOCALAI_AUTH=true;多 GPU 场景 llama.cpp 后端自动跨卡分配,也可用 CUDA_VISIBLE_DEVICES=0,1 控制;模型安装支持 Gallery/HuggingFace/Ollama/OCI/YAML 五种来源。

相关导航