LiteLLM是BerriAI(YC W23)开源的AI网关与Python SDK,MIT许可(核心)。以OpenAI格式统一调用100+ LLM提供商——OpenAI、Anthropic、Gemini、Bedrock、Azure、Cohere、HuggingFace、Ollama、vLLM等。两种形态:Python SDK直接集成代码 + Proxy Server独立网关。内置虚拟密钥、预算管理、限流、负载均衡、自动回退、观测回调,1k RPS下P95延迟8ms,Netflix等企业采用。
项目概述
LiteLLM由BerriAI(YC W23,创始人Krrish Dholakia与Ishaan Jaffer)维护 。截至2026年4月,项目已达45,400 GitHub Stars、1,000+贡献者,自称通过代理基础设施服务了10亿+请求 。
核心定位哲学:
LiteLLM官方自我定位是”an open source AI Gateway that gives you a single, unified interface to call 100+ LLM providers… using the OpenAI format” ——它解决的是一个非常具体的痛点:SDK碎片化。OpenAI的chat.completions.create与Anthropic的messages.create不匹配,与Bedrock的InvokeModelCommand不匹配,与Vertex AI的generateContent不匹配;每个提供商的认证、参数名、响应形状、错误类型、流式逻辑都不同 。LiteLLM作为抽象层,用一个Python函数 litellm.completion(model="provider/model", messages=...) 路由到100+提供商,相同的函数签名、相同的响应形状、相同的重试逻辑、相同的成本跟踪 。
两种使用形态 :
| 形态 | 使用方式 | 适用对象 |
|---|---|---|
| Python SDK | from litellm import completion 直接在代码中调用 |
构建LLM应用的开发者 |
| Proxy Server | litellm --model gpt-4o 启动网关,默认端口4000 |
Gen AI平台/ML平台团队 |
不执行推理——这是关键归类:
LiteLLM自己不加载模型权重、不管理KV Cache、不执行CUDA计算。它的本质是协议转换与流量治理层:接收OpenAI格式的请求 → 翻译成目标提供商的native请求 → 调用提供商API → 将响应翻译回OpenAI格式返回 。因此它严格属于”API封装/LLM网关”子类,不是推理引擎;它的后端可以接OpenAI/Anthropic等云端API,也可以接Ollama/vLLM/Sonar等本地推理引擎 。
请求生命周期(Proxy Server形态) :
Client (OpenAI SDK/LangChain/curl)
↓ Authorization: Bearer sk-…
LiteLLM Gateway :4000
1. Auth与预算检查:虚拟密钥 Redis缓存优先,miss查PostgreSQL
2. 限流:rpm/tpm for key/user/team/server 四级
3. Router:负载均衡、回退、重试
4. Provider翻译:litellm SDK,OpenAI格式进出,翻译成提供商native请求
↓
LLM Providers:OpenAI / Anthropic / Bedrock / Vertex / 100+ more
响应返回客户端后,支出日志、限流计数、日志回调都以异步后台任务运行,没有任何数据库写入阻塞在请求路径上 ——这是LiteLLM能做到1k RPS下P95延迟8ms 的架构关键。
支持端点 :
/chat/completions、/responses、/embeddings、/images、/audio、/batches、/rerank、/a2a、/messages等全端点统一。
100+提供商覆盖(部分代表性) :
OpenAI、Anthropic、Gemini、Vertex AI、Bedrock、Azure、Cohere、Mistral、HuggingFace、Groq、Together AI、DeepSeek、NVIDIA NIM、Ollama、vLLM、LM Studio、OpenRouter、xAI、Perplexity、Volcengine、Dashscope、Moonshot、Novita AI、SambaNova、Snowflake、IBM Watsonx、Databricks、OCI、Replicate、Fireworks、Cloudflare、GitHub Models、Vercel AI Gateway等 。
许可策略:MIT许可证(核心),企业治理功能(SSO、RBAC、审计日志)在商业许可层,企业版起价$250/月 。
💡 LiteLLM的独特定位:它是”API封装/LLM网关”子类的事实标准。与One API(中文社区经典)、Portkey Gateway(TS轻量)、Kong AI Gateway(企业API网关AI插件)、Higress(阿里系国产)形成差异化:LiteLLM的核心竞争力在”以OpenAI格式统一100+提供商 + 网关与SDK双形态 + 路由/回退/预算/限流/观测全家桶” ——它是API封装层的参照系,几乎所有同类项目的对标对象。MIT许可 与llama.cpp/MLX/CTranslate2/ExLlamaV3并列最干净许可阵营。它自己不执行推理计算(非vLLM/SGLang那种推理引擎),而是把上游提供商API或本地推理引擎统一封装成OpenAI兼容接口,在此之上提供路由、限流、鉴权、计费、容灾、观测 。Netflix、Stripe、Google ADK等企业的采用 证明了它在生产环境的工业级实力。需要注意的是,高级企业治理功能(SSO/RBAC/审计日志)在商业许可层 ,开源核心版的治理功能相对基础。
核心能力
- 统一OpenAI格式:一个
completion()函数调用100+提供商,相同函数签名、相同响应形状 - 双形态部署:Python SDK直接集成代码 + Proxy Server独立网关(默认端口4000)
- 100+提供商支持:OpenAI/Anthropic/Gemini/Bedrock/Azure/Cohere/HuggingFace/Ollama/vLLM等全涵盖
- 全端点统一:
/chat/completions、/responses、/embeddings、/images、/audio、/batches、/rerank、/a2a、/messages - 虚拟密钥:按用户/项目/团队签发虚拟key,每个key独立预算、模型访问列表、TTL
- 预算管理:按key/user/team设置预算,软预算警报,超预算webhook通知,实时支出跟踪
- 限流:全局/key/user/team四级rpm/tpm限流
- 负载均衡:跨多个deployment的usage-based路由,模型组(model group)概念
- 自动回退与重试:
function_with_fallbacks跨模型组故障转移,function_with_retries组内重试 - MCP Server:在
http://localhost:4000/mcp暴露网关为MCP Server,Cursor/Claude Desktop可直接调用 - A2A网关:Agent-to-Agent协议网关支持
- 成本跟踪:内置支出仪表盘,按key/model/team分解,CSV/JSON导出
- 观测回调:Langfuse、Lunary、Helicone、Weights & Biases、MLflow、Arize、Prometheus、OpenTelemetry等80+集成
- 语义缓存与精确匹配缓存:Redis/Qdrant/S3/内存
- 护栏框架:内容审核、PII检测、Prompt注入检查
- JWT认证:支持自定义JWT认证流
- Admin Dashboard:React Admin UI管理key、模型、预算、用量
- 异步记账:支出日志、限流计数、日志回调全部异步后台执行,不阻塞请求路径
- 图像URL处理:自动检测目标提供商是否支持URL,不支持则下载转base64(单张上限50MB,内存缓存10张)
- 1k RPS下P95延迟8ms:生产级性能基准
优势亮点
- MIT最干净许可:核心MIT许可,商用、修改、再分发无任何限制
- API封装层事实标准:海外最热门的开源AI网关,几乎所有同类项目的参照系
- 100+提供商统一:OpenAI格式一处调用,新增提供商通常在公开API发布后1天内支持
- 双形态灵活:SDK嵌入代码 + 独立网关,覆盖从原型到生产的全生命周期
- 路由/回退/限流/预算全家桶:生产网关所需的治理能力全部内置
- Netflix等级生产验证:Netflix、Stripe、Google ADK等企业采用
- MCP与A2A原生支持:在AI Agent化趋势下,网关同时作为MCP Server暴露工具
- 异步架构高性能:1k RPS下P95延迟8ms,数据库写入全异步不阻塞请求路径
- 观测生态最丰富:80+观测集成,Langfuse/Prometheus/OpenTelemetry全覆盖
- BerriAI商业支持:企业版提供SSO/RBAC/审计日志/SLA,起价$250/月
局限
- 自己不执行推理:LiteLLM是协议转换层,后端必须接推理引擎(vLLM/Sonar/Ollama)或云端API,不能独立运行模型
- 高级治理需商业许可:SSO、RBAC、审计日志等企业治理功能在商业层($250/月起)
- PostgreSQL+Redis依赖:生产部署需要PostgreSQL(存储key/team/支出)和Redis(缓存/限流计数器)
- 配置复杂度:生产级配置(model group、路由规则、预算、回退链)的YAML相对复杂
- 国产模型适配略滞后:Dashscope/Moonshot/Volcengine等国产提供商虽支持,但新模型Day-1适配速度不及本土网关
- 单机水平扩展限制:大规模部署需要Kubernetes+多副本+外部PostgreSQL/Redis,自托管运维成本
- 非国产生态:主要面向海外100+提供商,国内用户可能需要额外的国产模型适配层
- 企业版部分特性需授权:如部分护栏、企业级SLA等
适用人群
- 多模型应用开发者:需要用统一接口调用OpenAI/Anthropic/Bedrock/Vertex等多家提供商
- Gen AI平台/ML平台团队:需要为组织提供中心化的LLM网关
- 成本敏感团队:需要跨提供商的成本跟踪与预算控制
- 需要故障转移的生产系统:主提供商不可用时自动回退到备选
- Agentic应用开发者:MCP Server暴露使Cursor/Claude Desktop可直接调用
- 合规与审计需求企业:虚拟密钥+支出跟踪+审计日志(企业版)满足合规
- 已有OpenAI客户端代码的项目:只需更换base_url与api_key,无需改写业务代码
- 本地+云端混合部署:同时路由到Ollama/vLLM(本地)和OpenAI/Anthropic(云端)
安装与部署
1. 环境要求
- Python 3.10+
- 生产部署建议:PostgreSQL + Redis
- Docker部署可选
2. 安装
# 安装Proxy形态 pip install 'litellm[proxy]' # 仅安装SDK uv add litellm
3. Python SDK快速使用
from litellm import completion
import os
os.environ["OPENAI_API_KEY"] = "your-openai-key"
os.environ["ANTHROPIC_API_KEY"] = "your-anthropic-key"
# OpenAI
response = completion(model="openai/gpt-4o", messages=[{"role": "user", "content": "Hello!"}])
# Anthropic——相同的调用形状
response = completion(model="anthropic/claude-sonnet-4-20250514", messages=[{"role": "user", "content": "Hello!"}])
# 流式
response = completion(
model="bedrock/anthropic.claude-3-5-sonnet-20240620-v1:0",
messages=[{"role": "user", "content": "Summarize this."}],
stream=True,
)
for chunk in response:
print(chunk.choices[0].delta.content or "", end="")
4. 启动Proxy Server
# 基础启动
litellm --model gpt-4o
# INFO: Proxy running on http://0.0.0.0:4000
# 客户端调用(OpenAI SDK无需修改代码)
import openai
client = openai.OpenAI(api_key="anything", base_url="http://0.0.0.0:4000")
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)
5. 配置文件(config.yaml)生产部署
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude-opus
litellm_params:
model: anthropic/claude-opus-4
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: my-local-llm
litellm_params:
model: ollama/llama3.1
api_base: http://localhost:11434
router_settings:
routing_strategy: usage-based-routing
fallbacks:
- gpt-4o → claude-opus # gpt-4o失败时回退到claude-opus
num_retries: 3
# 虚拟密钥与预算
general_settings:
telemetry: false
# 启动
# litellm --config config.yaml
6. 虚拟密钥与预算
# 生成虚拟密钥(带预算限制)
curl -X POST "http://localhost:4000/key/new" \
-H "Authorization: Bearer sk-admin-key" \
-H "Content-Type: application/json" \
-d '{
"models": ["gpt-4o", "claude-opus"],
"max_budget": 100.0,
"budget_duration": "30d",
"rpm_limit": 100,
"tpm_limit": 100000
}'
# 返回:{"key": "sk-1234...", "max_budget": 100.0, ...}
7. Docker部署
# 使用-stable标签(经过12小时负载测试) docker run -d \ -p 4000:4000 \ -v $(pwd)/config.yaml:/app/config.yaml \ -e LITELLM_MASTER_KEY="sk-master-key" \ ghcr.io/berriai/litellm:latest-stable \ --config /app/config.yaml # Docker Compose示例 # version: "3.9" # services: # litellm: # image: ghcr.io/berriai/litellm:latest-stable # ports: ["4000:4000"] # environment: # - LITELLM_MASTER_KEY=sk-master-key # volumes: # - ./config.yaml:/app/config.yaml # command: ["--config", "/app/config.yaml"]
8. 观测集成
import litellm # 配置Langfuse观测 os.environ["LANGFUSE_PUBLIC_KEY"] = "..." os.environ["LANGFUSE_SECRET_KEY"] = "..." litellm.success_callback = ["langfuse"] # 每次completion调用都会自动上报到Langfuse response = litellm.completion(model="gpt-4o", messages=[...])
9. 部署前必检清单
- 确认仓库位于
github.com/BerriAI/litellm(官方) - 许可:MIT(核心),企业治理功能(SSO/RBAC/审计日志)在商业许可层($250/月起)
- 严格属于”API封装/LLM网关”子类,自己不执行推理计算,后端需接推理引擎或云端API
- 100+提供商支持,以OpenAI格式统一封装
- 生产部署建议配置PostgreSQL(key/team/支出存储)+ Redis(缓存/限流)
- 1k RPS下P95延迟8ms ,Netflix/Stripe/Google ADK等企业采用
- 虚拟密钥、预算、限流、路由、回退、重试、观测全家桶内置
- MCP Server原生支持:
http://localhost:4000/mcp - 使用
-stableDocker标签(经过12小时负载测试)用于生产
相关导航
Portkey Gateway

Kong AI Gateway

LocalAI
One API
AIProxy

n1n

