LiteLLM翻译站点

3周前发布 12 0 0

BerriAI主导,以OpenAI格式统一调用100+ LLM提供商,MIT许可,AI网关事实标准。

语言:
英文
收录时间:
2026-08-22

LiteLLM是BerriAI(YC W23)开源的AI网关与Python SDK,MIT许可(核心)。以OpenAI格式统一调用100+ LLM提供商——OpenAI、Anthropic、Gemini、Bedrock、Azure、Cohere、HuggingFace、Ollama、vLLM等。两种形态:Python SDK直接集成代码 + Proxy Server独立网关。内置虚拟密钥、预算管理、限流、负载均衡、自动回退、观测回调,1k RPS下P95延迟8ms,Netflix等企业采用。

 

项目概述

LiteLLM由BerriAI(YC W23,创始人Krrish Dholakia与Ishaan Jaffer)维护 。截至2026年4月,项目已达45,400 GitHub Stars、1,000+贡献者,自称通过代理基础设施服务了10亿+请求​ 。

 

核心定位哲学

LiteLLM官方自我定位是”an open source AI Gateway that gives you a single, unified interface to call 100+ LLM providers… using the OpenAI format” ——它解决的是一个非常具体的痛点:SDK碎片化。OpenAI的chat.completions.create与Anthropic的messages.create不匹配,与Bedrock的InvokeModelCommand不匹配,与Vertex AI的generateContent不匹配;每个提供商的认证、参数名、响应形状、错误类型、流式逻辑都不同 。LiteLLM作为抽象层,用一个Python函数litellm.completion(model="provider/model", messages=...) 路由到100+提供商,相同的函数签名、相同的响应形状、相同的重试逻辑、相同的成本跟踪 。

 

两种使用形态​ :

形态 使用方式 适用对象
Python SDK from litellm import completion 直接在代码中调用 构建LLM应用的开发者
Proxy Server litellm --model gpt-4o 启动网关,默认端口4000 Gen AI平台/ML平台团队

 

不执行推理——这是关键归类

LiteLLM自己不加载模型权重、不管理KV Cache、不执行CUDA计算。它的本质是协议转换与流量治理层:接收OpenAI格式的请求 → 翻译成目标提供商的native请求 → 调用提供商API → 将响应翻译回OpenAI格式返回 。因此它严格属于”API封装/LLM网关”子类,不是推理引擎;它的后端可以接OpenAI/Anthropic等云端API,也可以接Ollama/vLLM/Sonar等本地推理引擎 。

 

请求生命周期(Proxy Server形态) :

Client (OpenAI SDK/LangChain/curl)
↓ Authorization: Bearer sk-…
LiteLLM Gateway :4000
1. Auth与预算检查:虚拟密钥 Redis缓存优先,miss查PostgreSQL
2. 限流:rpm/tpm for key/user/team/server 四级
3. Router:负载均衡、回退、重试
4. Provider翻译:litellm SDK,OpenAI格式进出,翻译成提供商native请求

LLM Providers:OpenAI / Anthropic / Bedrock / Vertex / 100+ more

响应返回客户端后,支出日志、限流计数、日志回调都以异步后台任务运行,没有任何数据库写入阻塞在请求路径上​ ——这是LiteLLM能做到1k RPS下P95延迟8ms 的架构关键。

 

支持端点​ :

/chat/completions/responses/embeddings/images/audio/batches/rerank/a2a/messages等全端点统一。

 

100+提供商覆盖(部分代表性) :

OpenAI、Anthropic、Gemini、Vertex AI、Bedrock、Azure、Cohere、Mistral、HuggingFace、Groq、Together AI、DeepSeek、NVIDIA NIM、Ollama、vLLM、LM Studio、OpenRouter、xAI、Perplexity、Volcengine、Dashscope、Moonshot、Novita AI、SambaNova、Snowflake、IBM Watsonx、Databricks、OCI、Replicate、Fireworks、Cloudflare、GitHub Models、Vercel AI Gateway等 。

 

许可策略:MIT许可证(核心),企业治理功能(SSO、RBAC、审计日志)在商业许可层,企业版起价$250/月 。

💡 LiteLLM的独特定位:它是”API封装/LLM网关”子类的事实标准。与One API(中文社区经典)、Portkey Gateway(TS轻量)、Kong AI Gateway(企业API网关AI插件)、Higress(阿里系国产)形成差异化:LiteLLM的核心竞争力在”以OpenAI格式统一100+提供商 + 网关与SDK双形态 + 路由/回退/预算/限流/观测全家桶” ——它是API封装层的参照系,几乎所有同类项目的对标对象。MIT许可 与llama.cpp/MLX/CTranslate2/ExLlamaV3并列最干净许可阵营。它自己不执行推理计算(非vLLM/SGLang那种推理引擎),而是把上游提供商API或本地推理引擎统一封装成OpenAI兼容接口,在此之上提供路由、限流、鉴权、计费、容灾、观测 。Netflix、Stripe、Google ADK等企业的采用 证明了它在生产环境的工业级实力。需要注意的是,高级企业治理功能(SSO/RBAC/审计日志)在商业许可层 ,开源核心版的治理功能相对基础。

 

核心能力

  • 统一OpenAI格式:一个completion()函数调用100+提供商,相同函数签名、相同响应形状
  • 双形态部署:Python SDK直接集成代码 + Proxy Server独立网关(默认端口4000)
  • 100+提供商支持:OpenAI/Anthropic/Gemini/Bedrock/Azure/Cohere/HuggingFace/Ollama/vLLM等全涵盖
  • 全端点统一/chat/completions/responses/embeddings/images/audio/batches/rerank/a2a/messages
  • 虚拟密钥:按用户/项目/团队签发虚拟key,每个key独立预算、模型访问列表、TTL
  • 预算管理:按key/user/team设置预算,软预算警报,超预算webhook通知,实时支出跟踪
  • 限流:全局/key/user/team四级rpm/tpm限流
  • 负载均衡:跨多个deployment的usage-based路由,模型组(model group)概念
  • 自动回退与重试function_with_fallbacks跨模型组故障转移,function_with_retries组内重试
  • MCP Server:在http://localhost:4000/mcp暴露网关为MCP Server,Cursor/Claude Desktop可直接调用
  • A2A网关:Agent-to-Agent协议网关支持
  • 成本跟踪:内置支出仪表盘,按key/model/team分解,CSV/JSON导出
  • 观测回调:Langfuse、Lunary、Helicone、Weights & Biases、MLflow、Arize、Prometheus、OpenTelemetry等80+集成
  • 语义缓存与精确匹配缓存:Redis/Qdrant/S3/内存
  • 护栏框架:内容审核、PII检测、Prompt注入检查
  • JWT认证:支持自定义JWT认证流
  • Admin Dashboard:React Admin UI管理key、模型、预算、用量
  • 异步记账:支出日志、限流计数、日志回调全部异步后台执行,不阻塞请求路径
  • 图像URL处理:自动检测目标提供商是否支持URL,不支持则下载转base64(单张上限50MB,内存缓存10张)
  • 1k RPS下P95延迟8ms:生产级性能基准

 

优势亮点

  • MIT最干净许可:核心MIT许可,商用、修改、再分发无任何限制
  • API封装层事实标准:海外最热门的开源AI网关,几乎所有同类项目的参照系
  • 100+提供商统一:OpenAI格式一处调用,新增提供商通常在公开API发布后1天内支持
  • 双形态灵活:SDK嵌入代码 + 独立网关,覆盖从原型到生产的全生命周期
  • 路由/回退/限流/预算全家桶:生产网关所需的治理能力全部内置
  • Netflix等级生产验证:Netflix、Stripe、Google ADK等企业采用
  • MCP与A2A原生支持:在AI Agent化趋势下,网关同时作为MCP Server暴露工具
  • 异步架构高性能:1k RPS下P95延迟8ms,数据库写入全异步不阻塞请求路径
  • 观测生态最丰富:80+观测集成,Langfuse/Prometheus/OpenTelemetry全覆盖
  • BerriAI商业支持:企业版提供SSO/RBAC/审计日志/SLA,起价$250/月

 

局限

  • 自己不执行推理:LiteLLM是协议转换层,后端必须接推理引擎(vLLM/Sonar/Ollama)或云端API,不能独立运行模型
  • 高级治理需商业许可:SSO、RBAC、审计日志等企业治理功能在商业层($250/月起)
  • PostgreSQL+Redis依赖:生产部署需要PostgreSQL(存储key/team/支出)和Redis(缓存/限流计数器)
  • 配置复杂度:生产级配置(model group、路由规则、预算、回退链)的YAML相对复杂
  • 国产模型适配略滞后:Dashscope/Moonshot/Volcengine等国产提供商虽支持,但新模型Day-1适配速度不及本土网关
  • 单机水平扩展限制:大规模部署需要Kubernetes+多副本+外部PostgreSQL/Redis,自托管运维成本
  • 非国产生态:主要面向海外100+提供商,国内用户可能需要额外的国产模型适配层
  • 企业版部分特性需授权:如部分护栏、企业级SLA等

 

适用人群

  • 多模型应用开发者:需要用统一接口调用OpenAI/Anthropic/Bedrock/Vertex等多家提供商
  • Gen AI平台/ML平台团队:需要为组织提供中心化的LLM网关
  • 成本敏感团队:需要跨提供商的成本跟踪与预算控制
  • 需要故障转移的生产系统:主提供商不可用时自动回退到备选
  • Agentic应用开发者:MCP Server暴露使Cursor/Claude Desktop可直接调用
  • 合规与审计需求企业:虚拟密钥+支出跟踪+审计日志(企业版)满足合规
  • 已有OpenAI客户端代码的项目:只需更换base_url与api_key,无需改写业务代码
  • 本地+云端混合部署:同时路由到Ollama/vLLM(本地)和OpenAI/Anthropic(云端)

 

安装与部署

 

1. 环境要求

  • Python 3.10+
  • 生产部署建议:PostgreSQL + Redis
  • Docker部署可选

 

2. 安装

# 安装Proxy形态
pip install 'litellm[proxy]'

# 仅安装SDK
uv add litellm

 

3. Python SDK快速使用

from litellm import completion
import os

os.environ["OPENAI_API_KEY"] = "your-openai-key"
os.environ["ANTHROPIC_API_KEY"] = "your-anthropic-key"

# OpenAI
response = completion(model="openai/gpt-4o", messages=[{"role": "user", "content": "Hello!"}])

# Anthropic——相同的调用形状
response = completion(model="anthropic/claude-sonnet-4-20250514", messages=[{"role": "user", "content": "Hello!"}])

# 流式
response = completion(
    model="bedrock/anthropic.claude-3-5-sonnet-20240620-v1:0",
    messages=[{"role": "user", "content": "Summarize this."}],
    stream=True,
)
for chunk in response:
    print(chunk.choices[0].delta.content or "", end="")

 

4. 启动Proxy Server

# 基础启动
litellm --model gpt-4o
# INFO: Proxy running on http://0.0.0.0:4000

# 客户端调用(OpenAI SDK无需修改代码)
import openai
client = openai.OpenAI(api_key="anything", base_url="http://0.0.0.0:4000")
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)

 

5. 配置文件(config.yaml)生产部署

model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY

  - model_name: claude-opus
    litellm_params:
      model: anthropic/claude-opus-4
      api_key: os.environ/ANTHROPIC_API_KEY

  - model_name: my-local-llm
    litellm_params:
      model: ollama/llama3.1
      api_base: http://localhost:11434

router_settings:
  routing_strategy: usage-based-routing
  fallbacks:
    - gpt-4o → claude-opus  # gpt-4o失败时回退到claude-opus
  num_retries: 3

# 虚拟密钥与预算
general_settings:
  telemetry: false

# 启动
# litellm --config config.yaml

 

6. 虚拟密钥与预算

# 生成虚拟密钥(带预算限制)
curl -X POST "http://localhost:4000/key/new" \
  -H "Authorization: Bearer sk-admin-key" \
  -H "Content-Type: application/json" \
  -d '{
    "models": ["gpt-4o", "claude-opus"],
    "max_budget": 100.0,
    "budget_duration": "30d",
    "rpm_limit": 100,
    "tpm_limit": 100000
  }'
# 返回:{"key": "sk-1234...", "max_budget": 100.0, ...}

 

7. Docker部署

# 使用-stable标签(经过12小时负载测试)
docker run -d \
  -p 4000:4000 \
  -v $(pwd)/config.yaml:/app/config.yaml \
  -e LITELLM_MASTER_KEY="sk-master-key" \
  ghcr.io/berriai/litellm:latest-stable \
  --config /app/config.yaml

# Docker Compose示例
# version: "3.9"
# services:
#   litellm:
#     image: ghcr.io/berriai/litellm:latest-stable
#     ports: ["4000:4000"]
#     environment:
#       - LITELLM_MASTER_KEY=sk-master-key
#     volumes:
#       - ./config.yaml:/app/config.yaml
#     command: ["--config", "/app/config.yaml"]

 

8. 观测集成

import litellm

# 配置Langfuse观测
os.environ["LANGFUSE_PUBLIC_KEY"] = "..."
os.environ["LANGFUSE_SECRET_KEY"] = "..."
litellm.success_callback = ["langfuse"]

# 每次completion调用都会自动上报到Langfuse
response = litellm.completion(model="gpt-4o", messages=[...])

 

9. 部署前必检清单

  • 确认仓库位于 github.com/BerriAI/litellm(官方)
  • 许可:MIT(核心),企业治理功能(SSO/RBAC/审计日志)在商业许可层($250/月起)
  • 严格属于”API封装/LLM网关”子类,自己不执行推理计算,后端需接推理引擎或云端API
  • 100+提供商支持,以OpenAI格式统一封装
  • 生产部署建议配置PostgreSQL(key/team/支出存储)+ Redis(缓存/限流)
  • 1k RPS下P95延迟8ms ,Netflix/Stripe/Google ADK等企业采用
  • 虚拟密钥、预算、限流、路由、回退、重试、观测全家桶内置
  • MCP Server原生支持:http://localhost:4000/mcp
  • 使用-stable Docker标签(经过12小时负载测试)用于生产

相关导航