Higress是阿里巴巴开源的AI原生云原生API网关,CNCF Sandbox项目,Apache-2.0许可。基于Istio和Envoy构建,通过Wasm插件(Go/Rust/JS)扩展。AI网关能力支持100+主流大模型统一协议转换、模型级Fallback、语义缓存、Token级限流、内容安全防护、多维度鉴权与可观测性,同时统一治理MCP Server。诞生于阿里内部,承载通义千问等阿里云核心AI业务的API网关,5分钟Docker一键部署。
项目概述
Higress由阿里巴巴开源,是CNCF Sandbox项目 ,Apache-2.0许可证 。最新版本v2.2.4(2026年7月) ,从新版MCP到Gateway API推理扩展持续演进 。
核心定位哲学:
Higress官方自我定位是”AI Native API Gateway” ——它既不是纯粹的LLM网关(如LiteLLM),也不是传统的微服务网关(如Kong的原生形态),而是为AI场景从头设计的云原生网关:统一代理大模型API与MCP Server,支持模型、工具(MCP)及Agent的集中接入与管理 。
技术基因:
Higress基于Istio和Envoy构建 ,核心扩展性通过Wasm插件交付,插件可用Go/Rust/JavaScript编写 。这使它具备:
- 生产级稳定:诞生于阿里内部,承载阿里云通义千问模型工作室、机器学习PAI平台等核心AI业务 ,在阿里内部经历2年以上生产验证,支持十万级QPS大规模场景
- 毫秒级配置生效:彻底消除Nginx reload导致的流量抖动,配置变更毫秒生效且对业务透明,特别适合AI业务的长连接场景
- 流式友好:全面支持SSE等流式请求,优化大模型流式响应的内存与性能占用
它做什么 / 不做什么(关键归类):
- ✅ 做:接收客户端请求 → 通过AI Proxy等Wasm插件翻译成目标提供商native请求 → 调用提供商API → 返回响应 → 在此之上提供多模型统一路由、协议转换、语义缓存、Token级限流、内容安全防护、MCP统一管理、可观测
- ❌ 不做:自己不加载模型权重、不管理KV Cache、不执行推理计算。它严格属于”API封装/LLM网关”子类,不是推理引擎;后端接的是各家云端API或本地推理引擎
- 本质是AI原生网关:AI能力通过Wasm插件体系启用,与网关原有数十个通用插件(认证、限流、日志、监控、WAF)无缝组合
AI网关核心能力(官方定义) :
- 多模型统一接入:对OpenAI兼容接口及主流大模型服务提供统一网关入口,屏蔽不同厂商鉴权、接口差异,便于快速切换与多活部署;支持模型负载均衡及Fallback
- MCP统一管理:支持HTTP到MCP的协议转换,以及原生MCP服务的代理,把分散的工具能力收敛为统一入口
- Token流量管理:除传统QPS限流外,提供基于Token消耗的配额管理与限流,结合API Key池轮转与消费者认证机制
- AI缓存:支持精确缓存及语义缓存推理的结果上下文,节省Token并减小时延
- 内容安全防护:提示词攻击检测、敏感内容识别
- 热插拔插件与智能工具路由:通过插件快速集成RAG、向量数据库、日志可观测、缓存等AI生态组件
- 多维度鉴权与可观测性
模型提供商支持:
Higress已支持100+主流大模型的统一接入与治理 ,国内外主流模型厂商全覆盖:
- 国际:OpenAI、Azure OpenAI、Anthropic Claude、Google Gemini、Groq等
- 国产:通义千问、DeepSeek、月之暗面(Kimi)、百川智能、智谱AI、阶跃星辰、文心一言、腾讯混元、MiniMax、Ollama等
- AI代理插件:支持对接多厂商协议
MCP Server托管能力 :
Higress通过插件机制托管MCP Server,使AI Agent轻松调用各种工具和服务:
- 统一认证与授权机制
- 细粒度限流防止滥用
- 完善的工具调用审计日志
- 丰富的可观测性监控性能
- 通过插件机制简化部署
- 动态更新不中断连接
openapi-to-mcp工具快速将OpenAPI规范转换为远程MCP Server
部署形态:
- Docker一键启动:
docker run -d --rm --name higress-ai -v ${PWD}:/data -p 8001:8001 -p 8080:8080 -p 8443:8443 higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest - Kubernetes Helm部署:作为K8s Ingress Controller,兼容nginx ingress大量注解,支持Gateway API,路由变更生效速度比ingress-nginx快10倍
- 微服务网关:从Nacos、ZooKeeper、Consul、Eureka等服务注册中心发现服务,深度集成Dubbo、Nacos、Sentinel
- 安全网关:支持WAF和key-auth、hmac-auth、jwt-auth、basic-auth、oidc等认证策略
- Higress Console:提供开箱即用的Web控制台
许可策略:Apache-2.0许可证 ,允许商用、修改、分发,是”最干净许可”阵营中最宽松的。同时提供:
- 社区版:免费开源,社区支持
- 企业版:全托管云服务,99.95% SLA,软硬一体性能优化,多可用区部署,工单/钉群商业支持
- 飞天专属版:匹配业务规模,按需协商极致SLA保障
💡 Higress的独特定位:它是”API封装/LLM网关”子类中国产AI原生云原生网关的标杆。与LiteLLM(Python生态、100+提供商、网关+SDK双形态)、One API(Go语言、中文社区经典、中转分发)、Portkey Gateway(TypeScript轻量、边缘部署、Guardrails原生)、Kong AI Gateway(企业级云原生、LLM/MCP/A2A三类流量治理)形成差异化:Higress的核心竞争力在”CNCF Sandbox项目 + 基于Envoy生产级云原生网关 + 阿里内部2年+生产验证 + 100+大模型统一接入 + MCP Server托管 + 国产模型覆盖最全 + Apache-2.0许可” 。它是API封装层的”国产企业级代表”,Apache-2.0许可 与LiteLLM/One API/Portkey Gateway并列最干净许可阵营。Higress自己不执行推理计算(非vLLM/SGLang那种推理引擎),而是把各家云端API或本地推理引擎统一封装,通过AI Proxy等Wasm插件提供provider-agnostic API ,在此之上提供多模型统一路由、模型级Fallback、语义缓存、Token级限流、内容安全防护、MCP统一管理、多维度鉴权与可观测性等生产级能力 。CNCF Sandbox项目身份 、阿里内部诞生并承载通义千问等核心AI业务 、5分钟Docker一键部署 ,证明了它的企业级实力与易用性。需要注意的是,Higress的插件体系基于Wasm(Go/Rust/JS) ,与Kong的Lua插件、Portkey的TypeScript实现形成技术栈差异;企业版(全托管云服务)提供99.95% SLA和商业支持,但社区版需自行兜底稳定性与性能 。对于国产模型覆盖需求强、Kubernetes原生、需要MCP Server托管、国内合规要求的企业,Higress是自然选择;而对于Python/TypeScript技术栈、轻量需求、海外100+提供商统一场景,LiteLLM/Portkey Gateway仍是更合适的选择。
核心能力
- AI原生云原生网关:基于Istio和Envoy构建,Wasm插件扩展(Go/Rust/JS)
- CNCF Sandbox项目:Apache-2.0许可,开源治理规范
- 100+大模型统一接入:OpenAI/Claude/Gemini/通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元/MiniMax/Ollama等全覆盖
- 多模型统一路由与协议转换:屏蔽不同厂商鉴权、接口差异,便于快速切换与多活部署
- 模型负载均衡与Fallback:提升模型服务的可靠性
- MCP Server托管:支持HTTP到MCP协议转换与原生MCP服务代理,统一工具入口
- openapi-to-mcp工具:快速将OpenAPI规范转换为远程MCP Server
- Token流量管理:基于Token消耗的配额管理与限流,API Key池轮转与消费者认证
- AI缓存:精确缓存及语义缓存推理的结果上下文,节省Token并减小时延
- 内容安全防护:提示词攻击检测、敏感内容识别
- 多维度鉴权与可观测性:热插拔插件和智能工具路由
- 插件生态:提供数十个开箱即用的通用插件和AI专用插件
- K8s Ingress Controller:兼容nginx ingress大量注解,支持Gateway API,路由变更生效速度比ingress-nginx快10倍
- 微服务网关:从Nacos/ZooKeeper/Consul/Eureka服务发现,深度集成Dubbo/Nacos/Sentinel
- 安全网关:支持WAF和key-auth/hmac-auth/jwt-auth/basic-auth/oidc等认证策略
- 流式友好:全面支持SSE等流式请求,优化大模型流式响应的内存与性能
- 毫秒级配置生效:彻底消除Nginx reload导致的流量抖动,特别适合AI长连接场景
- Higress Console:开箱即用的Web控制台
- 5分钟Docker一键部署:
higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest - 生产级稳定:阿里内部诞生,承载通义千问等阿里云核心AI业务,2年+生产验证,支持十万级QPS
- 多部署模式:Docker / Kubernetes Helm / 高可用集群 / 微服务网关 / 安全网关
优势亮点
- Apache-2.0最干净许可:商用、修改、分发无限制,与LiteLLM/One API/Portkey Gateway并列最宽松阵营
- CNCF Sandbox项目:开源治理规范,中立性保障
- 阿里生产级验证:诞生于阿里内部,承载通义千问模型工作室、PAI平台等核心AI业务,2年+生产验证
- 国产模型覆盖最全:通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元/MiniMax全覆盖,是国产AI网关的最强代表
- AI原生设计:从头为AI场景设计,全面支持SSE流式、长连接、Token级治理,而非传统网关嫁接AI插件
- Envoy生产级底座:基于Istio/Envoy,毫秒级配置生效,彻底消除Nginx reload流量抖动
- MCP Server托管能力:统一认证、细粒度限流、审计日志、可观测性,动态更新不中断连接
- 100+大模型统一接入:国内外主流模型厂商全覆盖,模型级Fallback提升可靠性
- Wasm插件热更新:插件可热更新、独立升级,支持跨语言开发(Go/Rust/JS)
- K8s原生友好:作为Ingress Controller兼容nginx ingress注解,支持Gateway API,路由变更生效快10倍
- 5分钟Docker一键部署:个人开发者本地体验极低门槛
- 企业版商业支持:全托管云服务99.95% SLA,多可用区部署,工单/钉群商业支持
局限
- 自己不执行推理:Higress是协议转换与流量治理层,后端必须接各家API或本地推理引擎(Ollama/vLLM)
- Wasm插件技术栈:插件开发主要用Go/Rust/JS(Wasm),Python-native AI团队需评估学习成本
- 企业版需商业订阅:全托管云服务、99.95% SLA、软硬一体性能优化等高级特性在企业版
- 社区版需自行兜底:稳定性与性能需自行保障
- 海外提供商适配:虽支持100+模型,但海外新模型Day-1适配速度可能不及LiteLLM
- 上手门槛在K8s侧:没有容器经验的小团队建议先用托管版或docker-compose起步
- Lua/Python生态不如Kong/LiteLLM:插件生态虽丰富,但以Go/Rust/JS为主,Python AI团队需适应
- 轻量场景可能过重:对于简单的中转需求,Higress的全功能数据平面可能显得过重
适用人群
- Kubernetes原生企业:需要K8s Ingress Controller或Gateway API模式的AI网关
- 国产模型覆盖需求强:需要通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元等国产模型统一接入
- AI Agent平台开发者:需要MCP Server托管,统一工具入口与治理
- 国内合规要求企业:CNCF Sandbox项目、Apache-2.0许可、阿里云生态深度集成
- 已采用阿里云产品:与阿里云WAF/KMS/IDAAS深度集成,企业版提供99.95% SLA
- 微服务+AI统一治理:需要同时管理AI流量与传统微服务流量的组织
- 长连接AI场景:SSE流式、大模型长连接,Higress的毫秒级配置生效优势明显
- 企业级AI治理需求:Token级限流、内容安全、多维度鉴权、可观测性
- 多模型路由需求:需要在国内外100+模型间动态路由与Fallback
安装与部署
1. 环境要求
- Docker(最简部署)或Kubernetes(生产部署)
- 或阿里云Higress企业版(全托管)
2. Docker一键部署(5分钟本地体验)
# 创建工作目录
mkdir higress; cd higress
# 启动Higress
docker run -d --rm --name higress-ai \
-v ${PWD}:/data \
-p 8001:8001 \
-p 8080:8080 \
-p 8443:8443 \
higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest
# 端口说明:
# 8001: Higress UI控制台入口
# 8080: 网关HTTP协议入口
# 8443: 网关HTTPS协议入口
3. Kubernetes Helm部署
# 参考官方Quick Start文档进行Helm部署 # https://higress.cn/docs/latest/quickstart/helm/
4. 配置AI代理插件(通义千问示例)
# AI代理插件配置示例
provider:
type: qwen
apiTokens:
- "你自己的通义千问API Key"
modelMapping:
# 映射配置:默认将所有OpenAI模型按能力和价格映射到通义千问
"gpt-4": "qwen-max"
"gpt-3.5-turbo": "qwen-plus"
qwenEnableSearch: true # 开启通义千问联网搜索能力
5. 客户端调用(OpenAI SDK兼容)
from openai import OpenAI
# 只需替换base_url为Higress网关地址
client = OpenAI(
api_key="anything",
base_url="http://localhost:8080/v1"
)
# 调用通义千问(通过Higress AI代理)
response = client.chat.completions.create(
model="qwen-max",
messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)
# 切换到DeepSeek(只需改model参数,base_url不变)
response = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": "Hello!"}]
)
6. 通过Higress将OpenAI业务迁移到通义千问
import openai
# 业务代码无需修改,只需改base_url和api_key
client = openai.OpenAI(
api_key="anything",
base_url="http://localhost:8080/v1"
)
# 使用gpt-4模型名,Higress自动映射到通义千问qwen-max
stream = client.chat.completions.create(
model="gpt-4",
messages=[{"role": "user", "content": "Hello!"}],
stream=True,
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
7. 部署前必检清单
- 确认仓库位于
github.com/higress-group/higress(官方,CNCF Sandbox项目) - 许可:Apache-2.0 ,商用无限制
- 严格属于”API封装/LLM网关”子类,自己不执行推理计算,后端需接各家API或本地推理引擎
- 最新版本v2.2.4(2026年7月),从新版MCP到Gateway API推理扩展持续演进
- 基于Istio和Envoy构建,Wasm插件扩展(Go/Rust/JS)
- 100+主流大模型统一接入与治理
- 5分钟Docker一键部署:
higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest - 阿里内部诞生,承载通义千问等阿里云核心AI业务,2年+生产验证
- 企业版提供全托管云服务99.95% SLA,社区版需自行兜底稳定性与性能
- 国产模型覆盖最全:通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元/MiniMax/Ollama
- 支持MCP Server托管:HTTP到MCP协议转换,统一工具入口
- K8s原生:作为Ingress Controller兼容nginx ingress注解,支持Gateway API
相关导航
Portkey Gateway

OpenRouter
硅基流动

OmniRoute
One API

