Higress翻译站点

3周前发布 17 0 0

阿里开源AI原生云原生网关,CNCF沙箱项目,基于Envoy,统一治理LLM API与MCP Server,Apache-2.0许可。

语言:
英文
收录时间:
2026-08-22

Higress是阿里巴巴开源的AI原生云原生API网关,CNCF Sandbox项目,Apache-2.0许可。基于Istio和Envoy构建,通过Wasm插件(Go/Rust/JS)扩展。AI网关能力支持100+主流大模型统一协议转换、模型级Fallback、语义缓存、Token级限流、内容安全防护、多维度鉴权与可观测性,同时统一治理MCP Server。诞生于阿里内部,承载通义千问等阿里云核心AI业务的API网关,5分钟Docker一键部署。

 

项目概述

Higress由阿里巴巴开源,是CNCF Sandbox项目​ ,Apache-2.0许可证 。最新版本v2.2.4(2026年7月) ,从新版MCP到Gateway API推理扩展持续演进 。

 

核心定位哲学:

Higress官方自我定位是”AI Native API Gateway” ——它既不是纯粹的LLM网关(如LiteLLM),也不是传统的微服务网关(如Kong的原生形态),而是为AI场景从头设计的云原生网关:统一代理大模型API与MCP Server,支持模型、工具(MCP)及Agent的集中接入与管理 。

 

技术基因

Higress基于Istio和Envoy构建 ,核心扩展性通过Wasm插件交付,插件可用Go/Rust/JavaScript编写 。这使它具备:

  • 生产级稳定:诞生于阿里内部,承载阿里云通义千问模型工作室、机器学习PAI平台等核心AI业务 ,在阿里内部经历2年以上生产验证,支持十万级QPS大规模场景
  • 毫秒级配置生效:彻底消除Nginx reload导致的流量抖动,配置变更毫秒生效且对业务透明,特别适合AI业务的长连接场景
  • 流式友好:全面支持SSE等流式请求,优化大模型流式响应的内存与性能占用

 

它做什么 / 不做什么(关键归类):

  • :接收客户端请求 → 通过AI Proxy等Wasm插件翻译成目标提供商native请求 → 调用提供商API → 返回响应 → 在此之上提供多模型统一路由、协议转换、语义缓存、Token级限流、内容安全防护、MCP统一管理、可观测
  • 不做:自己不加载模型权重、不管理KV Cache、不执行推理计算。它严格属于”API封装/LLM网关”子类,不是推理引擎;后端接的是各家云端API或本地推理引擎
  • 本质是AI原生网关:AI能力通过Wasm插件体系启用,与网关原有数十个通用插件(认证、限流、日志、监控、WAF)无缝组合

 

AI网关核心能力(官方定义) :

  1. 多模型统一接入:对OpenAI兼容接口及主流大模型服务提供统一网关入口,屏蔽不同厂商鉴权、接口差异,便于快速切换与多活部署;支持模型负载均衡及Fallback
  2. MCP统一管理:支持HTTP到MCP的协议转换,以及原生MCP服务的代理,把分散的工具能力收敛为统一入口
  3. Token流量管理:除传统QPS限流外,提供基于Token消耗的配额管理与限流,结合API Key池轮转与消费者认证机制
  4. AI缓存:支持精确缓存及语义缓存推理的结果上下文,节省Token并减小时延
  5. 内容安全防护:提示词攻击检测、敏感内容识别
  6. 热插拔插件与智能工具路由:通过插件快速集成RAG、向量数据库、日志可观测、缓存等AI生态组件
  7. 多维度鉴权与可观测性

 

模型提供商支持

Higress已支持100+主流大模型的统一接入与治理​ ,国内外主流模型厂商全覆盖:

  • 国际:OpenAI、Azure OpenAI、Anthropic Claude、Google Gemini、Groq等
  • 国产:通义千问、DeepSeek、月之暗面(Kimi)、百川智能、智谱AI、阶跃星辰、文心一言、腾讯混元、MiniMax、Ollama等
  • AI代理插件:支持对接多厂商协议

 

MCP Server托管能力​ :

Higress通过插件机制托管MCP Server,使AI Agent轻松调用各种工具和服务:

  • 统一认证与授权机制
  • 细粒度限流防止滥用
  • 完善的工具调用审计日志
  • 丰富的可观测性监控性能
  • 通过插件机制简化部署
  • 动态更新不中断连接
  • openapi-to-mcp工具快速将OpenAPI规范转换为远程MCP Server

 

部署形态

  • Docker一键启动docker run -d --rm --name higress-ai -v ${PWD}:/data -p 8001:8001 -p 8080:8080 -p 8443:8443 higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest
  • Kubernetes Helm部署:作为K8s Ingress Controller,兼容nginx ingress大量注解,支持Gateway API,路由变更生效速度比ingress-nginx快10倍
  • 微服务网关:从Nacos、ZooKeeper、Consul、Eureka等服务注册中心发现服务,深度集成Dubbo、Nacos、Sentinel
  • 安全网关:支持WAF和key-auth、hmac-auth、jwt-auth、basic-auth、oidc等认证策略
  • Higress Console:提供开箱即用的Web控制台

 

许可策略:Apache-2.0许可证 ,允许商用、修改、分发,是”最干净许可”阵营中最宽松的。同时提供:

  • 社区版:免费开源,社区支持
  • 企业版:全托管云服务,99.95% SLA,软硬一体性能优化,多可用区部署,工单/钉群商业支持
  • 飞天专属版:匹配业务规模,按需协商极致SLA保障

💡 Higress的独特定位:它是”API封装/LLM网关”子类中国产AI原生云原生网关的标杆。与LiteLLM(Python生态、100+提供商、网关+SDK双形态)、One API(Go语言、中文社区经典、中转分发)、Portkey Gateway(TypeScript轻量、边缘部署、Guardrails原生)、Kong AI Gateway(企业级云原生、LLM/MCP/A2A三类流量治理)形成差异化:Higress的核心竞争力在”CNCF Sandbox项目 + 基于Envoy生产级云原生网关 + 阿里内部2年+生产验证 + 100+大模型统一接入 + MCP Server托管 + 国产模型覆盖最全 + Apache-2.0许可” 。它是API封装层的”国产企业级代表”,Apache-2.0许可 与LiteLLM/One API/Portkey Gateway并列最干净许可阵营。Higress自己不执行推理计算(非vLLM/SGLang那种推理引擎),而是把各家云端API或本地推理引擎统一封装,通过AI Proxy等Wasm插件提供provider-agnostic API ,在此之上提供多模型统一路由、模型级Fallback、语义缓存、Token级限流、内容安全防护、MCP统一管理、多维度鉴权与可观测性等生产级能力 。CNCF Sandbox项目身份 、阿里内部诞生并承载通义千问等核心AI业务 、5分钟Docker一键部署 ,证明了它的企业级实力与易用性。需要注意的是,Higress的插件体系基于Wasm(Go/Rust/JS) ,与Kong的Lua插件、Portkey的TypeScript实现形成技术栈差异;企业版(全托管云服务)提供99.95% SLA和商业支持,但社区版需自行兜底稳定性与性能 。对于国产模型覆盖需求强、Kubernetes原生、需要MCP Server托管、国内合规要求的企业,Higress是自然选择;而对于Python/TypeScript技术栈、轻量需求、海外100+提供商统一场景,LiteLLM/Portkey Gateway仍是更合适的选择。

 

核心能力

  • AI原生云原生网关:基于Istio和Envoy构建,Wasm插件扩展(Go/Rust/JS)
  • CNCF Sandbox项目:Apache-2.0许可,开源治理规范
  • 100+大模型统一接入:OpenAI/Claude/Gemini/通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元/MiniMax/Ollama等全覆盖
  • 多模型统一路由与协议转换:屏蔽不同厂商鉴权、接口差异,便于快速切换与多活部署
  • 模型负载均衡与Fallback:提升模型服务的可靠性
  • MCP Server托管:支持HTTP到MCP协议转换与原生MCP服务代理,统一工具入口
  • openapi-to-mcp工具:快速将OpenAPI规范转换为远程MCP Server
  • Token流量管理:基于Token消耗的配额管理与限流,API Key池轮转与消费者认证
  • AI缓存:精确缓存及语义缓存推理的结果上下文,节省Token并减小时延
  • 内容安全防护:提示词攻击检测、敏感内容识别
  • 多维度鉴权与可观测性:热插拔插件和智能工具路由
  • 插件生态:提供数十个开箱即用的通用插件和AI专用插件
  • K8s Ingress Controller:兼容nginx ingress大量注解,支持Gateway API,路由变更生效速度比ingress-nginx快10倍
  • 微服务网关:从Nacos/ZooKeeper/Consul/Eureka服务发现,深度集成Dubbo/Nacos/Sentinel
  • 安全网关:支持WAF和key-auth/hmac-auth/jwt-auth/basic-auth/oidc等认证策略
  • 流式友好:全面支持SSE等流式请求,优化大模型流式响应的内存与性能
  • 毫秒级配置生效:彻底消除Nginx reload导致的流量抖动,特别适合AI长连接场景
  • Higress Console:开箱即用的Web控制台
  • 5分钟Docker一键部署higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest
  • 生产级稳定:阿里内部诞生,承载通义千问等阿里云核心AI业务,2年+生产验证,支持十万级QPS
  • 多部署模式:Docker / Kubernetes Helm / 高可用集群 / 微服务网关 / 安全网关

 

优势亮点

  • Apache-2.0最干净许可:商用、修改、分发无限制,与LiteLLM/One API/Portkey Gateway并列最宽松阵营
  • CNCF Sandbox项目:开源治理规范,中立性保障
  • 阿里生产级验证:诞生于阿里内部,承载通义千问模型工作室、PAI平台等核心AI业务,2年+生产验证
  • 国产模型覆盖最全:通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元/MiniMax全覆盖,是国产AI网关的最强代表
  • AI原生设计:从头为AI场景设计,全面支持SSE流式、长连接、Token级治理,而非传统网关嫁接AI插件
  • Envoy生产级底座:基于Istio/Envoy,毫秒级配置生效,彻底消除Nginx reload流量抖动
  • MCP Server托管能力:统一认证、细粒度限流、审计日志、可观测性,动态更新不中断连接
  • 100+大模型统一接入:国内外主流模型厂商全覆盖,模型级Fallback提升可靠性
  • Wasm插件热更新:插件可热更新、独立升级,支持跨语言开发(Go/Rust/JS)
  • K8s原生友好:作为Ingress Controller兼容nginx ingress注解,支持Gateway API,路由变更生效快10倍
  • 5分钟Docker一键部署:个人开发者本地体验极低门槛
  • 企业版商业支持:全托管云服务99.95% SLA,多可用区部署,工单/钉群商业支持

 

局限

  • 自己不执行推理:Higress是协议转换与流量治理层,后端必须接各家API或本地推理引擎(Ollama/vLLM)
  • Wasm插件技术栈:插件开发主要用Go/Rust/JS(Wasm),Python-native AI团队需评估学习成本
  • 企业版需商业订阅:全托管云服务、99.95% SLA、软硬一体性能优化等高级特性在企业版
  • 社区版需自行兜底:稳定性与性能需自行保障
  • 海外提供商适配:虽支持100+模型,但海外新模型Day-1适配速度可能不及LiteLLM
  • 上手门槛在K8s侧:没有容器经验的小团队建议先用托管版或docker-compose起步
  • Lua/Python生态不如Kong/LiteLLM:插件生态虽丰富,但以Go/Rust/JS为主,Python AI团队需适应
  • 轻量场景可能过重:对于简单的中转需求,Higress的全功能数据平面可能显得过重

 

适用人群

  • Kubernetes原生企业:需要K8s Ingress Controller或Gateway API模式的AI网关
  • 国产模型覆盖需求强:需要通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元等国产模型统一接入
  • AI Agent平台开发者:需要MCP Server托管,统一工具入口与治理
  • 国内合规要求企业:CNCF Sandbox项目、Apache-2.0许可、阿里云生态深度集成
  • 已采用阿里云产品:与阿里云WAF/KMS/IDAAS深度集成,企业版提供99.95% SLA
  • 微服务+AI统一治理:需要同时管理AI流量与传统微服务流量的组织
  • 长连接AI场景:SSE流式、大模型长连接,Higress的毫秒级配置生效优势明显
  • 企业级AI治理需求:Token级限流、内容安全、多维度鉴权、可观测性
  • 多模型路由需求:需要在国内外100+模型间动态路由与Fallback

 

安装与部署

 

1. 环境要求

  • Docker(最简部署)或Kubernetes(生产部署)
  • 或阿里云Higress企业版(全托管)

 

2. Docker一键部署(5分钟本地体验)

# 创建工作目录
mkdir higress; cd higress

# 启动Higress
docker run -d --rm --name higress-ai \
  -v ${PWD}:/data \
  -p 8001:8001 \
  -p 8080:8080 \
  -p 8443:8443 \
  higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest

# 端口说明:
# 8001: Higress UI控制台入口
# 8080: 网关HTTP协议入口
# 8443: 网关HTTPS协议入口

 

3. Kubernetes Helm部署

# 参考官方Quick Start文档进行Helm部署
# https://higress.cn/docs/latest/quickstart/helm/

 

4. 配置AI代理插件(通义千问示例)

# AI代理插件配置示例
provider:
  type: qwen
  apiTokens:
    - "你自己的通义千问API Key"
  modelMapping:
    # 映射配置:默认将所有OpenAI模型按能力和价格映射到通义千问
    "gpt-4": "qwen-max"
    "gpt-3.5-turbo": "qwen-plus"
  qwenEnableSearch: true  # 开启通义千问联网搜索能力

 

5. 客户端调用(OpenAI SDK兼容)

from openai import OpenAI

# 只需替换base_url为Higress网关地址
client = OpenAI(
    api_key="anything",
    base_url="http://localhost:8080/v1"
)

# 调用通义千问(通过Higress AI代理)
response = client.chat.completions.create(
    model="qwen-max",
    messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)

# 切换到DeepSeek(只需改model参数,base_url不变)
response = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Hello!"}]
)

 

6. 通过Higress将OpenAI业务迁移到通义千问

import openai

# 业务代码无需修改,只需改base_url和api_key
client = openai.OpenAI(
    api_key="anything",
    base_url="http://localhost:8080/v1"
)

# 使用gpt-4模型名,Higress自动映射到通义千问qwen-max
stream = client.chat.completions.create(
    model="gpt-4",
    messages=[{"role": "user", "content": "Hello!"}],
    stream=True,
)
for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

 

7. 部署前必检清单

  • 确认仓库位于 github.com/higress-group/higress(官方,CNCF Sandbox项目)
  • 许可:Apache-2.0 ,商用无限制
  • 严格属于”API封装/LLM网关”子类,自己不执行推理计算,后端需接各家API或本地推理引擎
  • 最新版本v2.2.4(2026年7月),从新版MCP到Gateway API推理扩展持续演进
  • 基于Istio和Envoy构建,Wasm插件扩展(Go/Rust/JS)
  • 100+主流大模型统一接入与治理
  • 5分钟Docker一键部署:higress-registry.cn-hangzhou.cr.aliyuncs.com/higress/all-in-one:latest
  • 阿里内部诞生,承载通义千问等阿里云核心AI业务,2年+生产验证
  • 企业版提供全托管云服务99.95% SLA,社区版需自行兜底稳定性与性能
  • 国产模型覆盖最全:通义/DeepSeek/月之暗面/百川/智谱/阶跃/文心/混元/MiniMax/Ollama
  • 支持MCP Server托管:HTTP到MCP协议转换,统一工具入口
  • K8s原生:作为Ingress Controller兼容nginx ingress注解,支持Gateway API

相关导航