GroqCloud翻译站点

3天前更新 5 0 0

自研 LPU 芯片把开源模型推理速度推到 280-1000 tokens/秒,Llama 3.3 70B 仅 $0.59/$0.79 每百万 token,免费层 14,400 请求/天,OpenAI 兼容,海外需VPN(国区受限)。

所在地:
美国
语言:
英文
收录时间:
2026-07-26
GroqCloudGroqCloud
开发商:Groq
核心模型:Llama 3.3 70B / Llama 3.1 8B / GPT-OSS 120B / GPT-OSS 20B / Qwen3 32B / Kimi K2 / DeepSeek-R1-Distill 70B / Whisper Large V3
上下文:131K(主流模型),Kimi K2 为 256K
多模态:文本、图像(Llama 4 Scout/Maverick)、Whisper 语音转写、Compound 智能体(web search + code execution)
平台类型:官方
计价方式: Llama 3.1 8B:$0.05/$0.08;Llama 3.3 70B:$0.59/$0.79;GPT-OSS 20B:$0.075/$0.30;GPT-OSS 120B:$0.15/$0.60;Qwen3 32B:$0.29/$0.59;Kimi K2:$1.00/$3.00;Whisper V3 Turbo:$0.04/小时(单位:美元/百万 token)
免费额度:免费层所有模型可用,30 RPM / 14,400 RPD,无需信用卡;Developer 层加信用卡后限额提升 10 倍 + 25% token 折扣
接入方式:OpenAI 兼容(base_url: https://api.groq.com/openai/v1)/ Groq SDK / REST API / Responses API
适用场景:实时对话、语音助手、Agent 多步编排、AI 编程、高吞吐推理、语音转写、开源模型推理
特色功能:LPU 极速推理(280-1000 t/s)、OpenAI 兼容、Responses API(browser_search/code_interpreter/structured outputs)、Tool Use、Compound 智能体、Prompt Caching、Whisper 极速转写、免费层 14,400 RPD
可访问性:需VPN(国区受限)

GroqCloud 是 Groq 公司推出的极速大模型推理平台,基于自研 LPU(Language Processing Unit)​ 专用推理芯片,不训练自有模型,专跑开源权重模型。当前模型矩阵涵盖 GPT-OSS 120B/20B、Llama 3.3 70B、Llama 3.1 8B、Qwen3 32B、Kimi K2、DeepSeek-R1 蒸馏版、Whisper 语音转写等。支持 OpenAI 兼容接口(base_url: https://api.groq.com/openai/v1)、Groq Python/JS SDK、REST API。免费层所有模型可用,30 RPM / 14,400 RPD 限额,无需信用卡;付费层按 token 计费无月费。海外直连 api.groq.com 受限,需VPN(国区受限)

 

产品概述

Groq 于 2016 年成立,2024 年因 LPU 跑 Llama 3 突破 800 tokens/秒引发关注。LPU 采用确定性流水线架构,片上 SRAM 取代 GPU 的外部 HBM,彻底消除 GPU 批处理的内存争用与调度延迟——单请求速度 280-1000 t/s 且尾部延迟等于中位数延迟。2025 年 4 月 Llama 4 Scout Day 0 上线即超 460 t/s;2025 年 12 月 NVIDIA 以约 $200 亿授权 LPU 技术,GroqCloud 在新领导下独立运营,第二代 Groq 3 LPU 进入 NVIDIA Vera Rubin 平台路线图。2026 年 Artificial Analysis 独立基准:Groq 在 Llama 3.3 70B 上输出 328.3 t/s、TTFT 0.96s,是 15 家追踪供应商中最快;TokenMix 基准中 Groq 中位 TTFT 120ms、P95/P50 比值 2.3x,是基准中最稳定的供应商。当前官方模型页显示:GPT-OSS 20B 达 1000 t/s、Llama 3.1 8B 560 t/s、GPT-OSS 120B 500 t/s、Llama 3.3 70B 280 t/s,上下文统一 131,072 token。2026 年平台新增 Responses API(支持 browser_search、code_interpreter、structured outputs),Groq Compound 智能体系统(web search + code execution)正式可用。

 

核心能力

  • 文本生成:Llama 3.3 70B(复杂任务)、Llama 3.1 8B(实时高并发)、Qwen3 32B、Kimi K2(256K 上下文)、GPT-OSS 120B/20B
  • 推理:DeepSeek-R1-Distill 70B、GPT-OSS 120B/20B 思考模式、Compound 智能体系统
  • 语音转写:Whisper Large V3($0.111/小时)、Whisper Large V3 Turbo($0.04/小时)
  • 多模态:Llama 4 Scout / Maverick 支持图像输入
  • 高级功能:OpenAI Chat Completions 兼容、Responses API(browser_search / code_interpreter / structured outputs)、Tool Use、JSON Output、流式输出、Prompt Caching(GPT-OSS 20B 支持)、Compound 智能体编排

 

优势亮点

  • 全球最快开源模型推理:LPU 专属芯片,GPT-OSS 20B 1000 t/s、Llama 3.1 8B 560 t/s、Llama 3.3 70B 280-394 t/s,是同类 GPU 云的 4-6 倍
  • 确定性低延迟:中位 TTFT 120ms、P95/P50 比值 2.3x,尾部延迟等于中位数——Agent 多步调用累积延迟优势巨大
  • 价格极致亲民:Llama 3.1 8B 输入 $0.05/输出 $0.08 每百万 token,是生产环境最便宜的推理之一;Llama 3.3 70B 仅 $0.59/$0.79
  • 免费层慷慨:所有模型 30 RPM / 14,400 RPD,无需信用卡,足够原型验证和低并发生产
  • OpenAI 完全兼容:两行代码切换 base_url 即可从 OpenAI 迁到 Groq,LangChain/Cursor/Claude Code/Cline 全兼容
  • Responses API 现代化:browser_search 联网、code_interpreter 代码执行、structured outputs JSON 约束,智能体开发一站式
  • Kimi K2 256K 上下文:Groq 上最强推理模型,覆盖长文档场景
  • Whisper 转写极速且便宜:Whisper Large V3 Turbo 仅 $0.04/小时,228x 实时,比 OpenAI Whisper API 便宜 89%

 

短板

  • 仅支持开源权重模型:不提供 GPT-5/Claude Opus/Gemini Pro 等闭源旗舰,模型能力上限受限于开源阵营(最强 Kimi K2 仍不及 Claude Opus 4.8
  • 上下文较短:主流模型 131K 上下文,低于 DeepSeek V4(1M)、GLM-5.2(500K)、Gemini 3.1 Pro(2M)
  • 国内需VPN(国区受限):Groq 未对中国大陆开放,直连 api.groq.com 受限
  • 免费层限额严格:30 RPM / 14,400 RPD,生产高并发必须升 Developer/Enterprise 付费层
  • 无 Batch API 官方折扣:CloudZero 2026 年 5 月报告指出 Batch 和 Prompt Caching 各 50% 折扣可叠加,但官方模型页未明确所有模型支持;目前仅 GPT-OSS 20B 确认支持 Prompt Caching
  • 模型菜单固定:Groq 策展模型列表,不支持自部署自定义模型(DeepInfra 等 GPU 云可自部署,Groq 不行)
  • 企业级 SLA 需商务洽谈:免费层和 Developer 层无 SLA,Enterprise 定制
  • NVIDIA 收购技术授权后的长期独立性:虽当前独立运营,但二代 LPU 已进入 NVIDIA 路线图,长期定位有变数

 

适用人群

海外开发者、实时对话/语音助手(需 sub-200ms TTFT)、Agent 多步编排(累积延迟敏感)、成本敏感的高吞吐场景、开源模型爱好者、AI 编程工具(Cursor/Claude Code 接入 Llama 3.3 70B)、语音转写批量处理(Whisper 极速便宜)、想薅免费额度做原型验证的开发者。

相关导航