
Together AI 是 2022 年成立于旧金山的”AI 原生云”平台,定位开源模型的全生命周期计算层——推理、微调、预训练、GPU 集群一站式。当前模型库 200+ 开源与多模态模型,涵盖 DeepSeek-V4-Pro、MiniMax M3、Kimi K2.7 Code、GLM-5.2、Qwen3.6-Plus、Llama 3.3 70B、GPT-OSS 120B/20B、Nemotron 3 Ultra 等。支持 OpenAI 兼容接口(base_url: https://api.together.xyz/v1)、SDK、REST API。Serverless API 按 token 计费无最低消费;Batch API 异步处理 30 亿 token 规模、成本降低 50%;Dedicated Inference 单租户 GPU 实例(H100 $6.49/小时、B200 $11.95/小时)。新账户第三方注册教程显示赠送 $5 试用额度(以官网当期活动为准)。海外直连 api.together.xyz 受限,需VPN(国区受限)。
产品概述
Together AI 由 CEO Vipul Ved Prakash 联合创立,核心团队源自 frontier systems 研究。2025 年 2 月完成 3.3 亿美元 B 轮(估值 $3.3B,General Catalyst 领投,NVIDIA 参投),2026 年 7 月完成 8 亿美元 C 轮——Aramco Ventures、NVIDIA、Vista Equity、General Catalyst、Salesforce Ventures 等投资,并获超 500MW 算力容量承诺。平台核心技术是自研 Together Inference Engine——结合定制 FP8 推理内核(比 PyTorch 快 75%+)、QTIP 保质量量化、Speculative Decoding 推测解码,以及 2026 年新发的 FlashAttention-4、Together Megakernel、ATLAS speculator system。客户包括 Cursor、Cognition(Devin)、Decagon、Eleven Labs、Suno 等头部 AI 公司——Decagon 迁移到 Together 后推理成本降低 6 倍。
2026 年 6 月密集上新:6/9 DeepSeek-V4-Pro 降价至 $1.74/$3.48、6/12 MiniMax M3 Day 0 上线(524K 上下文、$0.30/$1.20)、6/13 Kimi K2.7 Code 上线(262K、$0.95/$4.00)、6/17 GLM-5.2 替代 GLM-5。部署形态分四档:Serverless Inference(托管弹性)、Batch Inference(异步 50% 折扣)、Dedicated Model Inference(单租户 GPU 保证性能)、Dedicated Container Inference(生成式媒体模型专用)。
核心能力
- 文本生成:DeepSeek-V4-Pro(512K)、MiniMax M3(524K)、Kimi K2.7 Code(262K)、GLM-5.2(262K)、Qwen3.6-Plus(1M)、Llama 3.3 70B、GPT-OSS 120B/20B、Nemotron 3 Ultra 550B
- 推理:DeepSeek-V4-Pro 可控推理模式(Non-Think / Think High / Think Max)、GPT-OSS 思考模式、MiniMax M3 三档推理
- 长上下文:DeepSeek-V4-Pro 512K(模型级 1M)、MiniMax M3 524K、Qwen3.6-Plus 1M、Kimi K2.6/K2.7 Code 262K
- 多模态:MiniMax M3 / GLM-5.2 / Qwen3.7-Plus 视觉理解;FLUX.2 文生图、Ideogram 4.0、Google Imagen 4.0、ByteDance Seedream 4.0 图像生成
- 视频:Google Veo 3.0、Kling 2.1、MiniMax Hailuo 02、Wan 2.2、Vidu 2.0、PixVerse v5、ByteDance Seedance 2.0
- 语音:Cartesia Sonic 3/2 TTS($65/百万字符)、Orpheus TTS($15)、Kokoro-82M TTS($4-10)
- 转写:Whisper Large v3($0.0015/分钟)、NVIDIA Parakeet/ Nemotron 3 ASR
- 高级功能:OpenAI 兼容、Tool Use、Function Calling、JSON Mode、Structured Outputs、Reasoning、Vision、Batch API(50% 折扣)、Together Inference Engine 加速、Code Sandbox(代码沙盒,2024 年 12 月收购 CodeSandbox)
优势亮点
- 开源模型推理性能全球第一梯队:自研 Together Inference Engine + FP8 内核 + Speculative Decoding,Llama 3 8B 相对 vLLM 全精度快 3.5 倍,训练快 2.3 倍、成本低 20%
- 200+ 开源模型一字排开:DeepSeek/MiniMax/Qwen/Kimi/GLM/Llama/Nemotron/Gemma/Mistral 全系,一个 Key 调用
- 价格极具竞争力:MiniMax M3 $0.30/$1.20(524K 上下文)、DeepSeek-V4-Pro $1.74/$3.48(512K)、Llama 3.3 70B $1.04/$1.04、Llama 3 8B Lite $0.14/$0.14
- 三档部署灵活:Serverless(无最低消费)/ Batch(50% 折扣)/ Dedicated(单租户 H100 $6.49/小时、B200 $11.95/小时)
- DeepSeek-V4-Pro 可控推理:Non-Think / Think High / Think Max 三档,按任务匹配推理深度
- Batch API 50% 折扣:异步处理可达 30 亿 token/模型,分类、离线摘要、合成数据生成成本砍半
- OpenAI 完全兼容:base_url
https://api.together.xyz/v1,原 GPT 代码改地址即可跑 - 全栈 AI 原生云:推理 + 微调(LoRA/全参)+ 预训练 + GPU 集群(H100/H200/B200/GB200/GB300)+ Code Sandbox
- 2026 年 7 月完成 8 亿美元 C 轮:NVIDIA、Aramco Ventures 等顶级投资方加持,算力容量超 500MW 承诺,企业级稳定性背书
- 头部 AI 公司共建:Cursor、Cognition、Decagon、Eleven Labs、Suno 都在 Together 上跑生产负载,Decagon 推理成本降 6 倍
- 全模态覆盖:文本/视觉/图像/视频/语音/转写/嵌入/重排序/内容审核统一 API
短板
- 仅支持开源权重模型:不提供 GPT-5/Claude Opus/Gemini Pro 等闭源旗舰,最强模型 DeepSeek-V4-Pro 在复杂推理上仍不及 Claude Opus 4.8 / GPT-5.5
- 国内需VPN(国区受限):Together 未对中国大陆开放,直连
api.together.xyz受限 - 免费额度不透明:第三方注册教程显示赠送 $5 试用额度,但官网未承诺长期固定免费档;FLUX.1 Schnell Free 图片生成完全免费(不消耗额度)
- Dedicated 实例价格高:H100 $6.49/小时、B200 $11.95/小时,长期运行成本显著高于 Serverless
- 模型迭代快、旧模型下线:2026 年 6 月 GLM-5 退役、Qwen3.5-397B-A17B 将于 6/29 下线,开发者需跟踪迁移
- Cached Input 仅部分模型支持:GLM-5.2/DeepSeek-V4-Pro/MiniMax M3/Kimi K2.7 Code 有缓存价,Llama 3.3 70B Turbo 等无缓存折扣
- 企业级 SLA 需 Provisioned Throughput:Serverless 无 SLA 保障,生产高并发建议 Dedicated 或 PTU
- 上下文长度不及顶级:DeepSeek-V4-Pro 在 Together 上仅 512K(模型级 1M),低于 Gemini 3.1 Pro(2M)
适用人群
海外开发者、AI 编程工具(Cursor 等已在用)、Agent 开发团队、需要开源模型高性能推理的场景、成本敏感的大批量调用(Batch 50% 折扣)、长上下文应用(DeepSeek-V4-Pro 512K / MiniMax M3 524K)、微调自有模型的企业、需要 GPU 集群的 AI 原生公司。
相关导航


DeepSeek API

智谱 BigModel

Claude API

火山方舟

Gemini API

MiniMax API

