Together AI翻译站点

3天前更新 5 0 0

开源模型推理首选云平台,200+ 开源与多模态模型,DeepSeek-V4-Pro 512K 上下文 $1.74/$3.48 每百万 token,MiniMax M3 仅 $0.30/$1.20,Serverless/Batch/Dedicated 三档部署,OpenAI 兼容,海外需VPN(国区受限)。

所在地:
美国旧金山
语言:
英文
收录时间:
2026-07-26
Together AITogether AI
开发商:Together AI
核心模型:DeepSeek-V4-Pro / MiniMax M3 / Kimi K2.7 Code / GLM-5.2 / Qwen3.6-Plus / Llama 3.3 70B / GPT-OSS 120B / Nemotron 3 Ultra 等 200+ 模型
上下文:DeepSeek-V4-Pro 512K(模型级 1M)、MiniMax M3 524K、Qwen3.6-Plus 1M、Kimi K2.7 Code 262K、GLM-5.2 262K、Llama 3.3 70B 128K
多模态:文本、视觉(MiniMax M3/GLM-5.2/Qwen3.7-Plus)、图像(FLUX.2/Ideogram 4.0/Imagen 4.0/Seedream 4.0)、视频(Veo 3.0/Kling 2.1/Wan 2.2/Seedance 2.0)、语音(Cartesia/Orpheus/Kokoro)、转写(Whisper/Nemotron ASR)
平台类型:官方(开源模型 AI 原生云)
计价方式:DeepSeek-V4-Pro:$1.74/$0.20(缓存)/$3.48;MiniMax M3:$0.30/$0.06(缓存)/$1.20;Kimi K2.7 Code:$0.95/$0.19(缓存)/$4.00;GLM-5.2:$1.40/$0.26(缓存)/$4.40;Llama 3.3 70B Turbo:$1.04/$1.04;Qwen3.6-Plus:$0.50/$3.00(单位:美元/百万 token);Batch API 50% 折扣;Dedicated H100 $6.49/小时
免费额度:以官网当期活动为准;FLUX.1 Schnell Free 图像生成完全免费
接入方式:OpenAI 兼容 / SDK / REST API / Batch API / Dedicated Inference
适用场景:AI 编程、智能体、长上下文应用、大批量推理(Batch 50% 折扣)、模型微调、GPU 集群训练、全模态应用
特色功能:Serverless/Batch/Dedicated 三档部署、Batch 50% 折扣、Together Inference Engine 加速、可控推理模式(DeepSeek-V4-Pro)、Tool Use、JSON Mode、Structured Outputs、Code Sandbox、LoRA/全参微调、GPU 集群租赁、200+ 开源模型
可访问性:需VPN(国区受限)

Together AI 是 2022 年成立于旧金山的”AI 原生云”平台,定位开源模型的全生命周期计算层——推理、微调、预训练、GPU 集群一站式。当前模型库 200+ 开源与多模态模型,涵盖 DeepSeek-V4-Pro、MiniMax M3、Kimi K2.7 Code、GLM-5.2、Qwen3.6-Plus、Llama 3.3 70B、GPT-OSS 120B/20B、Nemotron 3 Ultra 等。支持 OpenAI 兼容接口(base_url: https://api.together.xyz/v1)、SDK、REST API。Serverless API 按 token 计费无最低消费;Batch API 异步处理 30 亿 token 规模、成本降低 50%;Dedicated Inference 单租户 GPU 实例(H100 $6.49/小时、B200 $11.95/小时)。新账户第三方注册教程显示赠送 $5 试用额度(以官网当期活动为准)。海外直连 api.together.xyz 受限,需VPN(国区受限)

 

产品概述

Together AI 由 CEO Vipul Ved Prakash 联合创立,核心团队源自 frontier systems 研究。2025 年 2 月完成 3.3 亿美元 B 轮(估值 $3.3B,General Catalyst 领投,NVIDIA 参投),2026 年 7 月完成 8 亿美元 C 轮——Aramco Ventures、NVIDIA、Vista Equity、General Catalyst、Salesforce Ventures 等投资,并获超 500MW 算力容量承诺。平台核心技术是自研 Together Inference Engine——结合定制 FP8 推理内核(比 PyTorch 快 75%+)、QTIP 保质量量化、Speculative Decoding 推测解码,以及 2026 年新发的 FlashAttention-4、Together Megakernel、ATLAS speculator system。客户包括 Cursor、Cognition(Devin)、Decagon、Eleven Labs、Suno 等头部 AI 公司——Decagon 迁移到 Together 后推理成本降低 6 倍。

2026 年 6 月密集上新:6/9 DeepSeek-V4-Pro 降价至 $1.74/$3.48、6/12 MiniMax M3 Day 0 上线(524K 上下文、$0.30/$1.20)、6/13 Kimi K2.7 Code 上线(262K、$0.95/$4.00)、6/17 GLM-5.2 替代 GLM-5。部署形态分四档:Serverless Inference(托管弹性)、Batch Inference(异步 50% 折扣)、Dedicated Model Inference(单租户 GPU 保证性能)、Dedicated Container Inference(生成式媒体模型专用)。

 

核心能力

  • 文本生成:DeepSeek-V4-Pro(512K)、MiniMax M3(524K)、Kimi K2.7 Code(262K)、GLM-5.2(262K)、Qwen3.6-Plus(1M)、Llama 3.3 70B、GPT-OSS 120B/20B、Nemotron 3 Ultra 550B
  • 推理:DeepSeek-V4-Pro 可控推理模式(Non-Think / Think High / Think Max)、GPT-OSS 思考模式、MiniMax M3 三档推理
  • 长上下文:DeepSeek-V4-Pro 512K(模型级 1M)、MiniMax M3 524K、Qwen3.6-Plus 1M、Kimi K2.6/K2.7 Code 262K
  • 多模态:MiniMax M3 / GLM-5.2 / Qwen3.7-Plus 视觉理解;FLUX.2 文生图、Ideogram 4.0、Google Imagen 4.0、ByteDance Seedream 4.0 图像生成
  • 视频:Google Veo 3.0、Kling 2.1、MiniMax Hailuo 02、Wan 2.2、Vidu 2.0、PixVerse v5、ByteDance Seedance 2.0
  • 语音:Cartesia Sonic 3/2 TTS($65/百万字符)、Orpheus TTS($15)、Kokoro-82M TTS($4-10)
  • 转写:Whisper Large v3($0.0015/分钟)、NVIDIA Parakeet/ Nemotron 3 ASR
  • 高级功能:OpenAI 兼容、Tool Use、Function Calling、JSON Mode、Structured Outputs、Reasoning、Vision、Batch API(50% 折扣)、Together Inference Engine 加速、Code Sandbox(代码沙盒,2024 年 12 月收购 CodeSandbox)

 

优势亮点

  • 开源模型推理性能全球第一梯队:自研 Together Inference Engine + FP8 内核 + Speculative Decoding,Llama 3 8B 相对 vLLM 全精度快 3.5 倍,训练快 2.3 倍、成本低 20%
  • 200+ 开源模型一字排开:DeepSeek/MiniMax/Qwen/Kimi/GLM/Llama/Nemotron/Gemma/Mistral 全系,一个 Key 调用
  • 价格极具竞争力:MiniMax M3 $0.30/$1.20(524K 上下文)、DeepSeek-V4-Pro $1.74/$3.48(512K)、Llama 3.3 70B $1.04/$1.04、Llama 3 8B Lite $0.14/$0.14
  • 三档部署灵活:Serverless(无最低消费)/ Batch(50% 折扣)/ Dedicated(单租户 H100 $6.49/小时、B200 $11.95/小时)
  • DeepSeek-V4-Pro 可控推理:Non-Think / Think High / Think Max 三档,按任务匹配推理深度
  • Batch API 50% 折扣:异步处理可达 30 亿 token/模型,分类、离线摘要、合成数据生成成本砍半
  • OpenAI 完全兼容:base_url https://api.together.xyz/v1,原 GPT 代码改地址即可跑
  • 全栈 AI 原生云:推理 + 微调(LoRA/全参)+ 预训练 + GPU 集群(H100/H200/B200/GB200/GB300)+ Code Sandbox
  • 2026 年 7 月完成 8 亿美元 C 轮:NVIDIA、Aramco Ventures 等顶级投资方加持,算力容量超 500MW 承诺,企业级稳定性背书
  • 头部 AI 公司共建:Cursor、Cognition、Decagon、Eleven Labs、Suno 都在 Together 上跑生产负载,Decagon 推理成本降 6 倍
  • 全模态覆盖:文本/视觉/图像/视频/语音/转写/嵌入/重排序/内容审核统一 API

 

短板

  • 仅支持开源权重模型:不提供 GPT-5/Claude Opus/Gemini Pro 等闭源旗舰,最强模型 DeepSeek-V4-Pro 在复杂推理上仍不及 Claude Opus 4.8 / GPT-5.5
  • 国内需VPN(国区受限):Together 未对中国大陆开放,直连 api.together.xyz 受限
  • 免费额度不透明:第三方注册教程显示赠送 $5 试用额度,但官网未承诺长期固定免费档;FLUX.1 Schnell Free 图片生成完全免费(不消耗额度)
  • Dedicated 实例价格高:H100 $6.49/小时、B200 $11.95/小时,长期运行成本显著高于 Serverless
  • 模型迭代快、旧模型下线:2026 年 6 月 GLM-5 退役、Qwen3.5-397B-A17B 将于 6/29 下线,开发者需跟踪迁移
  • Cached Input 仅部分模型支持:GLM-5.2/DeepSeek-V4-Pro/MiniMax M3/Kimi K2.7 Code 有缓存价,Llama 3.3 70B Turbo 等无缓存折扣
  • 企业级 SLA 需 Provisioned Throughput:Serverless 无 SLA 保障,生产高并发建议 Dedicated 或 PTU
  • 上下文长度不及顶级:DeepSeek-V4-Pro 在 Together 上仅 512K(模型级 1M),低于 Gemini 3.1 Pro(2M)

 

适用人群

海外开发者、AI 编程工具(Cursor 等已在用)、Agent 开发团队、需要开源模型高性能推理的场景、成本敏感的大批量调用(Batch 50% 折扣)、长上下文应用(DeepSeek-V4-Pro 512K / MiniMax M3 524K)、微调自有模型的企业、需要 GPU 集群的 AI 原生公司。

相关导航