跳到主要内容
返回AI API产品列表
返回深度测评
AI API · 资料评估

Together AI租专用前:零散调用、PTU与GPU小时不能直接比价

Together AI

从同一组任务的有效结果和流量分布比较 Serverless、PTU 与专用 GPU。

想试几种开源模型,Serverless 的好处是可以先把注意力放在任务上:这段文本能不能按要求分类,返回格式能不能被程序读。我的建议是先挑十来个固定样本,每个模型都做同一件事;排行榜名字和参数量,暂时不能替你决定哪个结果更好用。

先分清三种费用单位

Together 当前将 Serverless、Provisioned Throughput 和 Dedicated Inference 分列。前者按相关 token 等用量,PTU 是预留容量,其每分钟 token 能力取决于模型和 token 类型;专用推理则有按 GPU 小时的价格。它们不是同一张单价表里可直接排序的数字。[1]

项目阶段先比较的方向还缺哪种记录
试模型,调用零散Serverless任务效果与实际输入输出
流量持续且峰值清楚Provisioned Throughput高峰请求、token 类型与命中率
需要自己的模型或专用部署Dedicated InferenceGPU 数量与实际使用时长

当前页面 Kimi K3 的普通输入、输出分别列每百万 tokens US$3、15;缓存输入另列。这个例子用于说明输入输出不能合成一个数字,不代表它适合所有任务或是本站质量最好的推荐。[1]

平均每小时很少,也可能一分钟挤在一起

如果白天只有几次调用,但每天某个时点要处理一批资料,我会把这种高峰单独记下来。页面的 PTU 比较器按流量与 token 条件计算,比较还假设持续预留;不能把它展示的节省比例直接当成你项目的账单折扣。[1]

先验证结果,再评估峰值。对于分类脚本,可记录哪些样本返工、哪些输出不能解析,以及失败时能否只重做该项。结果价格低但总要人工修,也可能不符合你的工作节奏。这些是评估建议,本文没有调用模型或测试处理能力。

我会等到负载有形状,再看专用

模型还在试选、调用零散,Serverless更便于建立任务和用量记录;峰值已经清楚且持续,再比较PTU;确有专用部署需要才算GPU小时。PTU比较器的持续预留假设不等于项目折扣,Dedicated Inference也不能借用GPU Clusters的另一栏报价。

资料核对与适用范围

2026-10-06直接重读所列官方公开资料;OpenAI使用OpenAI Docs官方检索及正文读取,其余官方网页直接核对。按具体任务分析选型、计费与边界,示例算术不代表账户账单或性能测试。

没有商家登录、付费调用、上传、缓存实验、资源部署或请求测试;未测时延、成功率、输出质量、真实扣费。地区、版本、额度、工具、认证方式与账户资格须对应核对。

来源与说明

  1. [1] Together AI 官方API与计费资料

    Together AI · 官方资料 · 核对 2026/10/06

    Serverless用量/PTU模型token类型容量/DedicatedGPU小时不同单位;KimiK3普通3/15每百万cached另列;PTU计算器24/7约43800min假设不当用户折扣,专用Inference不替换GPUClusters金额