想试几种开源模型,Serverless 的好处是可以先把注意力放在任务上:这段文本能不能按要求分类,返回格式能不能被程序读。我的建议是先挑十来个固定样本,每个模型都做同一件事;排行榜名字和参数量,暂时不能替你决定哪个结果更好用。
先分清三种费用单位
Together 当前将 Serverless、Provisioned Throughput 和 Dedicated Inference 分列。前者按相关 token 等用量,PTU 是预留容量,其每分钟 token 能力取决于模型和 token 类型;专用推理则有按 GPU 小时的价格。它们不是同一张单价表里可直接排序的数字。[1]
| 项目阶段 | 先比较的方向 | 还缺哪种记录 |
|---|---|---|
| 试模型,调用零散 | Serverless | 任务效果与实际输入输出 |
| 流量持续且峰值清楚 | Provisioned Throughput | 高峰请求、token 类型与命中率 |
| 需要自己的模型或专用部署 | Dedicated Inference | GPU 数量与实际使用时长 |
当前页面 Kimi K3 的普通输入、输出分别列每百万 tokens US$3、15;缓存输入另列。这个例子用于说明输入输出不能合成一个数字,不代表它适合所有任务或是本站质量最好的推荐。[1]
平均每小时很少,也可能一分钟挤在一起
如果白天只有几次调用,但每天某个时点要处理一批资料,我会把这种高峰单独记下来。页面的 PTU 比较器按流量与 token 条件计算,比较还假设持续预留;不能把它展示的节省比例直接当成你项目的账单折扣。[1]
先验证结果,再评估峰值。对于分类脚本,可记录哪些样本返工、哪些输出不能解析,以及失败时能否只重做该项。结果价格低但总要人工修,也可能不符合你的工作节奏。这些是评估建议,本文没有调用模型或测试处理能力。
我会等到负载有形状,再看专用
模型还在试选、调用零散,Serverless更便于建立任务和用量记录;峰值已经清楚且持续,再比较PTU;确有专用部署需要才算GPU小时。PTU比较器的持续预留假设不等于项目折扣,Dedicated Inference也不能借用GPU Clusters的另一栏报价。
资料核对与适用范围
2026-10-06直接重读所列官方公开资料;OpenAI使用OpenAI Docs官方检索及正文读取,其余官方网页直接核对。按具体任务分析选型、计费与边界,示例算术不代表账户账单或性能测试。
没有商家登录、付费调用、上传、缓存实验、资源部署或请求测试;未测时延、成功率、输出质量、真实扣费。地区、版本、额度、工具、认证方式与账户资格须对应核对。