围绕同一份产品说明连续问几个问题,是很适合认真看缓存的场景。资料不变、问题在变,反复处理那一大段前缀可能占不少输入预算。不过我不建议看到缓存读取便宜就默认打开最长时长:第一次写入也收费,后面能不能命中才决定值不值。
五分钟和一小时,首次成本不同
当前 Anthropic 价格说明,5分钟缓存写入为基础输入价1.25倍,1小时为2倍。读取倍率按模型区别:Sonnet 5.5 为0.1倍,Fable 5.1 等有更低比例,不能将一个倍率套给所有模型。[1]
| 你的阅读节奏 | 先考虑什么 | 要看的实际用量 |
|---|---|---|
| 连续追问同一份资料 | 较短缓存 | 写入后是否真的命中 |
| 隔较久再回来问 | 较长缓存的额外成本 | 间隔与复用次数 |
| 每次资料都变很多 | 先缩小可复用前缀 | 不把新内容也当缓存命中 |
以 Sonnet 5.5 普通输入 US$2/百万 tokens 为例,假设10万 tokens 的前缀写入5分钟缓存,再成功读取一次,前缀部分是0.25加0.02,共 US$0.27;两次都按普通输入是0.40美元。若用1小时写入再只读一次,则是0.42美元,反而略高。这个假设只比较该前缀,不含新问题、输出、额外功能和其他价格修饰条件。[1]
资料排好,缓存才有可比较的对象
我的建议是把稳定的说明与规则放在便于复用的位置,把这次新增的问题单独保留。比较时固定同一份资料和一组问题,再看实际缓存写入、读取与普通输入用量。仅仅看到回答更快,就说“缓存节省了九成整账”,证据还不够。
官方提供自动缓存与显式断点方式;具体支持和设置还要对应模型文档。[1] 本文没有进行请求实验,也没有测命中率或延迟,上面的金额只是帮助理解首次成本的算术。
先按你的追问节奏选,别按最长时长选
短时间连问同一份资料,可以先看5分钟方向;间隔较长且有足够复用,再比较1小时。每次输入都大改,就先减少无关正文、明确问题和输出要求。缓存更适合解决重复处理,不能替代你把资料整理清楚,也不能自动提高答案是否忠于原文的准确性。
资料核对与适用范围
2026-10-06直接重读所列官方公开资料;OpenAI使用OpenAI Docs官方检索及正文读取,其余官方网页直接核对。按具体任务分析选型、计费与边界,示例算术不代表账户账单或性能测试。
没有商家登录、付费调用、上传、缓存实验、资源部署或请求测试;未测时延、成功率、输出质量、真实扣费。地区、版本、额度、工具、认证方式与账户资格须对应核对。