跳到主要内容
返回AI API产品列表
返回深度测评
AI API · 资料评估

Anthropic缓存5分钟还是1小时:第一次写入成本也要算

Anthropic

把重复前缀、首次写入和后续命中分开,按真正的阅读节奏选择缓存时长。

围绕同一份产品说明连续问几个问题,是很适合认真看缓存的场景。资料不变、问题在变,反复处理那一大段前缀可能占不少输入预算。不过我不建议看到缓存读取便宜就默认打开最长时长:第一次写入也收费,后面能不能命中才决定值不值。

五分钟和一小时,首次成本不同

当前 Anthropic 价格说明,5分钟缓存写入为基础输入价1.25倍,1小时为2倍。读取倍率按模型区别:Sonnet 5.5 为0.1倍,Fable 5.1 等有更低比例,不能将一个倍率套给所有模型。[1]

你的阅读节奏先考虑什么要看的实际用量
连续追问同一份资料较短缓存写入后是否真的命中
隔较久再回来问较长缓存的额外成本间隔与复用次数
每次资料都变很多先缩小可复用前缀不把新内容也当缓存命中

以 Sonnet 5.5 普通输入 US$2/百万 tokens 为例,假设10万 tokens 的前缀写入5分钟缓存,再成功读取一次,前缀部分是0.25加0.02,共 US$0.27;两次都按普通输入是0.40美元。若用1小时写入再只读一次,则是0.42美元,反而略高。这个假设只比较该前缀,不含新问题、输出、额外功能和其他价格修饰条件。[1]

资料排好,缓存才有可比较的对象

我的建议是把稳定的说明与规则放在便于复用的位置,把这次新增的问题单独保留。比较时固定同一份资料和一组问题,再看实际缓存写入、读取与普通输入用量。仅仅看到回答更快,就说“缓存节省了九成整账”,证据还不够。

官方提供自动缓存与显式断点方式;具体支持和设置还要对应模型文档。[1] 本文没有进行请求实验,也没有测命中率或延迟,上面的金额只是帮助理解首次成本的算术。

先按你的追问节奏选,别按最长时长选

短时间连问同一份资料,可以先看5分钟方向;间隔较长且有足够复用,再比较1小时。每次输入都大改,就先减少无关正文、明确问题和输出要求。缓存更适合解决重复处理,不能替代你把资料整理清楚,也不能自动提高答案是否忠于原文的准确性。

资料核对与适用范围

2026-10-06直接重读所列官方公开资料;OpenAI使用OpenAI Docs官方检索及正文读取,其余官方网页直接核对。按具体任务分析选型、计费与边界,示例算术不代表账户账单或性能测试。

没有商家登录、付费调用、上传、缓存实验、资源部署或请求测试;未测时延、成功率、输出质量、真实扣费。地区、版本、额度、工具、认证方式与账户资格须对应核对。

来源与说明

  1. [1] Anthropic 官方API与计费资料

    Anthropic · 官方资料 · 核对 2026/10/06

    5m写入1.25x1h2x,读取Sonnet5.5 0.1x等不同;10万token前缀5m写0.25读0.02合0.27对普通两次0.40,1h一写一读0.42仅前缀假设;自动缓存/显式断点方向,未调用或测命中性能