微信扫码
添加专属顾问
我要投稿
今天,我们介绍了 Prompt Caching 功能,允许开发者减少成本和延迟。通过重用最近看到的输入token,开发者可以获得50%的折扣和更快的提示处理时间。
从今天开始,Prompt Caching 自动应用于最新版本的 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini,以及这些模型的细调版本。缓存的提示比未缓存的提示更便宜。
以下是定价概述:
| 模型 | 原价 | 缓存价格 | 每小时价格 |
|---|---|---|---|
| GPT-4o-2024-08-06 | $2.50 | $1.25 | $10.00 | |
| GPT-4o 细调 | $3.75 | $1.875 | $15.00 | |
| GPT-4o mini-2024-07-18 | $0.15 | $0.075 | $0.60 | |
| GPT-4o mini 细调 | $0.30 | $0.15 | $1.20 | |
| o1-preview | $15.00 | $7.50 | $60.00 | |
| o1 mini | $3.00 | $1.50 | $12.00 |
对支持模型的 API 调用将自动从提示缓存中受益,前提是提示长度超过 1024 个token。API 缓存之前计算过的提示的最长前缀,从 1024 个token开始,增加 128 个token的增量。如果您重用具有共同前缀的提示,我们将自动应用 Prompt Caching 折扣,无需对 API 集成进行任何更改。
使用 Prompt Caching 的请求在 API 响应中的 ‘usage’ 字段中包含 ‘cached_tokens’ 值:
usage: {
total_tokens: 2306,
prompt_tokens: 2006,
completion_tokens: 300,
prompt_tokens_details: {
cached_tokens: 1920,
audio_tokens: 0,
},
completion_tokens_details: {
reasoning_tokens: 0,
audio_tokens: 0,
}
}
缓存通常在不活动 5-10 分钟后清除,并在缓存最后使用后的一小时内始终删除。如所有 API 服务一样,Prompt Caching 遵守我们的企业隐私承诺。提示缓存不会在组织之间共享。
Prompt Caching 是开发者在生产环境中扩展应用程序时平衡性能、成本和延迟的一种工具。更多信息,请参阅 [Prompt Caching 文档]。**
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-14
多轮 Agent 场景下,滴滴的 EAGLE-3 训推加速实践
2026-05-06
谁说 Mac 只能写代码?Google 官宣:M 芯片本地微调 Gemma 4 时代开启!
2026-04-20
用 Unsloth 微调 Embedding 模型,让你的 RAG 检索不再答非所问
2026-04-15
ComfyUI v0.19.0 更新:大量新节点、新模型、新修复与性能优化全面落地,工作流与训练能力再升级
2026-04-13
Agent 持续学习落地路径:先做 Traces,再做 Context,最后才微调模型 | Jinqiu Select
2026-03-23
养死四只龙虾的小白有感
2026-03-22
Mistral Forge 的真正意义:企业AI从“租用”走向“拥有”
2026-03-21
马斯克再次站台Kimi,扒掉了Cursor 500亿估值的底裤
2026-03-19
2026-04-15
2026-03-21
2026-03-03
2026-03-23
2026-03-22
2026-03-17
2026-04-13
2026-04-20
2026-05-06
2026-01-02
2025-11-19
2025-09-25
2025-06-20
2025-06-17
2025-05-21
2025-05-17
2025-05-14