随着应用程序的扩展,尤其是在使用多家提供商时,AI 推理成本可能会不可预测地增长。Cloudflare AI Gateway 缓存相同的查询以避免冗余的推理调用,按用户或 API 密钥应用速率限制,并在所有提供商之间提供统一的分析。
跨提供商缓存响应、限制请求速率和监控使用情况。了解有关 AI Gateway 的更多信息。
- 响应缓存 - 缓存相同的查询,这样重复的 prompt 就不会触发新的推理调用
- 速率限制 - 针对每个用户或应用程序编程接口 (API) 密钥设置请求限制,以防止滥用和控制开销
- 统一分析 - 从一个仪表板跟踪所有 AI 提供商的使用情况、延迟和成本
存储并查询来自 Workers 的时间序列分析数据。了解有关 Workers Analytics Engine 的更多信息。
- 自定义指标 - 构建针对 AI 的仪表板,跟踪 token、延迟分布和错误率