本指南将引导你在 AI Gateway 中设置评估的流程。这些步骤在 Cloudflare 仪表板 ↗中完成。
数据集是存储用于分析的日志集合,可用于评估。你可以在 Logs 选项卡中应用过滤器创建数据集。数据集将根据设置的过滤器自动更新。
- 应用过滤器以缩小日志范围。过滤选项包括提供商、token 数量、请求状态等。
- 选择 Create Dataset(创建数据集) 以存储过滤后的日志供将来分析。
你可以从 Logs 选项卡选择 Manage datasets(管理数据集) 来管理数据集。
| 过滤类别 | 过滤选项 | 过滤说明 |
|---|---|---|
| Status | error, status | 错误类型或状态。 |
| Cache | cached, not cached | 基于是否被缓存。 |
| Provider | specific providers | 选定的 AI 提供商。 |
| AI Models | specific models | 选定的 AI 模型。 |
| Cost | less than, greater than | 成本,指定阈值。 |
| Request type | Workers AI Binding, WebSockets | 请求类型。 |
| Tokens | Total tokens, Tokens In, Tokens Out | token 数量(小于或大于)。 |
| Duration | less than, greater than | 请求持续时间。 |
| Feedback | equals, does not equal (thumbs up, thumbs down, no feedback) | 反馈类型。 |
| Metadata Key | equals, does not equal | 特定元数据键。 |
| Metadata Value | equals, does not equal | 特定元数据值。 |
| Log ID | equals, does not equal | 特定 Log ID。 |
| Event ID | equals, does not equal | 特定 Event ID。 |
创建数据集后,选择评估参数:
- Cost:计算数据集中推理请求的平均成本(仅适用于具有成本数据的请求)。
- Speed:计算数据集中推理请求的平均持续时间。
- Performance:
- Human feedback:基于人工反馈衡量性能,通过 Logs 选项卡中标注的日志点赞百分比计算。
- 为评估创建唯一名称,以便在仪表板中引用。
- 审查选定的数据集和评估器。
- 选择 Run(运行) 开始流程。
评估结果将显示在 Evaluations 选项卡中。结果显示评估状态(例如,进行中、已完成或错误)。将显示所选评估器的指标,不包括缺少字段的日志。你还将看到用于计算每个指标的日志数量。
虽然数据集根据过滤器自动更新,但评估不会。如果要评估新日志,需要创建新的评估。
使用这些洞察根据应用的优先级进行优化。根据结果,你可以选择:
- 更改模型或提供商
- 调整提示
- 探索进一步优化,例如设置检索增强生成 (RAG)