跳转到内容
搜索文档

设置 Evaluations

最后更新 查看 MarkdownAgent 设置

本指南将引导你在 AI Gateway 中设置评估的流程。这些步骤在 Cloudflare 仪表板中完成。

1. 选择或创建数据集

数据集是存储用于分析的日志集合,可用于评估。你可以在 Logs 选项卡中应用过滤器创建数据集。数据集将根据设置的过滤器自动更新。

从 Logs 选项卡设置数据集

  1. 应用过滤器以缩小日志范围。过滤选项包括提供商、token 数量、请求状态等。
  2. 选择 Create Dataset(创建数据集) 以存储过滤后的日志供将来分析。

你可以从 Logs 选项卡选择 Manage datasets(管理数据集) 来管理数据集。

可用过滤器列表

过滤类别 过滤选项 过滤说明
Status error, status 错误类型或状态。
Cache cached, not cached 基于是否被缓存。
Provider specific providers 选定的 AI 提供商。
AI Models specific models 选定的 AI 模型。
Cost less than, greater than 成本,指定阈值。
Request type Workers AI Binding, WebSockets 请求类型。
Tokens Total tokens, Tokens In, Tokens Out token 数量(小于或大于)。
Duration less than, greater than 请求持续时间。
Feedback equals, does not equal (thumbs up, thumbs down, no feedback) 反馈类型。
Metadata Key equals, does not equal 特定元数据键。
Metadata Value equals, does not equal 特定元数据值。
Log ID equals, does not equal 特定 Log ID。
Event ID equals, does not equal 特定 Event ID。

2. 选择评估器

创建数据集后,选择评估参数:

  • Cost:计算数据集中推理请求的平均成本(仅适用于具有成本数据的请求)。
  • Speed:计算数据集中推理请求的平均持续时间。
  • Performance:
    • Human feedback:基于人工反馈衡量性能,通过 Logs 选项卡中标注的日志点赞百分比计算。

3. 命名、审查并运行评估

  1. 为评估创建唯一名称,以便在仪表板中引用。
  2. 审查选定的数据集和评估器。
  3. 选择 Run(运行) 开始流程。

4. 审查和分析结果

评估结果将显示在 Evaluations 选项卡中。结果显示评估状态(例如,进行中、已完成或错误)。将显示所选评估器的指标,不包括缺少字段的日志。你还将看到用于计算每个指标的日志数量。

虽然数据集根据过滤器自动更新,但评估不会。如果要评估新日志,需要创建新的评估。

使用这些洞察根据应用的优先级进行优化。根据结果,你可以选择:

这篇文档对您有帮助吗?