Workers AI 现已正式发布(Generally Available)。我们已更新速率限制以反映这一点。
请注意,使用 Wrangler 在 local mode 下的模型推理也会计入这些限制。Beta 模型在优化性能和规模期间可能有较低的速率限制。
速率限制默认按任务类型设置,部分模型限制如下:
- 720 次请求/分钟
- 3000 次请求/分钟
- 720 次请求/分钟
- 3000 次请求/分钟
- 1500 次请求/分钟
- 2000 次请求/分钟
- 3000 次请求/分钟
- @cf/baai/bge-large-en-v1.5 为 1500 次请求/分钟
- 300 次请求/分钟
- @hf/thebloke/mistral-7b-instruct-v0.1-awq 为 400 次请求/分钟
- @cf/microsoft/phi-2 为 720 次请求/分钟
- @cf/qwen/qwen1.5-0.5b-chat 为 1500 次请求/分钟
- @cf/qwen/qwen1.5-1.8b-chat 为 720 次请求/分钟
- @cf/qwen/qwen1.5-14b-chat-awq 为 150 次请求/分钟
- @cf/tinyllama/tinyllama-1.1b-chat-v1.0 为 720 次请求/分钟
- 720 次请求/分钟
- @cf/runwayml/stable-diffusion-v1-5-img2img 为 1500 次请求/分钟
- 720 次请求/分钟