将文本生成模型与文本到图像模型相结合,可以开发出强大的 AI 系统,能够根据输入的提示词生成视觉内容。这种集成可以通过协作框架来实现,其中文本生成模型根据输入文本为文本到图像模型生成提示词。
以下是该流程的工作原理:
-
输入文本处理:输入文本被提供给系统,可以是简单的句子,也可以是多个段落。该文本作为生成视觉内容的基础。
-
提示词生成:文本生成模型根据输入文本生成提示词。这些提示词经过专门设计,用以引导文本到图像模型生成与输入文本上下文相关的图像。提示词可以包括描述、关键字或其他线索,用以引导图像生成过程。
-
内容审核:可以采用文本分类模型来确保生成的资产符合内容政策。
-
文本到图像模型:文本到图像模型将文本生成模型生成的提示词作为输入,并生成相应的图像。文本到图像模型学会将文本描述转化为视觉表征,旨在捕获输入文本所表达的实质和上下文。
此类 AI 模型组合的示例用途可用于为营销、出版、演示文稿等生成视觉资产。
- 客户端上传:向 API 端点发送包含内容的 POST 请求。
- 提示词生成:通过调用 Workers AI 文本生成模型(以内容作为输入)为后期的文本到图像模型生成提示词。
- 安全检查:通过调用 Workers AI 文本分类模型(以之前生成的提示词作为输入)来检查是否符合安全指南。
- 图像生成:通过调用 Workers AI 文本到图像模型(使用之前生成的提示词)生成图像。