Pollo AI 借助 OpenAI 多模型组合,把创意想法变成视频与图像广告

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Pollo AI 是拥有超过 2600 万用户的 AI 视频与图像创作平台。OpenAI 于 2026 年 10 月 8 日发布其客户案例:Pollo Agent 用 GPT-5.6 做路由,用 GPT-6 Astra 处理叙事与场景规划等难题,用 GPT-Image-2.5 负责图像生成,把粗略想法变成海报、分镜和约 15 秒的视频广告。公司称用户选择和切换模型的时间减少 50% 以上,30% 的创作者会话从模板开始。以上数据均为公司自述。

Pollo AI 是一家面向全球创作者与营销人员的 AI 视频与图像生成平台,目前拥有超过 2600 万用户。2026 年 10 月 8 日,OpenAI 发布了一篇客户案例,介绍这家初创公司如何借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,把创作者模糊的想法变成完整的图像与电影感视频广告。案例的核心是 Pollo AI 的最新产品 Pollo Agent:它把"选模型、写脚本、做分镜、出图、成片"这一整套流程,压缩成一条有引导的工作流。

一、产品定位:做视频领域的 Canva Pollo AI 的创始人兼 CEO Bill Zhu 把目标说得很直白:"我们想为视频做 Canva 为设计做过的事。我们要让它足够简单,让更多人真正用得起来,而不只是那些本来就会的人。"公司的出发点是,即便有了生成式 AI,创作者和营销人员仍然要在不同工具和不同模型之间来回切换,不少人会因为受挫而放弃项目。Pollo AI 想把这层摩擦拿掉。 最早的突破来自视频模板。据公司披露,目前有 30% 的创作者会话从模板或热门格式工作流开始。在此基础上,团队推出了 Pollo Agent,让用户从更简单的输入出发,由系统负责后面的流程。Bill Zhu 表示,随着 OpenAI 模型不断进步,Pollo 想支持的工作流有越来越多在产品内部变得切实可行。 二、技术机制:按任务难度分层的模型组合 Pollo Agent 的第一步是理解用户。它读取用户粗略的想法和视觉参考,再生成故事线、场景流程和脚本。CTO Peter Zhou 说,OpenAI 模型的突出之处在于能理解含糊的创意输入,并具备多模态能力,"GPT-5.6 在这方面表现尤其好"。团队同时看重 OpenAI API 的稳定性和发布节奏。

为了在推理深度、速度和成本之间取得平衡,Pollo AI 采用了分工明确的模型组合: 1. GPT-5.6 负责路由,即判断用户的请求属于哪一类任务,该交给谁处理。

2. GPT-6 Astra 负责更难的工作,例如构思叙事、规划场景修改。

3. GPT-Image-2.5 负责所有图像生成,用于制作海报、分镜和广告视觉。Peter Zhou 的原话是:"只要收到用户生成图片的任务,我们一定用 GPT-Image-2.5。它特别擅长处理不同类型的角色和文字。" 这种设计让系统可以根据用户提示词,把推理强度匹配到任务本身,简单任务不必为重型模型付费。Pollo AI 称,用户在选择或切换模型上花的时间减少了 50% 以上,省下的时间可以用于创作。在选型上,团队会用真实用户的提示词和工作流去测试各个生成模型,评估输出质量、一致性、风格范围、速度和成本。需要说明的是,这些数字均为公司自行报告,案例中没有给出测试方法或第三方验证。 三、三个应用场景 第一个场景是照片转视频广告。Pollo 的营销套件 Marketing Studio 中有"Photo to Video Ads"工具,它用 OpenAI 模型把一张静态图片和一段提示词变成短视频,目标是帮助小企业和 DTC 品牌在几分钟而不是几天内生成社交媒体产品广告。案例中,一位用户想用产品照片做一支有奢华感的香水广告,静态照片无法传达这种氛围,专业拍摄又超出预算。该用户最终得到一支约 15 秒的视频:画面里有丝绒质感、暖色聚光灯和瓶身特写,结尾是香水被置于深红色织物前。

第二个场景是奢华品牌视觉。一家珠宝品牌想要一张大胆的杂志风广告图,但预算撑不起高概念的影棚拍摄。借助 Pollo Agent 和 GPT-Image-2.5,品牌把"模特坐在猎豹身旁佩戴醒目珠宝"的创意变成了现实。画面以深色帷幔和暖光构图,并确保珠宝产品清晰可见。按案例说法,品牌拿到了成品级的奢华视觉,相比实拍,制作投入、时间和成本都更低。 第三个场景是把产品图变成奇幻世界。一家饮料品牌希望蜜桃汽水在广告中显得俏皮而有想象力,普通的影棚产品照做不到。团队用 Pollo Agent 和 GPT-Image-2.5(案例称其带来更清晰的细节和更快的生成)把一张简单的瓶子图片,变成了一片雪地微缩景观,里面有火车、蜥蜴和闪亮的水珠。 四、对行业的意义 对开发者而言,这个案例展示了一种可复制的架构思路:用较轻的模型做路由,用较强的模型处理困难推理,再把图像生成交给专用模型。这样的分层既控制成本,也缩短延迟。对营销团队和小企业而言,价值在于制作门槛降低:不需要拍摄团队,也能在短时间内得到可用于社交平台的广告素材。对平台方而言,模板加智能体的组合说明,可重复的格式与更少的试错,比单纯堆叠模型数量更有价值。

五、局限与展望 读者需要保持审慎。案例由 OpenAI 发布,属于客户故事,所有数据和效果描述都来自公司自述。文中没有公开广告的转化率、单条素材成本的具体数字或质量评测,因此"高转化"这一说法暂时无法独立核实。此外,AI 生成的广告在品牌一致性、素材版权和真实性披露方面仍有行业层面的疑问,案例也未涉及。 展望未来,Pollo 希望在未来 12 个月内让 AI 视频成为日常内容创作的一部分。Bill Zhu 认为,这取决于让"把想法变成可直接发布、测试或用于投放的素材"变得更容易。他的判断是:"内容创作领域的 AI 变革,会青睐那些从一开始就让创作更可重复的产品:更强的格式、更少的试错,以及围绕模型本身的更简单的工作流。"换句话说,下一阶段的竞争重点,可能不再是谁的单个模型更强,而是谁能把多个模型编排成一条稳定、低摩擦的生产线。

Sources