Pollo AI transforme des idées créatives en campagnes multimodales avec OpenAI

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Pollo AI, plateforme de vidéo et d'images par IA forte de plus de 26 millions d'utilisateurs, fait l'objet d'un témoignage client publié par OpenAI le 8 octobre 2026. Son produit Pollo Agent s'appuie sur GPT-5.6 pour le routage, sur GPT-6 Astra pour les tâches difficiles comme la construction du récit et la planification des scènes, et sur GPT-Image-2.5 pour les images. Il transforme des idées brutes en affiches, storyboards et publicités vidéo d'environ 15 secondes. L'entreprise annonce plus de 50 % de temps en moins passé à choisir un modèle et 30 % de sessions démarrant par un modèle. Ces chiffres sont déclarés par l'entreprise.

Pollo AI, une plateforme qui aide les créateurs et les équipes marketing à produire des vidéos et des images avec l'IA, compte aujourd'hui plus de 26 millions d'utilisateurs. Le 8 octobre 2026, OpenAI a publié un témoignage client qui décrit comment cette jeune entreprise utilise GPT-5.6, GPT-6 Astra et GPT-Image-2.5 pour transformer des idées créatives brutes en images détaillées et en publicités vidéo cinématographiques. Au centre du récit se trouve Pollo Agent, le produit le plus récent de la société. Il réunit dans un seul parcours guidé le choix du modèle, l'écriture du script, la préparation des scènes, la génération d'images et le montage de la vidéo.

1. Positionnement : faire pour la vidéo ce que Canva a fait pour le design Bill Zhu, fondateur et PDG de Pollo AI, formule l'objectif simplement : « Nous voulons faire pour la vidéo ce que Canva a fait pour le design. Nous voulons que ce soit assez simple pour que beaucoup plus de personnes puissent s'en servir, pas seulement celles qui savent déjà. » Le point de départ est une observation. Même avec l'IA générative, les créateurs et les marketeurs doivent encore passer d'un outil à l'autre et choisir entre plusieurs modèles pour obtenir le résultat voulu. Certains abandonnent leur projet par frustration. Pollo AI cherche à supprimer cette friction. La première percée est venue des modèles de vidéo. Selon l'entreprise, 30 % des sessions de créateurs commencent aujourd'hui à partir de modèles ou de formats tendance. Pollo Agent prolonge ce succès. Les utilisateurs peuvent partir d'une entrée plus simple et laisser le système gérer le reste. Selon Bill Zhu, à mesure que les modèles d'OpenAI progressent, davantage de parcours que Pollo voulait offrir deviennent réalisables dans le produit. 2. Fonctionnement : un mélange de modèles adapté à la difficulté de la tâche Pollo Agent commence par interpréter l'utilisateur. Il lit des idées approximatives et des références visuelles, puis élabore des trames narratives, des enchaînements de scènes et des scripts. Le directeur technique Peter Zhou explique que les modèles d'OpenAI se sont distingués par leur capacité à comprendre des demandes créatives ambiguës et par leur dimension multimodale : « GPT-5.6 s'est montré particulièrement performant sur ce point. » L'équipe apprécie aussi la stabilité de l'API d'OpenAI et son rythme de publication.

Pour équilibrer profondeur de raisonnement, rapidité et coût, Pollo AI répartit le travail entre trois rôles : 1. GPT-5.6 assure le routage : il détermine le type de tâche et l'oriente vers le bon traitement.

2. GPT-6 Astra prend en charge les travaux plus difficiles, comme l'élaboration d'un récit ou la planification de révisions de scènes.

3. GPT-Image-2.5 gère la génération d'images : affiches, storyboards et visuels de campagne. Peter Zhou le dit ainsi : « Si nous recevons une demande de génération d'image, nous utilisons toujours GPT-Image-2.5. Il est particulièrement bon avec les différents types de personnages et de lettres. » Ce schéma permet d'adapter le niveau de raisonnement à la demande de l'utilisateur, si bien qu'une requête simple ne paie pas pour un modèle lourd. Pollo AI indique que ses utilisateurs passent plus de 50 % de temps en moins à choisir ou à changer de modèle, ce qui libère du temps pour la création. Pour sélectionner ses modèles, l'équipe les teste sur de vraies requêtes et de vrais parcours d'utilisateurs, en évaluant la qualité, la cohérence, l'étendue stylistique, la vitesse et le coût. Une précaution s'impose : ces chiffres sont déclarés par l'entreprise elle-même. Le témoignage ne fournit ni méthode de test ni vérification par un tiers.

3. Trois cas d'usage Photo vers publicité vidéo. L'outil Photo to Video Ads de la suite Marketing Studio utilise des modèles d'OpenAI pour transformer une image fixe et une consigne en courte vidéo. Il vise à aider les petites entreprises et les marques DTC à produire des publicités produit pour les réseaux sociaux en quelques minutes plutôt qu'en quelques jours. Dans l'exemple, un utilisateur voulait une publicité de parfum luxueuse à partir d'une photo de produit. La photo seule ne transmettait pas l'ambiance, et un tournage professionnel dépassait son budget. L'outil a produit une vidéo d'environ 15 secondes, avec des textures de velours, des projecteurs chauds et des gros plans du flacon, terminée par le parfum cadré devant un tissu rouge profond.

Un visuel de campagne de luxe. Une marque de bijoux voulait une image de campagne éditoriale audacieuse, mais son budget ne permettait pas un shooting en studio à fort concept. Avec Pollo Agent et GPT-Image-2.5, la marque a donné vie à son idée : des bijoux marquants portés par un mannequin assis près d'un guépard. L'outil a composé la scène avec des drapés sombres et un éclairage chaud, tout en gardant les bijoux bien visibles. Selon le témoignage, le client a obtenu un visuel de luxe abouti, avec moins d'effort, de temps et de coût qu'un tournage réel. Des photos de produit transformées en mondes magiques. Une marque de boissons voulait que son soda à la pêche paraisse ludique et imaginatif, ce qu'une photo de studio classique ne permettait pas. Avec Pollo Agent et GPT-Image-2.5, dont le témoignage salue les détails plus nets et la génération plus rapide, l'équipe a transformé une simple image de bouteille en paysage miniature enneigé, avec un train, des lézards et des gouttelettes scintillantes. 4. Ce que cela change pour les développeurs, les entreprises et l'écosystème Pour les développeurs, le cas montre un schéma d'architecture facile à reproduire : un modèle léger pour le routage, un modèle plus puissant pour le raisonnement difficile et un modèle dédié aux images. Cette organisation en couches maîtrise à la fois le coût et la latence. Pour les équipes marketing et les petites entreprises, l'intérêt tient à la baisse de la barrière de production : une publicité exploitable sur les réseaux sociaux ne demande plus d'équipe de tournage. Pour ceux qui construisent des plateformes, l'association de modèles et d'un agent suggère que des formats reproductibles et moins d'essais-erreurs peuvent compter davantage que l'ajout de modèles.

5. Limites et perspectives Le lecteur doit rester prudent. OpenAI présente ici un témoignage client, et chaque chiffre ou résultat provient du récit de l'entreprise. L'article ne donne ni taux de conversion, ni coût par visuel, ni évaluation de qualité. L'idée de campagnes « à forte conversion » ne peut donc pas être vérifiée de façon indépendante. Les questions plus larges de cohérence de marque, de droits sur les contenus et de transparence sur les publicités générées par IA ne sont pas abordées. Pour la suite, Pollo veut que la vidéo par IA entre dans la création de contenu quotidienne au cours des 12 prochains mois. Selon Bill Zhu, cela dépend de la possibilité de transformer encore plus facilement une idée en contenu prêt à publier, à tester ou à utiliser dans une campagne. Son analyse : « Nous pensons que le changement apporté par l'IA à la création de contenu favorisera les produits qui rendent la création plus reproductible dès le départ, avec de meilleurs formats, moins d'essais-erreurs et un flux de travail plus simple autour des modèles eux-mêmes. » Autrement dit, la prochaine étape de la concurrence portera peut-être moins sur la force d'un modèle isolé que sur la capacité à orchestrer plusieurs modèles en une chaîne de production stable et sans friction.

Sources