Pollo AI macht aus kreativen Ideen multimodale Kampagnen mit OpenAI
Pollo AI, eine KI-Plattform für Video und Bild mit mehr als 26 Millionen Nutzern, steht im Mittelpunkt einer OpenAI-Kundengeschichte vom 8. Oktober 2026. Das neue Produkt Pollo Agent nutzt GPT-5.6 für das Routing, GPT-6 Astra für schwierige Aufgaben wie Erzählentwicklung und Szenenplanung und GPT-Image-2.5 für Bilder. Aus groben Ideen werden Poster, Storyboards und Videoanzeigen von etwa 15 Sekunden. Laut Unternehmen sinkt die Zeit für Modellwahl um mehr als 50 %, und 30 % der Sitzungen beginnen mit Vorlagen. Alle Zahlen sind Eigenangaben.
Pollo AI, eine Plattform, mit der Kreative und Marketingteams KI-generierte Videos und Bilder erstellen, hat inzwischen mehr als 26 Millionen Nutzer. Am 8. Oktober 2026 veröffentlichte OpenAI eine Kundengeschichte. Sie beschreibt, wie das Startup GPT-5.6, GPT-6 Astra und GPT-Image-2.5 einsetzt, um grobe kreative Ideen in detaillierte Bilder und filmische Videoanzeigen zu verwandeln. Im Mittelpunkt steht Pollo Agent, das neueste Produkt des Unternehmens. Es fasst Modellwahl, Drehbuch, Szenenplanung, Bilderzeugung und Videoschnitt in einem geführten Ablauf zusammen. 1. Positionierung: Für Video leisten, was Canva für Design leistete Bill Zhu, Gründer und CEO von Pollo AI, nennt das Ziel offen: „Wir wollen für Video tun, was Canva für Design getan hat. Wir wollen es so einfach machen, dass mehr Menschen es wirklich nutzen können, nicht nur diejenigen, die es ohnehin schon beherrschen.“ Am Anfang stand eine einfache Beobachtung. Auch mit generativer KI müssen Kreative und Marketer weiterhin zwischen verschiedenen Werkzeugen wechseln und Modelle auswählen, um das gewünschte Ergebnis zu erhalten. Manche geben ihr Projekt aus Frust auf. Pollo AI will diese Reibung beseitigen.
Der erste Durchbruch waren Videovorlagen. Nach Angaben des Unternehmens beginnen heute 30 % der Sitzungen von Kreativen mit Vorlagen oder mit Abläufen für Trendformate. Darauf baut Pollo Agent auf. Nutzer können mit einfacheren Eingaben starten und den Rest dem System überlassen. Laut Zhu sind mit den Fortschritten der OpenAI-Modelle immer mehr der Abläufe, die Pollo unterstützen wollte, im Produkt praktikabel geworden. 2. Funktionsweise: Ein Modellmix, abgestimmt auf die Schwierigkeit der Aufgabe Pollo Agent deutet zunächst die Absicht des Nutzers. Es liest grobe Ideen und visuelle Referenzen und entwickelt daraus Handlungsbögen, Szenenabläufe und Skripte. CTO Peter Zhou sagt, die OpenAI-Modelle hätten sich durch ihr Verständnis mehrdeutiger kreativer Eingaben und durch ihre multimodalen Fähigkeiten hervorgetan: „GPT-5.6 hat hier besonders gut abgeschnitten.“ Das Team schätzt außerdem die Stabilität der OpenAI-API und deren Veröffentlichungsrhythmus. Um Denktiefe, Geschwindigkeit und Kosten auszubalancieren, teilt Pollo AI die Arbeit auf drei Rollen auf: 1. GPT-5.6 übernimmt das Routing. Es erkennt, um welche Art von Aufgabe es sich handelt, und leitet sie weiter.
2. GPT-6 Astra erledigt die schwierigeren Aufgaben, etwa die Entwicklung einer Erzählung oder die Planung von Szenenänderungen.
3. GPT-Image-2.5 erzeugt die Bilder, darunter Poster, Storyboards und Kampagnenmotive. Peter Zhou sagt dazu: „Wenn wir von einem Nutzer eine Aufgabe zur Bilderzeugung erhalten, verwenden wir immer GPT-Image-2.5. Es ist besonders gut im Umgang mit verschiedenen Arten von Figuren und Buchstaben.“ So lässt sich die Denktiefe an die Eingabe des Nutzers anpassen, und einfache Anfragen müssen nicht für schwere Modelle zahlen. Pollo AI berichtet, dass Nutzer mehr als 50 % weniger Zeit mit der Wahl oder dem Wechsel von Modellen verbringen. Diese Zeit bleibt für die kreative Arbeit. Bei der Auswahl testet das Team generative Modelle an echten Nutzereingaben und Abläufen und bewertet Ausgabequalität, Konsistenz, stilistische Bandbreite, Geschwindigkeit und Kosten. Hier ist Vorsicht geboten: Die Zahlen stammen vom Unternehmen selbst. Die Geschichte nennt weder eine Testmethode noch eine unabhängige Bestätigung. 3. Drei Anwendungsfälle Foto zu Videoanzeige. Das Werkzeug Photo to Video Ads in der Suite Marketing Studio nutzt OpenAI-Modelle, um aus einem Standbild und einer Eingabe ein kurzes Video zu machen. Es soll kleinen Unternehmen und DTC-Marken helfen, Produktanzeigen für soziale Medien in Minuten statt Tagen zu erstellen. Im Beispiel wollte ein Nutzer aus einem Produktfoto eine luxuriöse Parfümanzeige machen. Das Foto allein konnte die Stimmung nicht vermitteln, und ein professioneller Dreh sprengte das Budget. Das Werkzeug erzeugte ein Video von etwa 15 Sekunden mit Samtstrukturen, warmen Spotlights und Nahaufnahmen der Flasche. Am Ende stand das Parfüm vor tiefrotem Stoff.
Ein Luxus-Kampagnenmotiv. Eine Schmuckmarke wollte ein kräftiges redaktionelles Kampagnenbild, aber das Budget reichte nicht für ein konzeptstarkes Studioshooting. Mit Pollo Agent und GPT-Image-2.5 setzte die Marke ihre Idee um: auffälliger Schmuck an einem Model, das neben einem Geparden sitzt. Das Werkzeug gestaltete die Szene mit dunklen Vorhängen und warmem Licht und hielt den Schmuck gut sichtbar. Laut der Geschichte erhielt der Kunde ein fertiges Luxusmotiv mit weniger Aufwand, Zeit und Kosten als bei einem echten Shooting. Produktfotos als magische Welten. Eine Getränkemarke wollte, dass ihre Pfirsichlimonade verspielt und fantasievoll wirkt. Ein gewöhnliches Studiofoto konnte das nicht leisten. Mit Pollo Agent und GPT-Image-2.5, dem die Geschichte schärfere Details und schnellere Erzeugung zuschreibt, wurde aus einem einfachen Flaschenbild eine verschneite Miniaturlandschaft mit Zug, Eidechsen und funkelnden Tropfen. 4. Bedeutung für Entwickler, Unternehmen und das Ökosystem Für Entwickler zeigt der Fall ein leicht übertragbares Architekturmuster: ein leichtes Modell für das Routing, ein stärkeres Modell für schwierige Schlussfolgerungen und ein spezialisiertes Modell für Bilder. Diese Schichtung hält Kosten und Latenz zugleich im Griff. Für Marketingteams und kleine Unternehmen liegt der Wert in der niedrigeren Einstiegshürde: Eine brauchbare Anzeige für soziale Medien braucht kein Drehteam mehr. Für Plattformbauer deutet die Kombination aus Vorlagen und Agent an, dass wiederholbare Formate und weniger Versuch und Irrtum wichtiger sein können als zusätzliche Modelle.
5. Grenzen und Ausblick Leser sollten vorsichtig bleiben. OpenAI hat dies als Kundengeschichte veröffentlicht, und jede Zahl und jedes Ergebnis stammt aus der Darstellung des Unternehmens. Der Beitrag nennt weder Konversionsraten noch Kosten pro Motiv noch Qualitätsbewertungen. Die Aussage über „hochkonvertierende“ Kampagnen lässt sich deshalb nicht unabhängig prüfen. Auch Fragen der Markenkonsistenz, der Rechte an Bildmaterial und der Kennzeichnung KI-generierter Werbung bleiben offen. Für die Zukunft will Pollo, dass KI-Video in den nächsten 12 Monaten Teil der alltäglichen Inhaltserstellung wird. Laut Zhu hängt das davon ab, dass sich eine Idee noch leichter in ein Ergebnis verwandeln lässt, das sich veröffentlichen, testen oder in einer Kampagne nutzen lässt. Seine Einschätzung: „Wir glauben, dass der KI-Wandel in der Inhaltserstellung Produkte begünstigen wird, die die Erstellung von Anfang an wiederholbarer machen, mit stärkeren Formaten, weniger Versuch und Irrtum und einem einfacheren Ablauf rund um die Modelle selbst.“ Anders gesagt: Im nächsten Wettbewerb zählt womöglich weniger, wessen einzelnes Modell am stärksten ist, sondern wer mehrere Modelle zu einer stabilen, reibungsarmen Produktionslinie verbinden kann.