LegalOn halbiert die Codex-Kosten, ohne die Entwicklung zu bremsen

Published · AI Daily — AI-assisted deep research, methodology & disclosure

LegalOn baute Codex ein. Ingenieure wählen GPT-6 (Astra, Luna) oder GPT-6.1 Sol je nach Aufgabe, Budgets folgen der Wachstumsphase. Geschätzte Tageskosten sanken um 65 Prozent, in reifen Bereichen um 20 Prozent, bei gleichem Tempo.

Am 8. Oktober 2026 veröffentlichte OpenAI eine Kundengeschichte über LegalOn Technologies, ein Unternehmen, das weltweit sogenannte Professional AI für juristische und andere Geschäftsteams anbietet. Nachdem LegalOn Codex in seinen Entwicklungsprozess eingebaut hatte, senkte es die geschätzten Tageskosten um 65 Prozent und die Kosten in reifen Geschäftsbereichen um 20 Prozent, ohne die Entwicklung zu verlangsamen. Der Fall ist weniger wegen der Prozentzahl wichtig als wegen des Problems, das er löst. Sobald agentisches Programmieren ein Unternehmen durchdringt, wächst die Rechnung schneller als erwartet. Unbegrenzter Zugang zum stärksten Modell treibt die Ausgaben nach oben. Eine pauschale Beschränkung nimmt die Produktivität wieder weg, die das Werkzeug überhaupt gerechtfertigt hat.

LegalOn begann so, wie viele frühe Anwender beginnen. Das Unternehmen gab Entwicklern unbegrenzten Zugriff auf sein Hauptmodell, GPT-5.5 im Fast-Modus, und weitete die Nutzung vom Entwurf über die Umsetzung bis zur täglichen Arbeit aus. In dieser Phase lernte es durch Experimente, wie Verantwortung zwischen Menschen und KI aufzuteilen ist. Die Reihenfolge ist sinnvoll, denn für ein Werkzeug, dessen Grenzen man noch nicht kennt, lässt sich keine gute Regel schreiben. Die Quelle benennt aber die Folge klar: Die fortgesetzte, unbeschränkte Nutzung eines Hochleistungsmodells würde das Jahresbudget unvermeidlich überschreiten. Kostenkontrolle wurde von einer Finanzfrage zu einer Frage der Führung in der Entwicklung.

Die erste Hälfte der Antwort ist eine Methode zur Modellwahl. Eine interne Gruppe, das AI-powered Development CoE (AID CoE), begann, Richtlinien für die Modellauswahl zu entwickeln. Sie testete und überwachte die Modelle, und die Führungskräfte gaben die Ergebnisse an ihre Teams weiter. Diese Arbeitsteilung verdient Beachtung. Tests und Überwachung sind zentralisiert, damit die Belege einheitlich bleiben. Die Entscheidung ist dezentral: Jede Ingenieurin und jeder Ingenieur wählt selbst das passende Modell für die Aufgabe, ohne auf eine Freigabe zu warten. Die Richtlinien sind kein Regelwerk, das Aufgabentypen auf Modelle abbildet, sondern eine gemeinsame Beweisbasis für schnelle, gute Entscheidungen.

Zur Auswahl standen GPT-6 in den Varianten Astra und Luna sowie GPT-6.1 Sol. LegalOn wählte danach, wie komplex die Aufgabe war und in welcher Entwicklungsphase sie lag. Die hier vorliegende Quelle sagt nicht, welche Variante zu welcher Aufgabe passt, und eine solche Zuordnung zu erfinden wäre falsch. Der Fall belegt dagegen das Prinzip: Das Modell ist kein einheitlicher Standard für das ganze Unternehmen mehr, sondern ein Parameter pro Aufgabe. Eine einfache Aufgabe braucht nicht die teuerste Kapazität, und eine schwere Aufgabe sollte nicht aus Sparsamkeit mit zu wenig Leistung auskommen müssen.

Die zweite Hälfte der Antwort ist das Budgetdesign. LegalOn stimmte die Budgets auf die Wachstumsphase jedes Geschäftsbereichs ab. Das erklärt zum Teil, warum die beiden berichteten Zahlen auseinanderliegen: Reife Bereiche sparten 20 Prozent, während die geschätzten Tageskosten insgesamt um 65 Prozent sanken. Reife Bereiche haben stabilere, besser vorhersehbare Arbeit und damit weniger Sparspielraum. Frühere Phasen brauchen mehr Exploration, und ihre Budgetlogik ist eine andere. Wer Ausgaben an die Phase koppelt, behandelt KI-Nutzung als Investition mit erwarteter Rendite und nicht als Pauschalumlage für alle Teams. Eine Einschränkung gehört dazu: Die 65 Prozent beschreiben eine Senkung geschätzter Tageskosten. Das ist eine Projektion und kein geprüftes Ergebnis über einen vollständigen Abrechnungszyklus.

Für die Branche ergeben sich drei Lehren. Erstens verschiebt sich der Wettbewerb im agentischen Programmieren von der Frage nach dem stärksten Modell zur Frage nach der effizientesten Nutzung. Modellstufung und Aufgabenlenkung werden zur Grundfähigkeit. Zweitens ist wirksame Governance organisatorisch und nicht rein technisch: Der Kreislauf aus Test, Überwachung, schriftlicher Anleitung und Weitergabe durch Führungskräfte hält viele unabhängige Entscheidungen konsistent. Drittens sind Kosten und Tempo keine natürlichen Gegner. Andere Teams können nicht die Modellnamen übernehmen, die sich mit jeder Version ändern, wohl aber die Reihenfolge: erst beobachten, dann stufen, dann Budgets nach Reifegrad zuweisen.

Sources

FAQ

Wie senkte LegalOn die Codex-Kosten, ohne die Entwicklung zu bremsen?

Mit zwei Maßnahmen zugleich. Das AID CoE testete und überwachte Modelle und schrieb Auswahlrichtlinien, sodass Ingenieure je nach Aufgabenkomplexität und Phase zwischen GPT-6 (Astra, Luna) und GPT-6.1 Sol wählen. Außerdem wurden die Budgets an die Wachstumsphase der Bereiche angepasst. Die geschätzten Tageskosten sanken um 65 Prozent, in reifen Bereichen um 20 Prozent.

Sind die 65 Prozent eine tatsächliche Ersparnis?

Nicht ohne Einschränkung. Die Quelle nennt eine Senkung der geschätzten Tageskosten, kein geprüftes Ergebnis über einen vollen Abrechnungszyklus. Die Zahl sollte mit dem Zusatz geschätzt zitiert werden.

Was können andere Teams aus dem Fall übernehmen?

Die Reihenfolge, nicht die Modellnamen: erst Zugang öffnen und beobachten, eine Gruppe dauerhaft testen lassen, Ergebnisse als Richtlinie weitergeben und Budgets an die Reife der Bereiche koppeln.