Basis: Steuerarbeitsmappe 2x schneller via GPT-6 Astra
GPT-6 Astra hat eine Steuerarbeitsmappe mit 50 Registerkarten doppelt so schnell wie GPT-5.6 Sol abgeschlossen, und sein besseres Verständnis der Benutzerabsicht gibt Basis mehr Vertrauen in den realen Einsatz.
Hintergrund
Im September 2026 veröffentlichte OpenAI den ersten öffentlichen Branchen-Benchmark für sein neuestes Reasoning-Modell GPT-6 Astra, basierend auf einem Praxistest der Steuersoftware-Plattform Basis. Der Test umfasste eine komplexe Steuerarbeitsmappe mit 50 Registerkarten, die typischerweise Einkommensaufstellungen, Abschreibungspläne und Steuergutschriften über Dutzende voneinander abhängiger Tabellenblätter bündelt. Basis berichtete, dass GPT-6 Astra die gesamte Arbeitsmappe doppelt so schnell wie sein Vorgängermodell GPT-5.6 Sol fertigstellte und dabei ein deutlich besseres Verständnis der Benutzerabsicht zeigte. Die Aufgabe war keine einfache Textgenerierung; sie erforderte tabellenübergreifende Datenextraktion, Abgleich mit aktuellen Steuervorschriften, mehrschrittige Berechnungen und die Orchestrierung eines sequenziellen Arbeitsablaufs, der der kognitiven Belastung eines erfahrenen Steuerberaters entspricht.
Das Ingenieurteam von Basis betonte, dass die Geschwindigkeitssteigerung mit einer erheblichen Reduzierung manueller Korrekturen und wiederholter Eingabeaufforderungen einherging. Bei früheren Einsätzen interpretierten selbst fortschrittliche Modelle häufig die implizite Logik zwischen verschiedenen Registerkarten falsch, sodass menschliche Buchhalter eingreifen und das System erneut anweisen mussten. Mit Astra stieg die End-to-End-Aufgabenerfüllungsrate stark an, da das Modell das übergeordnete Ziel des Buchhalters – etwa „Erstellen Sie die Bundes- und Landessteuererklärungen für dieses Unternehmen“ – ableiten und autonom bestimmen konnte, welche Formulare auszufüllen, welche Querverweise aufzulösen und wie Abzüge auf verschiedene Rechtsräume zu verteilen sind. Die Ankündigung vom September positioniert GPT-6 Astra als einen der ersten Belege dafür, dass modernste Reasoning-Modelle über Konversationsflüssigkeit hinaus zuverlässige, mehrschrittige professionelle Ausführung erreichen können.
Tiefenanalyse
Die Verdoppelung der Geschwindigkeit resultiert aus einer grundlegenden Neugestaltung der Reasoning-Pipeline des Modells. Im Vergleich zu GPT-5.6 Sol verfügt Astra über einen effizienteren Mechanismus zur Komprimierung des Langzeitgedächtnisses und einen adaptiven Planer für die Argumentationspfade. Bei einer 50-Registerkarten-Arbeitsmappe behandelt das Modell jedes Blatt nicht mehr als isolierte Eingabeaufforderung, die externe Werkzeugaufrufe oder fragmentierte Gedankenketten erfordert. Stattdessen konstruiert es die gesamte implizite Steuerlogikkette in einem einzigen, kohärenten Durchlauf – es identifiziert Abhängigkeiten zwischen den Registerkarten, sequenziert Berechnungen gemäß den Regeln des Internal Revenue Code und kennzeichnet anomale Einträge, die auf Dateneingabefehler oder Compliance-Risiken hinweisen könnten. Dieser ganzheitliche Ansatz eliminiert das kostspielige Hin und Her, das frühere Versionen plagte, bei denen die Aufmerksamkeit über lange Kontexte hinweg nachließ und das Modell die Ergebnisse früherer Registerkarten aus den Augen verlor.
Entscheidend ist, dass Astra das „Verständnis der Benutzerabsicht“ von oberflächlicher Befehlsausführung zu zielgerichteter autonomer Planung erhebt. Wenn ein Benutzer beispielsweise eine Arbeitsmappe mit der Anweisung „Erledigen Sie die diesjährigen Bundes- und Landessteuererklärungen“ einreicht, muss das Modell selbstständig entscheiden, welche Anhänge obligatorisch sind, welche Zahlen aus unterstützenden Registerkarten entnommen werden müssen und wie Abzüge zwischen Bundes- und Landesberechnungen aufgeteilt werden. Astras verbessertes Chain-of-Thought-Reasoning erreicht dies, indem es einen dynamischen Aufgabengraphen pflegt, der aktualisiert wird, sobald neue Informationen verarbeitet werden. So kann es sich elegant erholen, wenn ein erforderliches Feld fehlt, und den Benutzer nur dann zur Eingabe auffordern, wenn es wirklich notwendig ist. Das Ergebnis ist nicht nur eine schnellere Ausgabe, sondern eine höhere Erstgenauigkeit, die sich unmittelbar in der beobachteten Verdoppelung der Gesamtbearbeitungszeit der Arbeitsmappe niederschlägt.
Branchenwirkung
Für Basis, das kleine und mittelständische Buchhaltungsfirmen bedient, hat der Leistungssprung unmittelbare kommerzielle Bedeutung. Eine komplexe Steuerarbeitsmappe, die selbst mit KI-Unterstützung früher stundenlange menschliche Prüfung erforderte, kann nun in der halben Zeit mit weniger Eingriffen bearbeitet werden. Dies ermöglicht es Basis, den Kundendurchsatz ohne proportionalen Anstieg der Personalkosten zu steigern, und eröffnet den Weg, die Plattform von einem unterstützenden Werkzeug zu einem halbautomatisierten Steuererklärungsdienst weiterzuentwickeln. Das verbesserte Intentionsverständnis reduziert zudem die kognitive Belastung der Buchhalter, die ihre Expertise nun auf höherwertige Beratungstätigkeiten statt auf Datenüberprüfung lenken können.
Die Demonstration verschärft den Wettbewerbsdruck in der KI- und Steuersoftwarelandschaft. OpenAIs Fähigkeit, einen messbaren, aufgabenspezifischen Geschwindigkeitsvorteil in einer regulierten Berufsdomäne zu liefern, fordert Konkurrenten wie Anthropic und Google DeepMind heraus. Anthropics Claude-Serie wird seit langem für das Verständnis langer Dokumente und Sicherheit geschätzt, doch Astras konkreter Benchmark bei der Steuerarbeitsmappenbearbeitung könnte Unternehmenskäufer in Richtung des API-Ökosystems von OpenAI bewegen. Unterdessen stehen etablierte Steuersoftwareriesen wie Intuit (TurboTax) und Xero, die KI in ihre Produkte integrieren, vor einem „Build-or-Partner“-Dilemma: Hausinterne Modelle können mit der Iterationsgeschwindigkeit führender Labore kaum mithalten, was Partnerschaften oder Übernahmen von Drittanbieter-Reasoning-Modellen beschleunigen dürfte. Für den Berufsstand der Buchhalter bedeutet dies kurzfristig eine willkommene Reduzierung repetitiver manueller Arbeit, mittelfristig jedoch eine Rollentransformation – von der Dateneingabe und -prüfung hin zur strategischen Steuerplanung und Kundenberatung.
Ausblick
Mehrere Signale werden bestimmen, wie breit sich Astras Erfolg bei Steuerarbeitsmappen auf andere Branchen übertragen lässt. Es wird erwartet, dass OpenAI zusätzliche Benchmarks für ähnlich strukturierte Aufgaben mit langen Dokumenten veröffentlicht – etwa für Prüfungsunterlagen, juristische Vertragsprüfungen und die Bearbeitung von Versicherungsansprüchen –, um die Allgemeingültigkeit von Astra zu belegen. Für Basis besteht der entscheidende nächste Schritt darin, nachzuweisen, dass die im Test beobachteten Geschwindigkeits- und Genauigkeitsgewinne auch im kommerziellen Live-Einsatz Bestand haben, und zwar mit veröffentlichten Daten zu Fehlerquoten und der Häufigkeit menschlicher Eingriffe. Transparente Metriken werden unerlässlich sein, um die anfängliche Begeisterung der Early Adopters in nachhaltiges Vertrauen der Unternehmen umzuwandeln.
Die Reaktionen der Wettbewerber nehmen bereits Gestalt an. Anthropic könnte eine für professionelle Dokumente optimierte Version von Claude beschleunigen, während Google die Reasoning-Fähigkeiten von Gemini tiefer in Google Sheets integrieren könnte, um eine native Produktivitätsschleife zu schaffen. Allgemeiner markiert die Leistung von GPT-6 Astra einen Wendepunkt in der Entwicklung großer Modelle: Das Wertversprechen verschiebt sich von der Generierung fließender Texte hin zur zuverlässigen Ausführung mehrschrittiger, regelintensiver professioneller Arbeitsabläufe. Dieser Übergang wird die KI-Adoption in den Bereichen Finanzen, Recht und Gesundheitswesen beschleunigen, erhöht aber auch die Anforderungen an Erklärbarkeit, Prüfbarkeit und regulatorische Compliance. Der Fall Basis ist eine frühe Bestätigung dafür, dass Reasoning-Modelle Teile menschlicher Facharbeit ersetzen können, und das Tempo dieser Substitution könnte die derzeitigen Branchenerwartungen übertreffen.