gstack: 23 rollenbasierte Slash-Befehle machen Claude Code zum virtuellen Engineering-Team

Published · AI Daily — AI-assisted deep research, methodology & disclosure

gstack ist ein MIT-lizenziertes Claude-Code-Setup von Garry Tan, Präsident von Y Combinator. Es teilt Softwarearbeit in 23 rollenbasierte Slash-Befehle auf, etwa CEO-Review, Engineering-Review, Design-Review, QA und Release, dazu acht Zusatzwerkzeuge. Alles besteht aus einfachem Markdown. Das Repository hat rund 135.000 Sterne. Der echte Wert liegt darin, ein leeres Eingabefeld in einen wiederholbaren Ablauf zu verwandeln. Die vom Autor genannte 810-fache Produktivität ist eine Selbstauskunft und wurde nicht unabhängig reproduziert.

Hintergrund und Problemstellung

Im März 2026 sagte Andrej Karpathy in einem Podcast, er habe seit Dezember kaum noch eine Zeile Code selbst getippt. Das README von gstack stellt dieses Zitat an den Anfang. Es zeigt ein neues Problem. Wenn ein Modell den größten Teil des Codes schreiben kann, verschiebt sich der Engpass von „kann es schreiben“ zu „wie wird die Arbeit organisiert“.

Die meisten Menschen begegnen Claude Code zuerst als leerem Eingabefeld. Dasselbe Modell ergänzt für den einen ein paar Zeilen und liefert für den anderen eine ganze Funktion. Der Unterschied liegt oft in der Struktur der Anfrage, nicht im Modell. Ohne Struktur bleibt das Ergebnis ungleichmäßig, und die Gewohnheiten eines echten Teams, etwa Review, Tests und Release-Disziplin, entstehen nicht.

gstack zielt auf diese Lücke. Veröffentlicht wurde das Projekt von Garry Tan, Präsident und CEO von Y Combinator, im Repository garrytan/gstack unter der MIT-Lizenz. Es hat rund 135.000 GitHub-Sterne. Der Autor nennt es seine Open-Source-Softwarefabrik und sagt, er nutze sie täglich. Das README nennt drei Zielgruppen: technische Gründer, die noch selbst ausliefern wollen, Erstnutzer von Claude Code, die strukturierte Rollen statt eines leeren Prompts suchen, und Tech Leads, die bei jedem Pull Request strenges Review, QA und automatisierte Releases wollen.

Kernarchitektur und technische Prinzipien

Die zentrale Idee ist, ein allgemeines Modell in mehrere Rollen mit klaren Aufgaben zu zerlegen. Das README nennt einen CEO, der das Produkt neu durchdenkt, einen Engineering Manager, der die Architektur festlegt, einen Designer, der lieblos von KI gemachtes Design erkennt, einen Reviewer, der Produktionsfehler findet, einen QA-Leiter, der einen echten Browser öffnet, einen Sicherheitsbeauftragten, der OWASP- und STRIDE-Audits durchführt, und einen Release-Ingenieur, der den Pull Request ausliefert. Die genannte Gesamtzahl lautet 23 Spezialisten plus acht Zusatzwerkzeuge. Der Form nach hat gstack weder einen Backend-Dienst noch eine neue Laufzeitumgebung. Laut README besteht alles aus Slash-Befehlen, alles aus Markdown, kostenlos und unter MIT-Lizenz. Jede Rolle ist also eine vorbereitete Prompt-Datei, die Claude Code lädt, wenn man den passenden Befehl aufruft. Dieses Design hat drei Folgen. Erstens ist die Einstiegshürde sehr niedrig. Die Installation bedeutet, Dateien dorthin zu legen, wo Claude Code sie lesen kann, und das README nennt dafür etwa 30 Sekunden. Zweitens ist das System prüfbar. Jedes Verhalten steht als Text da, man kann es Zeile für Zeile lesen, ändern und forken. Drittens, und das ist am wichtigsten, besitzt es keine Durchsetzungskraft. Eine Rolle ist nur ein Prompt. Ob das Modell ihn befolgt, hängt vom Modell ab. Es gibt kein Typsystem, keinen Compiler und keinen Mechanismus, der beweist, dass der „Sicherheitsbeauftragte“ ein Audit wirklich abgeschlossen hat.

Auch der Schnellstart zeigt diese Arbeitsteilung. Mit `/office-hours` beschreibt man, was man baut, mit `/plan-ceo-review` hinterfragt man die Idee, mit `/review` prüft man einen Branch mit Änderungen, und mit `/qa` testet man eine Staging-URL oder eine isolierte lokale API, ein CLI, einen Job oder einen Webhook. Die Reihenfolge ahmt ein echtes Team nach: Bedarf klären, Plan prüfen, Code prüfen, testen, ausliefern.

Praktische Bewertung und Anwendungen

Die in dieser Sitzung sichtbare Skill-Liste zeigt, dass die Befehle viele Phasen des Softwarelebenszyklus abdecken: Ideenfindung (office-hours), Strategie-, Architektur- und Design-Review (plan-ceo-review, plan-eng-review, plan-design-review), Designsysteme (design-consultation), Fehlersuche (investigate), Tests (qa, qa-only), Code-Review (review), visuelle Prüfung (design-review), Auslieferung (ship, land-and-deploy), Dokumentationspflege (document-release), Rückblicke (retro) und Sicherheitsleitplanken (careful, freeze, guard). Ein Headless-Browser, mit etwa 100 ms pro Befehl beschrieben, unterstützt QA und Screenshots.

Die QA-Rolle verdient die meiste Aufmerksamkeit. Viele KI-Coding-Abläufe enden, sobald der Code geschrieben ist. gstack verlangt, einen echten Browser zu öffnen und den Zustand der Seite zu prüfen. Aus „ich glaube, es läuft“ wird „ich habe gesehen, dass es läuft“, ein praktischer Schutz gegen Halluzinationen. Auch die Leitplanken sind nützlich. Sie warnen vor gefährlichen Vorgängen wie `rm -rf` oder einem erzwungenen Push oder beschränken Änderungen auf ein Verzeichnis.

Eine Tatsache muss klar gesagt werden: Die auffälligsten Zahlen im README stammen vom Autor selbst. Er berichtet, seine Rate logischer Codeänderungen betrage 2026 etwa das 810-Fache von 2013, nämlich 11.417 gegenüber 14 logischen Zeilen pro Tag. Außerdem sei 2026 bis zum 18. April schon das 240-Fache des gesamten Jahres 2013, gemessen über 40 öffentliche und private Repositories. Er räumt ein, dass rohe Zeilenzahlen mit KI aufgebläht werden, und verweist auf ein Methodendokument, das dies bereinigt. Dennoch hat niemand die Zahlen unabhängig reproduziert, und private Repositories lassen sich von außen nicht prüfen. Mehr Code ist nicht mehr Wert, und der Gewinn lässt sich nicht allein gstack zuschreiben. Wir haben keinen gepaarten Vergleich durchgeführt und können daher keinen konkreten Verbesserungsfaktor behaupten.

Branchenwirkung und Ausblick

Die Bedeutung von gstack liegt nicht in einem algorithmischen Durchbruch, sondern in der Praxis, die es zeigt: Teamprozesse als teilbares Prompt-Paket zu kodieren. Das gehört zur selben Familie von Ideen wie Stilregeln in einer Lint-Konfiguration oder Deployment in CI-Skripten, nur mit einem Agenten als Ziel. Rund 135.000 Sterne zeigen eine starke Nachfrage nach fertigen Agenten-Workflows.

Das Projekt macht auch Risiken sichtbar. Rollen-Prompts können beliebig und austauschbar werden, und echte Projekte unterscheiden sich stark in ihren Randbedingungen, sodass eine direkte Übernahme zu rituellen Reviews ohne Substanz führen kann. Ohne erzwungene Prüfung muss ein Mensch die Ergebnisse der Review-Befehle weiterhin kontrollieren. Zudem sind die Befehle um Claude Code herum gebaut, und ein Wechsel zu einem anderen Agenten würde eine Neufassung erfordern.

Zwei Richtungen scheinen wahrscheinlich. Die eine verbindet Rollen-Prompts mit echten deterministischen Prüfungen, etwa indem die Sicherheitsrolle einen Scanner aufruft und ein nachprüfbares Protokoll liefert, statt nur einen Textbericht zu schreiben. Die andere ist Messung: gepaarte Daten pro Stichprobe, die Fehler- und Nacharbeitsraten mit und ohne rollenbasierten Ablauf vergleichen. Solange solche Belege fehlen, lautet die vorsichtige Sicht: gstack ist eine gut gestaltete, sehr günstige Workflow-Vorlage, die einen Versuch wert ist. Sein Produktivitätsversprechen bleibt die Selbstauskunft des Autors und kein überprüftes Ergebnis.

Sources

FAQ

Wer hat gstack veröffentlicht, und unter welcher Lizenz?

Garry Tan, Präsident und CEO von Y Combinator, hat es als garrytan/gstack unter der MIT-Lizenz veröffentlicht. Es hat rund 135.000 GitHub-Sterne.

Was ist gstack technisch, und braucht es ein Backend?

Es braucht kein Backend. Laut README besteht es aus Slash-Befehlen, die vollständig als Markdown-Prompt-Dateien vorliegen, ohne eigenen Dienst oder neue Laufzeit.

Ist die Angabe von 810-facher Leistung glaubwürdig?

Sie ist eine Selbstauskunft des Autors, schließt private Repositories ein und wurde weder unabhängig reproduziert noch in einem gepaarten Vergleich geprüft. Mehr Code bedeutet zudem nicht mehr Wert, daher ist Vorsicht angebracht.