gstack : 23 commandes slash par rôle qui transforment Claude Code en équipe d'ingénierie virtuelle

Published · AI Daily — AI-assisted deep research, methodology & disclosure

gstack est une configuration Claude Code sous licence MIT, publiée par Garry Tan, président de Y Combinator. Elle répartit le travail logiciel en 23 commandes slash par rôle, comme la revue CEO, la revue d'ingénierie, la revue de design, la QA et la livraison, plus huit outils complémentaires. Tout est écrit en Markdown. Le dépôt compte environ 135 000 étoiles. Sa vraie valeur est de transformer une invite vide en flux de travail reproductible. Le gain de productivité de 810 fois, annoncé par l'auteur, n'a pas été reproduit de façon indépendante.

Contexte et définition du problème

En mars 2026, Andrej Karpathy a déclaré dans un podcast qu'il n'avait presque plus tapé une ligne de code depuis décembre. Le README de gstack ouvre sur cette citation. Elle désigne un problème nouveau. Quand un modèle écrit la majeure partie du code, le goulot d'étranglement passe de « sait-il écrire » à « comment organiser le travail ».

La plupart des gens découvrent Claude Code devant une zone de saisie vide. Le même modèle peut compléter quelques lignes pour l'un et livrer une fonctionnalité entière pour l'autre. L'écart vient souvent de la structure de la demande, pas du modèle. Sans structure, le résultat reste irrégulier, et les habitudes d'une vraie équipe, comme la revue, les tests et la discipline de livraison, n'apparaissent jamais.

gstack vise cette lacune. Le projet a été publié par Garry Tan, président et directeur général de Y Combinator, dans le dépôt garrytan/gstack, sous licence MIT. Il compte environ 135 000 étoiles sur GitHub. L'auteur l'appelle son usine logicielle open source et affirme l'utiliser chaque jour. Le README cite trois publics : les fondateurs techniques qui veulent encore livrer, les nouveaux utilisateurs de Claude Code qui préfèrent des rôles structurés à une invite vide, et les responsables techniques qui veulent une revue stricte, de la QA et une livraison automatisée sur chaque pull request.

Architecture centrale et principes techniques

L'idée centrale consiste à découper un modèle généraliste en plusieurs rôles aux responsabilités claires. Le README décrit un CEO qui repense le produit, un responsable d'ingénierie qui fige l'architecture, un designer qui repère le design bâclé par l'IA, un relecteur qui trouve les bogues de production, un responsable QA qui ouvre un vrai navigateur, un responsable sécurité qui mène des audits OWASP et STRIDE, et un ingénieur de livraison qui expédie la pull request. Le total annoncé est de 23 spécialistes et huit outils complémentaires. Dans sa forme, gstack n'a ni service serveur ni nouvel environnement d'exécution. Le README indique que tout est en commandes slash, tout en Markdown, gratuit et sous licence MIT. Chaque rôle est donc un fichier d'invite préparé, que Claude Code charge lorsqu'on appelle la commande correspondante. Cette conception a trois conséquences. D'abord, la barrière d'entrée est très basse. L'installation consiste à placer des fichiers là où Claude Code peut les lire, et le README parle d'environ 30 secondes. Ensuite, le système est auditable. Chaque comportement est écrit en texte, donc on peut le lire, le modifier et le dupliquer ligne par ligne. Enfin, et c'est le point essentiel, il n'a aucun pouvoir de contrainte. Un rôle n'est qu'une invite. Que le modèle l'applique dépend du modèle. Il n'y a ni système de types, ni compilateur, ni mécanisme prouvant que le « responsable sécurité » a réellement terminé un audit.

Le démarrage rapide reflète la même répartition. On lance `/office-hours` pour décrire ce que l'on construit, `/plan-ceo-review` pour mettre l'idée à l'épreuve, `/review` sur une branche modifiée, puis `/qa` sur une URL de préproduction ou sur une API locale isolée, une CLI, une tâche ou un webhook. L'ordre imite une vraie équipe : clarifier le besoin, relire le plan, relire le code, tester, livrer.

Évaluation pratique et applications

La liste de compétences visible dans cette session montre que les commandes couvrent de nombreuses étapes du cycle de vie logiciel : remue-méninges (office-hours), revue de stratégie, d'architecture et de design (plan-ceo-review, plan-eng-review, plan-design-review), systèmes de design (design-consultation), débogage (investigate), tests (qa, qa-only), revue de code (review), audit visuel (design-review), livraison (ship, land-and-deploy), mise à jour de la documentation (document-release), rétrospectives (retro) et garde-fous (careful, freeze, guard). Un navigateur sans interface, décrit comme traitant une commande en environ 100 ms, soutient la QA et les captures d'écran.

Le rôle de QA mérite le plus d'attention. Beaucoup de flux de codage assisté s'arrêtent quand le code est écrit. gstack demande d'ouvrir un vrai navigateur pour vérifier l'état de la page. On remplace « je crois que ça marche » par « j'ai vu que ça marche », ce qui constitue une protection concrète contre les hallucinations. Les commandes de garde-fou sont utiles aussi : elles avertissent avant une opération dangereuse comme `rm -rf` ou un push forcé, ou limitent les modifications à un seul répertoire.

Un fait doit être dit clairement : les chiffres les plus visibles du README viennent de l'auteur lui-même. Il affirme que son rythme de changement de code logique en 2026 vaut environ 810 fois celui de 2013, soit 11 417 contre 14 lignes logiques par jour. Il ajoute que 2026, jusqu'au 18 avril, équivaut déjà à 240 fois toute l'année 2013, sur 40 dépôts publics et privés. Il reconnaît que le nombre brut de lignes gonfle avec l'IA et renvoie vers un document de méthode qui corrige cet effet. Pourtant, personne n'a reproduit ces chiffres de manière indépendante, et les dépôts privés ne sont pas vérifiables de l'extérieur. Plus de code n'est pas plus de valeur, et le gain ne peut pas être attribué à gstack seul. Nous n'avons mené aucune comparaison appariée, donc nous ne pouvons revendiquer aucun multiplicateur précis.

Impact sur l'industrie et perspectives

L'importance de gstack ne tient pas à une percée algorithmique, mais à la pratique qu'il représente : coder le processus d'une équipe sous forme de lot d'invites partageable. C'est la même famille d'idées que d'écrire les règles de style dans une configuration de lint ou le déploiement dans des scripts d'intégration continue, avec un agent pour cible. Environ 135 000 étoiles montrent une forte demande pour des flux de travail d'agent prêts à l'emploi.

Le projet révèle aussi des risques. Les invites de rôle peuvent devenir génériques, et les projets réels diffèrent beaucoup par leurs contraintes, si bien qu'une copie directe peut produire des revues rituelles sans substance. Sans vérification imposée, les conclusions des commandes de revue doivent encore être contrôlées par un humain. Enfin, les commandes sont bâties autour de Claude Code, et passer à un autre agent exigerait une réécriture.

Deux pistes semblent probables. La première relie les invites de rôle à de vrais contrôles déterministes, par exemple en laissant le rôle sécurité appeler un scanner et produire un journal vérifiable, au lieu d'un simple rapport écrit. La seconde est la mesure : des données appariées échantillon par échantillon comparant les taux de défauts et de reprises avec et sans flux par rôle. Tant que ces preuves manquent, la position prudente est la suivante. gstack est un modèle de flux de travail bien conçu, très peu coûteux et qui mérite d'être essayé. Sa promesse de productivité reste un témoignage de l'auteur, pas un résultat vérifié.

Sources

FAQ

Qui a publié gstack et sous quelle licence ?

Garry Tan, président et directeur général de Y Combinator, l'a publié sous le nom garrytan/gstack, avec la licence MIT. Il compte environ 135 000 étoiles sur GitHub.

Qu'est-ce que gstack sur le plan technique, faut-il un serveur ?

Aucun serveur n'est nécessaire. Selon le README, il s'agit d'un ensemble de commandes slash écrites en fichiers d'invite Markdown, sans service distinct ni nouvel environnement d'exécution.

Peut-on se fier au chiffre de 810 fois plus de production ?

Il s'agit d'une déclaration de l'auteur, qui inclut des dépôts privés, sans reproduction indépendante ni comparaison appariée. Plus de code ne signifie pas plus de valeur : il faut rester prudent.