Comment Jump Trading change d'échelle en recherche quantitative avec ChatGPT et GPT-6 Astra
Le 6 octobre, OpenAI a publié un témoignage client sur Jump Trading. Lucas Baker, responsable R&D LLM de la firme, explique que GPT-6 Astra permet de confier aux agents des recherches de plusieurs jours : puiser dans de nombreuses sources, arbitrer, cumuler les améliorations utiles et réorienter leur travail selon des critères convenus. Jump conserve toutefois des limites strictes et une revue humaine, et traite tout signal produit par un agent comme informatif mais potentiellement faux.
Le 6 octobre 2026, OpenAI a publié un témoignage client sur Jump Trading, la société de trading quantitatif, et sur la manière dont elle utilise ChatGPT et GPT-6 Astra pour changer d'échelle en recherche quantitative. La voix centrale est celle de Lucas Baker, responsable R&D LLM de Jump. Il dirige la recherche et le développement agentiques et se concentre sur la construction des agents, des harnais et de l'infrastructure qui permettent aux chercheurs quantitatifs d'explorer leurs idées avec plus d'ampleur et de profondeur. Commençons par le contexte. Jump construit des modèles prédictifs qui s'appuient sur les données de marché, les actualités et événements, et diverses sources de données alternatives pour prévoir le prix des actifs. Les marchés sont complexes, bruités et changent avec le temps : il est rarement possible d'anticiper exactement ce qui va se passer. Baker souligne pourtant que prédire à peine mieux qu'un tirage à pile ou face, à grande échelle, suffit pour une stratégie gagnante. Cette prémisse explique l'intérêt du sujet. La recherche quantitative consiste à chercher des avantages faibles mais reproductibles parmi un très grand nombre d'hypothèses. Celui qui teste plus d'idées, plus vite et plus largement, prend donc de l'avance.
Vient ensuite le changement lui-même. Baker affirme que GPT-6 Astra a considérablement élargi l'échelle et la complexité des flux de travail confiables aux agents, du codage quotidien aux études quantitatives avancées qui valident de nouvelles hypothèses. Selon lui, la série GPT-6, et surtout GPT-6 Astra, ouvre un nouveau palier d'autonomie pour les tâches à long horizon qui exigent une coordination souple entre agents et une persévérance extrême sur des flux complexes. Là où l'équipe avait besoin de conseils et d'interventions humaines fréquents, elle peut désormais se concentrer sur la définition d'un environnement sûr et bien surveillé, avec des objectifs clairs, et laisser les agents trouver leur chemin. L'article décrit l'année écoulée comme le passage d'un outil utile, bon pour des extraits de code isolés et de petits bogues, à un système polyvalent capable de développer seul des bases de code et des services entiers. L'équipe de Baker constate que l'IA fonctionne mieux lorsqu'on la traite comme un collègue. Le chercheur définit un problème clé, un environnement de travail et une façon d'évaluer la qualité et l'importance des résultats. Il pilote ensuite un ou plusieurs agents en temps réel, en précisant où concentrer l'analyse ou quelle tâche lancer ensuite. L'idée la plus marquante est l'amélioration récursive. Baker explique qu'avec GPT-6 Astra, les agents trouvent des changements significatifs et pratiques, et savent aussi fusionner et cumuler ces gains. Au cours d'une seule tâche de longue durée, le système analyse ses résultats, les juge selon les critères convenus dans la proposition initiale et réoriente son propre effort. Personne n'a besoin d'analyser chaque série de modifications. Selon lui, on peut désormais définir une tâche qui doit tourner pendant des jours, puiser dans de nombreuses sources, trancher finement entre ce qui compte et ce qui ne compte pas, tout relier, et obtenir une analyse complète qui fonctionne réellement.
Pour une entreprise d'un secteur très réglementé, la question difficile reste le risque. Jump opère sur tous les horizons de temps et toutes les classes d'actifs. Chaque étape est complexe, et une erreur peut avoir des conséquences financières comme réglementaires. Baker insiste sur la nécessité de connaître les risques liés à la délégation de travail à l'IA, et rappelle que l'intelligence agentique peut aussi améliorer la qualité, la sécurité et la surveillance, pas seulement ajouter des fonctions. Jump s'appuie sur une conception et des limites de système solides, des contraintes claires, une infrastructure qui favorise le pilotage et l'observabilité, et une revue humaine des changements. La confiance, dit-il, vient d'un environnement sûr où l'agent peut produire toute sortie nécessaire, associé à une étape finale de revue humaine où la validation critique a lieu et où une personne accepte le résultat.
Le témoignage est explicite sur les signaux de trading. Lorsqu'un agent produit un signal, il est cadré et relu comme toute autre sortie. Il est traité comme un signal : généralement informatif, potentiellement faux, et intégré avec tous les autres signaux dans un environnement d'exécution strictement relu et contrôlé. L'agent ne détient donc pas le pouvoir de négocier seul. Sa sortie est une entrée parmi d'autres dans les processus existants de risque et d'exécution. Pour la suite, Baker s'attend à ce que l'autorecherche, c'est-à-dire l'amélioration récursive de systèmes mesurables par des agents chercheurs, devienne si courante qu'elle fasse simplement partie du flux de travail ordinaire d'un chercheur quantitatif. Le présent est plus modeste. Même les travaux les plus longs de GPT-6 Astra impliquent des points réguliers avec la personne qui a défini la tâche : quelles données récupérer, combien de temps tourner, ce qui compte, et si les résultats intermédiaires sont cohérents. L'autorecherche avancée commencerait toujours par un système défini par un humain, avec entrées, environnement, métriques d'évaluation, compromis et priorités. Le reste serait confié à une flotte d'agents peu structurée, coordonnée par d'autres agents, qui déciderait comment explorer les idées, répartir le calcul et intégrer les trouvailles prometteuses, à partir de presque rien d'autre qu'une question ouverte.
Baker rappelle aussi le rythme des progrès. En 2024, il était impressionnant qu'un agent écrive un seul fichier sans erreur. En 2025, les agents pouvaient créer des bases de code entières à partir de zéro. En 2026, ils progressent sur des questions de recherche ouvertes, avec de nombreux agents qui collaborent dynamiquement côte à côte. Ces étapes étaient souvent difficiles à prévoir, même quelques mois à l'avance. Une précaution pour le lecteur : le témoignage ne divulgue ni scores de référence, ni coûts, ni rendements de stratégie, ni nombre d'agents, ni consommation de calcul. Il ne permet donc aucune conclusion sur le retour sur investissement. Sa valeur pour le secteur tient à la méthode : les humains fixent les objectifs, l'environnement et les critères d'évaluation ; les agents travaillent longtemps et corrigent eux-mêmes leur cap ; une personne valide le résultat à la fin ; et la sortie de l'agent est traitée comme un signal ordinaire dans un environnement d'exécution déjà contrôlé. D'autres secteurs régulés peuvent s'inspirer de ce partage des rôles pour concevoir leurs propres flux agentiques.