Jump Trading 用 GPT-6 Astra 把量化研究交给长时程智能体:人类只定目标与边界,审核留在最后一关

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OpenAI 于10月6日发布 Jump Trading 客户案例。该公司 LLM 研发负责人 Lucas Baker 表示,GPT-6 Astra 让智能体能够承接持续数天的长周期研究:自行调取多路数据、判断取舍、叠加有效改进,并按事先约定的标准调整方向。同时,团队坚持在受监管环境中保留人工审核,把智能体产出的交易信号当作可能出错的普通信号处理。

2026年10月6日,OpenAI 发布了一篇客户案例,讲述量化交易公司 Jump Trading 如何借助 ChatGPT 与 GPT-6 Astra 扩大量化研究的规模。案例的核心人物是 Jump 的 LLM 研发负责人 Lucas Baker。他主管智能体方向的研发,工作重点是搭建智能体、运行外壳(harness)和基础设施,让量化研究员能够把自己的想法探索得更广、更深。 先看背景。Jump 是一家量化交易公司,用市场数据、新闻与事件,以及多种另类数据构建预测模型,去预测资产价格。市场复杂、嘈杂,而且随时间变化,几乎不可能准确预知将发生什么。但 Baker 指出,只要在大规模上比抛硬币预测得稍微好一点,就足以形成一个成功的策略。这个前提很重要:量化研究本质上是在海量假设中寻找微弱而稳定的优势,所以谁能更快、更广地验证假设,谁就更占优势。 再看变化本身。Baker 说,加入 GPT-6 Astra 之后,可以交给智能体的工作流在规模和复杂度上都大幅扩展,从日常编码,一直到为验证新假设而做的高级量化研究。他的原话大意是:借助 GPT-6 系列,尤其是 GPT-6 Astra,OpenAI 为需要灵活的智能体协同和极强持续性的长时程任务解锁了新的自主层级。过去需要频繁的人工指导和介入,现在可以把精力完全放在定义一个安全、监控良好的环境和清晰的目标上,然后让智能体自己找到路径。

文章把过去一年的演变概括为:AI 从一个有帮助的工具,变成能够独立开发完整代码库和服务的多面手系统。以前它适合写一次性的代码片段或找小错误。现在 Baker 的团队发现,把 AI 当作同事来用效果最好。研究员定义关键问题、工作环境,以及评估结果质量与重要性的方式,然后实时引导一个或多个智能体,告诉它们接下来该关注哪块分析、该跑哪项任务。 其中最值得注意的是“递归式改进”。Baker 表示,GPT-6 Astra 驱动的智能体不仅能找到有意义且实用的改动,还能把这些成果合并、叠加起来。在一次长时间运行的任务中,系统可以分析自己的发现,对照最初方案里约定的标准加以判断,并主动调整努力方向,而不必由人去分析每一轮改动。用他的话说,你现在可以定义一个需要跑上几天的任务:它要从许多数据源取数,要对什么重要、什么不重要做出细微判断,还要把所有内容相互关联,最终形成一份真正可用的综合分析。 对一家身处强监管行业的公司来说,更关键的是如何管控风险。Jump 的业务覆盖所有时间维度与资产类别,每个环节都很复杂,一旦出错,既有财务后果,也有合规后果。Baker 强调,必须清楚把工作托付给 AI 会带来哪些风险;同时,智能体能力也可以用于提升质量、安全与监控,而不只是增加功能。Jump 的做法包括:强健的系统设计与边界、清晰的约束、利于引导与观测的基础设施,以及对改动的人工审核。他说,让智能体或系统在安全环境里自由产出所需的任何输出,同时在末端设一道人工审核、由人完成关键验证并最终接受,这才是信心的来源。 具体到交易信号,原文给出了很清楚的边界:如果智能体产出了一个交易信号,它会像任何其他输出一样被划定范围并接受审查,被当作一个信号对待。这个信号通常有信息量,但也可能出错,并且会与其他所有信号一起,被整合进一个经过严格审查、受到控制的执行环境。换言之,智能体并没有直接下单的权力,它的产出是进入既有风控与执行流程的一个输入。 展望方面,Baker 认为我们正走向一个“autoresearch”普及的世界,即由智能体研究员对可度量的系统做递归式改进,普及到被视为量化研究员日常工作流的一部分。不过现状要克制得多:即便是 GPT-6 Astra 最长的任务,也仍包含与任务定义者的定期确认,既要确认拉取什么数据、运行多久、什么算重要,也要确认中间结果是否合理。更高级的 autoresearch 仍然始于人类定义的系统,包括输入、环境定义、评价指标、取舍与整体优先级,之后把其余环节交给一个结构松散、由其他智能体协调的智能体“舰队”,由它们决定如何探索想法、分配算力、整合有前景的发现,起点可能只是一个开放问题。

他还回顾了节奏:2024年,早期智能体能无误地写出单个文件就算令人印象深刻;2025年,已经可以从零构建整个代码库;到2026年,已经能让许多智能体并肩动态协作,在开放的研究问题上取得进展。这些跃迁往往提前几个月都难以预测。 需要说明的是,这篇案例没有披露具体的基准分数、成本数字或策略收益,也没有说明智能体规模和算力用量,因此无法据此判断投资回报。对行业而言,它的价值更多在于方法:把目标、环境与评价标准交给人定义;让智能体长时间自主运行并自我修正;在末端保留人工验收;把智能体的产出当作普通信号,纳入既有的受控执行环境。这套分工,可供其他受监管行业设计智能体工作流时参考。

Sources