Jump Trading 用 GPT-6 Astra 把量化研究交給長時程智慧體:人類只定目標與邊界,審核留在最後一關
OpenAI 於10月6日發布 Jump Trading 客戶案例。該公司 LLM 研發負責人 Lucas Baker 表示,GPT-6 Astra 讓智慧體能夠承接持續數天的長週期研究:自行調取多路資料、判斷取捨、疊加有效改進,並依事先約定的標準調整方向。同時,團隊堅持在受監管環境中保留人工審核,把智慧體產出的交易訊號當作可能出錯的一般訊號處理。
2026年10月6日,OpenAI 發布了一篇客戶案例,講述量化交易公司 Jump Trading 如何借助 ChatGPT 與 GPT-6 Astra 擴大量化研究的規模。案例的核心人物是 Jump 的 LLM 研發負責人 Lucas Baker。他主管智慧體方向的研發,工作重點是搭建智慧體、運行外殼(harness)和基礎設施,讓量化研究員能夠把自己的想法探索得更廣、更深。 先看背景。Jump 是一家量化交易公司,用市場資料、新聞與事件,以及多種另類資料建構預測模型,去預測資產價格。市場複雜、嘈雜,而且隨時間變化,幾乎不可能準確預知將發生什麼。但 Baker 指出,只要在大規模上比擲硬幣預測得稍微好一點,就足以形成一個成功的策略。這個前提很重要:量化研究本質上是在海量假設中尋找微弱而穩定的優勢,所以誰能更快、更廣地驗證假設,誰就更占優勢。 再看變化本身。Baker 說,加入 GPT-6 Astra 之後,可以交給智慧體的工作流程在規模和複雜度上都大幅擴展,從日常編碼,一直到為驗證新假設而做的進階量化研究。他的原話大意是:藉助 GPT-6 系列,尤其是 GPT-6 Astra,OpenAI 為需要靈活的智慧體協同和極強持續性的長時程任務解鎖了新的自主層級。過去需要頻繁的人工指導和介入,現在可以把精力完全放在定義一個安全、監控良好的環境和清晰的目標上,然後讓智慧體自己找到路徑。
文章把過去一年的演變概括為:AI 從一個有幫助的工具,變成能夠獨立開發完整程式碼庫和服務的多面手系統。以前它適合寫一次性的程式碼片段或找小錯誤。現在 Baker 的團隊發現,把 AI 當作同事來用效果最好。研究員定義關鍵問題、工作環境,以及評估結果品質與重要性的方式,然後即時引導一個或多個智慧體,告訴它們接下來該關注哪塊分析、該跑哪項任務。 其中最值得注意的是「遞迴式改進」。Baker 表示,GPT-6 Astra 驅動的智慧體不僅能找到有意義且實用的改動,還能把這些成果合併、疊加起來。在一次長時間運行的任務中,系統可以分析自己的發現,對照最初方案裡約定的標準加以判斷,並主動調整努力方向,而不必由人去分析每一輪改動。用他的話說,你現在可以定義一個需要跑上幾天的任務:它要從許多資料來源取數,要對什麼重要、什麼不重要做出細微判斷,還要把所有內容相互關聯,最終形成一份真正可用的綜合分析。 對一家身處強監管產業的公司來說,更關鍵的是如何管控風險。Jump 的業務涵蓋所有時間維度與資產類別,每個環節都很複雜,一旦出錯,既有財務後果,也有合規後果。Baker 強調,必須清楚把工作託付給 AI 會帶來哪些風險;同時,智慧體能力也可以用於提升品質、安全與監控,而不只是增加功能。Jump 的做法包括:強健的系統設計與邊界、清晰的約束、利於引導與觀測的基礎設施,以及對改動的人工審核。他說,讓智慧體或系統在安全環境裡自由產出所需的任何輸出,同時在末端設一道人工審核、由人完成關鍵驗證並最終接受,這才是信心的來源。 具體到交易訊號,原文給出了很清楚的邊界:如果智慧體產出了一個交易訊號,它會像任何其他輸出一樣被劃定範圍並接受審查,被當作一個訊號對待。這個訊號通常有資訊量,但也可能出錯,並且會與其他所有訊號一起,被整合進一個經過嚴格審查、受到控制的執行環境。換言之,智慧體並沒有直接下單的權力,它的產出是進入既有風控與執行流程的一個輸入。 展望方面,Baker 認為我們正走向一個「autoresearch」普及的世界,即由智慧體研究員對可度量的系統做遞迴式改進,普及到被視為量化研究員日常工作流程的一部分。不過現況要克制得多:即便是 GPT-6 Astra 最長的任務,也仍包含與任務定義者的定期確認,既要確認拉取什麼資料、運行多久、什麼算重要,也要確認中間結果是否合理。更進階的 autoresearch 仍然始於人類定義的系統,包括輸入、環境定義、評價指標、取捨與整體優先順序,之後把其餘環節交給一個結構鬆散、由其他智慧體協調的智慧體「艦隊」,由它們決定如何探索想法、分配算力、整合有前景的發現,起點可能只是一個開放問題。
他還回顧了節奏:2024年,早期智慧體能無誤地寫出單一檔案就算令人印象深刻;2025年,已經可以從零建構整個程式碼庫;到2026年,已經能讓許多智慧體並肩動態協作,在開放的研究問題上取得進展。這些躍遷往往提前幾個月都難以預測。 需要說明的是,這篇案例沒有披露具體的基準分數、成本數字或策略收益,也沒有說明智慧體規模和算力用量,因此無法據此判斷投資報酬。對產業而言,它的價值更多在於方法:把目標、環境與評價標準交給人定義;讓智慧體長時間自主運行並自我修正;在末端保留人工驗收;把智慧體的產出當作一般訊號,納入既有的受控執行環境。這套分工,可供其他受監管產業設計智慧體工作流程時參考。