前沿AI在商業分析知識工作中的表現:基於案例的基準測試

當前大語言模型(LLM)在基準測試中表現優異,但主要側重於事實回憶、數學解題和程式碼生成等能力,缺乏對白領日常從事的分析性知識工作的評估。本文指出,此類工作涉及在不確定性和資訊不完整的情況下進行複雜資訊綜合、戰略判斷及權衡取捨。為此,作者借鑑頂尖商學院的「案例教學法」,構建了BusinessCaseBench基準測試。該基準涵蓋十八個商業學科,包含數百個問題及基於專家講師答案制定的評分標準。實驗結果顯示,前沿AI模型在該基準上得分較高,且同一模型家族的能力在兩年內顯著提升。這一發現表明AI在處理高階分析推理任務方面已具備高水平能力,對商學院教育及初級專業崗位具有深遠影響。

Sources