多智能体工作流:把对话式数据采集与行为预测整合进可审计流程
出行行为研究长期将数据采集与预测建模割裂开发,缺少统一协作框架。一项研究提出三智能体工作流,把对话式数据采集、结构化数据处理与行为预测整合进可审计流程。研究者用聊天机器人施测、图像增强的陈述偏好问卷,收集学生通勤者在五种预设天气场景下的出行方式选择,获454条受访者-场景观测。随机森林达69.6%五类准确率,最佳纯文本零样本大语言模型无需任务适配即达69.9%;在与受访者共享天气图像时最佳视觉配置升至71.5%,显示视觉上下文可为部分模型提供额外预测信息。
出行行为研究长期依赖两类相对独立的环节:一类是通过问卷、访谈等方式采集出行者的偏好与选择数据,另一类是用统计或机器学习模型对这些数据进行建模与预测。传统做法往往把这两个阶段分开设计、分别评估,导致数据生成方式与建模目标之间缺乏协调,采集到的信息未必最契合下游预测的需求。这篇论文的核心贡献在于提出一个三智能体工作流,把对话式数据采集、结构化数据处理与行为预测整合进一个可审计、可复现的协作流程中,尝试打通从数据生成到预测建模的完整链路。作者关注的具体问题是:在天气敏感的交通需求预测场景下,能否用对话式、图像增强的方式高效采集出行方式选择数据,并让传统行为建模、机器学习与多模态大语言模型在同一框架内协同工作,从而验证多智能体协作在出行研究中的可行性与价值。在技术方法上,研究首先设计了一个由聊天机器人施测的陈述偏好问卷,向学生通勤者展示五种预设的天气场景,并记录他们在每种场景下的出行方式选择,最终获得454条受访者-场景观测。
这一数据采集环节借助对话式交互完成,同时引入图像增强来提升天气情境的真实感与代入感。在数据处理环节,研究对天气与出行选择之间的关联使用多项Logit模型进行行为建模,这是交通行为分析中的经典方法,用于刻画不同情景下选择概率的结构。与此同时,研究以逻辑回归和随机森林作为机器学习基准,用于对比验证。在大语言模型评估部分,作者部署了九款参数规模从2亿到35亿不等的本地大语言模型,先在四种零样本的提示与上下文条件下进行基线评估,再逐步扩展至人格设定、少样本提示以及基于视觉的配置。这种由简到繁的评估策略,系统考察了不同提示工程手段对预测性能的影响,而非依赖针对任务的专门微调。
在实验设置与关键结果方面,研究在出行方式选择这一五分类任务上进行了全面比较。随机森林作为传统机器学习方法达到了69.6%的五类准确率,而最佳纯文本零样本大语言模型在没有进行任何任务适配的情况下就达到了69.9%,显示出大语言模型在零样本条件下的强大潜力。在提示工程探索中,习惯出行信息带来的提升最为一致,专家视角的框架普遍优于角色扮演框架,而人格信息在缺乏习惯出行信息时最为有用。少样本提示对多个模型都有改善,且在输入少量示例后收益趋于稳定。特别值得注意的是,当使用与受访者展示的天气图像时,最佳视觉配置达到了71.5%的五类准确率,表明视觉上下文能够为部分模型提供额外的预测信息。
这些消融式的发现说明,不同提示策略与多模态输入的效果高度依赖于所提供信息的内容与模型特性。在行业意义与潜在影响方面,这篇论文的价值不仅在于具体的准确率数字,更在于展示了一种可审计、可协调的多智能体工作流范式。它将对话式调查、结构化数据处理、传统行为建模、机器学习以及多模态大语言模型预测统一在同一框架内,为出行行为研究提供了一种端到端的协作思路。对开源社区而言,九款本地部署的大语言模型的评估为资源受限场景下的模型选型提供了参考。对工业落地而言,对话式数据采集降低了问卷施测的成本与门槛,而图像增强的方式有助于提升数据的真实感与质量。对后续研究而言,视觉上下文带来额外提升的发现提示研究者重视多模态信息在行为预测中的作用,同时也为如何协调人类数据生成与人工智能建模提供了可借鉴的实践经验。
Sources
FAQ
这篇论文提出了什么?
研究提出一个三智能体工作流,把对话式数据采集、结构化数据处理与行为预测整合进可审计流程。用聊天机器人施测图像增强的陈述偏好问卷,收集学生通勤者在五种天气场景下的出行方式选择,共454条受访者-场景观测。
为什么这项研究重要?
它打通了从数据生成到预测建模的完整链路,验证了多智能体协作在出行研究中的可行性。九款本地部署大语言模型为资源受限场景的模型选型提供参考,对话式采集也降低了问卷施测的成本与门槛。
未来值得关注的方向是什么?
最佳视觉配置在与受访者共享天气图像时准确率升至71.5%,显示视觉上下文可为部分模型提供额外预测信息。后续研究应重视多模态信息在行为预测中的作用。