K-Bench:面向高风险心理健康對話的臨牀校準評測基準
隨著越來越多患者使用大語言模型取得心理支持,模型在高風險、持續演化的對話中的安全性尚未被充分刻畫。本文提出 K-Bench,一個由臨牀醫生校準的受保護評測基準,涵蓋 33 個基座模型、14 家廠商的 125 種模型配置,在 200 條固定多輪情景上評估自殺、自傷、家庭暴力、物質濫用及無風險等臨牀呈現。合成患者對話與真實人机對話呈現顯著分布重疊。凍結的 GPT-4o 裁判在 151 份經臨牀評分的對話、6751 項可比條目上與醫生共識達到 94.2% 的精確一致。領先模型在支持性對話與綜合風險評分上均表現優異,而風險探索環節在低配模型間差異顯著。治療性提示帶來針對弱模型的提升,而強化推理未帶來平均改進。該基準兼具更廣臨牀覆蓋與配置級對比,並透過持續更新的公開榜單保護測試材料。
随着大语言模型越来越多地被用于心理健康支持领域,其在高风险、持续演化的对话场景中的安全性却尚未得到充分刻画。这一空白使得开发者与临床工作者难以判断不同模型在面对真实危机时的表现差异。本文的核心贡献是提出 K-Bench,一个由临床医生校准、受保护的评测基准,用于系统评估大语言模型在高风险心理健康对话中的表现。该基准覆盖了来自 14 家厂商的 33 个基座模型的 125 种模型配置,并在一个固定的 200 条多轮情景队列上进行评估,情景涵盖自杀、自伤、家庭暴力、物质滥用以及无风险呈现等多种临床情境。这一设计使得评测不仅能够考察模型在单一任务上的表现,还能在统一的临床队列上对比大量模型配置,从而更真实地反映不同模型在复杂、动态对话中的安全边界与能力差异。论文进一步通过合成患者对话与真实人机对话的分布对比,验证了基准的临床代表性,为后续的安全评测奠定了可信基础。
在技术方法上,K-Bench 采用固定队列的多轮情景设计,确保所有模型配置都在相同的临床情境下被评估,从而避免了因测试材料随机化而带来的可比性问题。情景经过临床校准,覆盖从高危到无风险的完整谱系,使评测能够同时考察模型的支持性对话能力与风险识别能力。为降低人工评分成本并提升一致性,论文引入一个冻结的 GPT-4o 裁判模型,用于对对话质量与风险处理进行自动化评估。该裁判在 151 份经临床医生评分的对话 transcript 中,从 6751 项可比条目里与医生共识达到了 94.2% 的精确一致,表明自动化裁判在高风险心理健康评估中具有高度的可信度。此外,论文还考察了两种提示策略的影响:治疗性提示与强化推理提示。前者针对弱模型带来显著提升,后者则未带来平均层面的改进。
这种针对配置特异性的发现,说明提示工程在高风险场景中的效果高度依赖模型本身的能力基线,为后续如何为不同模型设计适配的提示策略提供了实证依据。在实验设置与关键结果方面,K-Bench 在 200 条固定多轮情景上对 125 种模型配置进行了系统评估,覆盖 33 个基座模型与 14 家厂商,形成了目前较为广泛的临床覆盖与配置级对比。关键结果显示,领先模型能够将强支持性对话与高于 95 的综合风险评分相结合,表明头部模型在兼顾人文关怀与风险识别方面表现优异。相比之下,在风险探索环节,低性能配置之间出现了显著差异,说明这些模型在主动探索自杀、自伤等高危信号时能力参差不齐。消融与提示实验进一步揭示,治疗性提示带来的收益集中体现在较弱的模型配置上,而强化推理提示并未带来平均层面的改进。这一发现对当前普遍强调推理增强的趋势提出了重要反思,即在高风险心理健康场景中,单纯提升推理能力未必能转化为实际的安全收益。
同时,合成患者对话与真实人机对话之间显著的分布重叠,也为基准的外部效度提供了支持,表明基于合成对话的评测结果能够较好地推广到真实交互环境中。在行业意义与潜在影响方面,K-Bench 为心理健康领域的大语言模型评测提供了一个兼具临床严谨性与规模可比性的公共基础设施。其通过受保护的测试材料,避免了模型对评测数据的直接优化,从而保证了长期评测的可信度与公平性。持续更新的公开榜单则为开发者、临床工作者与监管方提供了一个透明的性能对比平台,有助于推动整个行业在安全性上的良性竞争。对于开源社区而言,该基准的配置级对比设计使得不同规模与架构的模型都能被纳入统一评估,降低了参与高标准评测的门槛。对于工业落地而言,其覆盖自杀、自伤、家庭暴力、物质滥用等高危情境,为产品在实际部署前的安全验证提供了可操作的依据。对于后续研究而言,冻结 GPT-4o 裁判与医生共识的高度一致,为自动化临床评估提供了可信范式,而治疗性提示与强化推理提示的差异化效果,则为高风险场景下的提示工程与模型设计指明了方向。该榜单已在 www.k-bench.ai 开放,有望成为心理健康大语言模型安全评测的重要参考标准。
Sources
FAQ
K-Bench 是什么?它如何评估大语言模型的心理健康对话安全性?
K-Bench 是一个由临床医生校准的受保护评测基准,覆盖 33 个基座模型、14 家厂商的 125 种配置,在 200 条固定多轮情景上评估自杀、自伤、家庭暴力、物质滥用等高风险对话表现。
为什么 K-Bench 对心理健康大模型的安全评测很重要?
越来越多患者转向大语言模型寻求心理支持,但高风险管理对话的安全性此前缺乏可靠刻画。K-Bench 的冻结 GPT-4o 裁判与医生共识达 94.2% 精确一致,为开发者、临床工作者和监管方提供了可信的评测基础设施。
K-Bench 之后有什么值得关注的方向?
K-Bench 测试材料受保护,公开榜单在 www.k-bench.ai 持续更新,可长期追踪模型安全表现。研究发现治疗性提示能提升弱模型而强化推理无平均改进,提示工程与模型设计将成为高风险场景下一步的研究重点。