Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
NEWS 约 1 分钟

MentalHealthBench给心理对话设考场

用真实感心理对话考AI:不只看会不会安慰,也检查能否守住安全边界。

当一个人向 AI 倾诉失眠、绝望,甚至逐渐流露危机信号时,回答听起来温柔并不等于安全。模型还要识别风险,避免强化妄想或依赖,并在必要时引导对方寻求专业帮助。MentalHealthBench 正是为这类高风险对话设置的一套“考场”。

据 OpenAI 介绍,MentalHealthBench 是一项有专家知识参与的基准测试——也就是用固定任务、样例和评分规则,检验 AI 在贴近真实的心理健康对话中,能否同时做到有帮助和足够安全。这里的关键是“同时”:理解处境、提供支持是一面;不漏掉危机信号、不提出危险建议,则是另一面。现有材料尚未披露测试规模、具体评分方法或模型成绩,因此眼下更值得关注的是它确立的评测方向,而非某个排行榜结论。


供稿材料 SOURCES — 1

← 返回 2026-09-24 · 科技板块