一项于周一发表的横断面研究,针对一份公开捐赠语料库中的 620,699 条 ChatGPT 对话使用同一个分类器,在两种不同的“什么算作心理健康对话”的定义下进行分析。按照保守定义——明确就心理问题寻求帮助——研究发现 1,317 条对话,占 0.21%(95% CI 0.20–0.22)。按照更宽泛的定义——只要存在任何心理健康相关主题——则发现 30,394 条,占 4.90%(95% CI 4.84–4.95)。定义一变,便出现了 23 倍的差距。

常规表述哪里出了错

有两种误读,第一种来自出版方。该期刊自己的索引简介将这项研究描述为:青少年使用 AI 聊天机器人讨论心理健康问题的频率。 但事实并非如此。分析单位是一份面向普通用户的公开对话语料库,其中完全没有年龄数据。任何人如果据此元数据一行写出“青少年安全”标题,都是建立在元数据错误之上。第二种:标题数字会被当作患病率来报道,但它并不是人群的患病率,而是在一个捐赠的公开语料库中、由一个阳性预测值为 67%的分类器打分后得到的对话占比——也就是说,大约三分之一的阳性判定是错的。其灵敏度为 87%,特异度为 95%,阴性预测值为 98%。

为何这个差距本身就是发现

“有多少人把心理健康问题带到聊天机器人那里”这一问题,如今正被模型提供商、监管机构和原告律师援引,而他们各自都希望得到不同答案。这篇论文表明,这个数字是披着测量外衣的政策选择——只要决定“顺带提到压力”算不算,就能在不触碰数据的情况下把结果放大或缩小 23 倍。作者给出的回应是建设性的:他们提出一个分层分类法——危机和高风险、临床框架下的类别,以及广义的情绪或人际关系类别——这样无论谁引用数字,都必须说明自己指的是哪一层。

作者声明的局限性

依赖一份没有外部验证的公开语料库;对含糊的痛苦表达可能存在误分类;且未测试基于分类法的监测是否能改善任何结果。该研究由一项 National Institute of Mental Health 资助支持。

应如何看待这项研究

除非一项关于聊天机器人心理健康用途的单一百分比同时说明其定义、分母和分类器精度,否则都应视为不完整。目前流传的大多数数字,这三项都没有交代。