跳到正文
热点事件观察中

研究评估LLM抑郁严重程度临床标准提取与CoT表现

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月1日,arXiv发布的一项研究在两个Reddit语料库上测试了3个从9B至前沿规模的大语言模型,对比临床标准提取(PHQ-9与BDI-II)与思维链(CoT)推理在抑郁严重程度判断中的表现。结果显示,基于先验规则的标准提取并未带来显著增益,反而漏判了绝大多数重度抑郁帖子。同时,当模型从直接提示转向CoT及标准提取时,对重度病例的漏判率在几乎所有对比中均呈现持续上升趋势。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv 自然语言处理
    结构化提取 vs CoT:评估大语言模型抑郁严重程度临床标准提取能力

    研究在两个 Reddit 语料库上测试了 3 个 9B 至前沿规模的大语言模型,对比临床标准提取(PHQ-9 与 BDI-II)与 CoT 推理在抑郁严重程度判断中的表现。结果显示,基于先验规则的标准提取并未带来显著增益,反而漏判了绝大多数重度抑郁帖子。从直接提示转向 CoT 及标准提取时,模型对重度病例的漏判率在几乎所有对比中均持续上升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。