热点事件观察中
研究评估LLM抑郁严重程度临床标准提取与CoT表现
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月1日,arXiv发布的一项研究在两个Reddit语料库上测试了3个从9B至前沿规模的大语言模型,对比临床标准提取(PHQ-9与BDI-II)与思维链(CoT)推理在抑郁严重程度判断中的表现。结果显示,基于先验规则的标准提取并未带来显著增益,反而漏判了绝大多数重度抑郁帖子。同时,当模型从直接提示转向CoT及标准提取时,对重度病例的漏判率在几乎所有对比中均呈现持续上升趋势。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 12:00
研究显示基于临床标准的提取与CoT推理未改善抑郁判断,反而导致重度病例漏判率上升。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv 自然语言处理结构化提取 vs CoT:评估大语言模型抑郁严重程度临床标准提取能力
研究在两个 Reddit 语料库上测试了 3 个 9B 至前沿规模的大语言模型,对比临床标准提取(PHQ-9 与 BDI-II)与 CoT 推理在抑郁严重程度判断中的表现。结果显示,基于先验规则的标准提取并未带来显著增益,反而漏判了绝大多数重度抑郁帖子。从直接提示转向 CoT 及标准提取时,模型对重度病例的漏判率在几乎所有对比中均持续上升。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。