arXiv 自然语言处理· Xinkai Chen·· 1 天前AI 评分33
结构化提取 vs CoT:评估大语言模型抑郁严重程度临床标准提取能力
Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
AI 导读
研究在两个 Reddit 语料库上测试了 3 个 9B 至前沿规模的大语言模型,对比临床标准提取(PHQ-9 与 BDI-II)与 CoT 推理在抑郁严重程度判断中的表现。结果显示,基于先验规则的标准提取并未带来显著增益,反而漏判了绝大多数重度抑郁帖子。从直接提示转向 CoT 及标准提取时,模型对重度病例的漏判率在几乎所有对比中均持续上升。
来源:arXiv 自然语言处理 · arxiv.org