跳到正文
原文
arXiv 自然语言处理· Marius Bayizere·· 2 天前AI 评分34

KinyaMed:种子而非行数——以错误单位设定的语料库需求为何无法约束质量

KinyaMed: Seeds, Not Rows -- What a Corpus Requirement Written in the Wrong Unit Fails to Constrain

AI 导读

KinyaMed 研究指出,构建卢旺达语医疗分诊分类器时若仅以数据行数而非种子句作为规范,将导致质量约束失效。机器虽能在 130 秒内以 7,700 条/秒生成 100 万行样本,但受限于仅 165 个临床种子句而无法通过质量检测,训练出的模型在大小写变动和单处拼写错误下分别有 31.5% 与 21.0% 的预测改变。该研究提供了完整的检测工具与可复现的负面结果。

来源:arXiv 自然语言处理 · arxiv.org