arXiv 自然语言处理· Jhen-Ke Lin, Chung Chun Wang·· 1 天前AI 评分48
StreamDecisionBench:评估动态语言流中的实时生效决策
StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams
AI 导读
研究团队推出 StreamDecisionBench(SDB)评测基准及 in-force accuracy 指标,用于衡量大语言模型在 0.5-8 s 更新间隔的语言流中实时决策的正确时间占比。评测显示较慢的高精度模型有 42-51% 的时间因延迟导致决策过时,快速模型则有 34% 的时间发生判断错误。采用慢速模型修正快速模型的混合架构表现优于单模型,但最佳系统的正确决策维持时间仍仅约三分之二。
来源:arXiv 自然语言处理 · arxiv.org