热点事件持续更新
全双工语音决策框架DuplexJev发布并开源
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月5日,研究团队在arXiv发布全双工语音决策框架DuplexJev。该框架通过连接器将ASR编码器隐状态直接输入冻结的LLM,读取选项的单token分布完成无解码语音决策。测试显示,在8-GPU节点上,该系统可在约0.1秒内完成8段语音的80项决策;其语音问答准确率达90%,说话人性别和情绪识别准确率均达90%。目前,团队已开源模型权重、训练方案、全双工批处理推理流水线及双语语音问答数据集。
AI 根据报道生成 · 3 小时前更新
最新进展10月5日 12:00
研究团队发布全双工语音决策框架DuplexJev,并开源模型权重、流水线及数据集。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv 人工智能无需解码的批量语音决策:单 token 监督让冻结 LLM 听懂超越文本的语音信息
DuplexJev 通过连接器将 ASR 编码器隐状态输入冻结的 LLM,直接读取选项的单 token 分布完成无解码语音决策。在 8-GPU 节点上,该系统可在约 0.1 s 内完成 8 段语音的 80 项决策,语音问答准确率达 90%,说话人性别和情绪识别准确率均达 90%。团队已开源模型权重、训练方案、全双工批处理推理流水线及双语语音问答数据集。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。