跳到正文
热点事件持续更新

全双工语音决策框架DuplexJev发布并开源

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,研究团队在arXiv发布全双工语音决策框架DuplexJev。该框架通过连接器将ASR编码器隐状态直接输入冻结的LLM,读取选项的单token分布完成无解码语音决策。测试显示,在8-GPU节点上,该系统可在约0.1秒内完成8段语音的80项决策;其语音问答准确率达90%,说话人性别和情绪识别准确率均达90%。目前,团队已开源模型权重、训练方案、全双工批处理推理流水线及双语语音问答数据集。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv 人工智能
    无需解码的批量语音决策:单 token 监督让冻结 LLM 听懂超越文本的语音信息

    DuplexJev 通过连接器将 ASR 编码器隐状态输入冻结的 LLM,直接读取选项的单 token 分布完成无解码语音决策。在 8-GPU 节点上,该系统可在约 0.1 s 内完成 8 段语音的 80 项决策,语音问答准确率达 90%,说话人性别和情绪识别准确率均达 90%。团队已开源模型权重、训练方案、全双工批处理推理流水线及双语语音问答数据集。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。