基于Transformer的OpenXR实时手势识别系统
该研究针对人机交互、虚拟现实及机器人等应用场景,提出了一种基于Transformer架构的实时手势识别系统。研究团队利用Unity中通过OpenXR标准捕获的手部追踪数据,结合手部关节位置与手腕旋转角度信息进行模型训练。依托Transformer出色的序列建模能力,该系统能够有效捕捉短手势中的时序依赖关系,从而实现高精度的实时手势识别与交互。
该研究针对人机交互、虚拟现实及机器人等应用场景,提出了一种基于Transformer架构的实时手势识别系统。研究团队利用Unity中通过OpenXR标准捕获的手部追踪数据,结合手部关节位置与手腕旋转角度信息进行模型训练。依托Transformer出色的序列建模能力,该系统能够有效捕捉短手势中的时序依赖关系,从而实现高精度的实时手势识别与交互。
该研究探讨了计算机辅助检测(CADe)系统在结肠镜检查中产生的假阳性提示对内窥镜医生注意力的分散效应。研究结合回顾性配对视频实验与前瞻性实时眼动追踪,分析了3名资深及2名初级医生观看60段视频的表现,并记录了9名资深医生在42例实时辅助检查中的视线变化,量化了假阳性提示对注视吸引和注意力占用的具体影响。由于摘要截断,更细致的结果未完整展示。
该研究旨在为动态模拟世界中人类与多智能体的交互提供设计原则和软件架构。结合通用人工智能(AGI)发展、Transformer对话智能体的普及以及计算能力的提升,文章梳理了过往与当前的多智能体心智理论,重点关注具备社会与情感认知能力的智能体,探讨智能体之间及其与人类互动的综合设计方法,以增强多智能体系统的交互理解与协同模拟能力。
该研究针对虚拟助手的人机交互场景,提出了一种新型语音唤醒系统。该方案将传统的直接关键词检测扩展为上下文触发检测,在初始唤醒词激活后,系统利用推理能力区分实际用户指令与无关语音,从而确保高效且具备上下文感知的交互。为支撑训练,研究团队设计了一套数据生成架构,成功合成了包含直接调用、上下文跟进等场景的62.3小时可控多说话人对话语料库。
为解决长期人机交互中数字存在的身份连续性与个性化发展问题,研究人员提出了基于心理学理论的操作系统 Emergi-PersonaOS。该系统旨在对人格化智能体全生命周期进行管理,通过构建涵盖倾向性特质、情境适应特征和叙事认同的三层架构,实现智能体在动态情境下的自适应与可控演化,为人机共生交互提供了新型计算架构支撑。