香港大学提出SceneMosaic:单图快速生成可仿真多样化3D场景
香港大学戴勃团队推出 3D 场景生成方法 SceneMosaic。该方法采用混合智能体布局演化机制,仅凭单张图像即可快速构建符合物理规律且具备多样化布局的仿真就绪 3D 室内场景。相较于现有的 SceneSmith,SceneMosaic 将生成速度提升了 24 倍,生成单个场景变体仅需约 0.03 小时,显著降低了具身智能高保真仿真环境的构建门槛与耗时。
香港大学戴勃团队推出 3D 场景生成方法 SceneMosaic。该方法采用混合智能体布局演化机制,仅凭单张图像即可快速构建符合物理规律且具备多样化布局的仿真就绪 3D 室内场景。相较于现有的 SceneSmith,SceneMosaic 将生成速度提升了 24 倍,生成单个场景变体仅需约 0.03 小时,显著降低了具身智能高保真仿真环境的构建门槛与耗时。
上海人工智能实验室正式开源多模态决策模型Intern-Decision,提供0.8B、2B和4B三个尺寸版本。该模型采用自回归式掩码语言任务框架,相比基准模型Jev推理速度提升2至3倍,并拿下多模态决策SOTA。模型重点提升了将视觉感知理解转化为结构化动作决策的能力,适用于游戏AI决策、图形验证码识别及GUI网页自动化操作等应用场景。
华为诺亚方舟实验室、华为云天筹AI求解器团队与华中科技大学John Hopcroft计算中心组成的联合团队,依托华为云天筹决策智能引擎和LLM4AD_Next算法设计平台,在国际SAT竞赛并行AI赛道SAT组夺得冠军。该成果展示了大模型在自动化算法设计与复杂组合优化求解领域的落地潜力。
Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。
一项针对DeepSeek-V4-Flash模型中mHC(多流残差)结构的机制分析显示,原本设计的四条残差流在实际读写权重中主要集中于其中约两条流。此外,在第22至42层等深层网络中,残差混合矩阵已退化并接近单位矩阵。该观察表明,模型在充分训练后对动态多流混合机制的实际依赖程度较为有限,部分残差通道可能存在冗余或功能退化。
中国科学院大学研究团队在《数据科学年鉴》发表论文,提出了“智能体能力周期表”。该研究将智能体抽象为控制、生成、记忆、输入、输出五大核心能力,每种能力细分为三个层级,构建出包含243种构型的系统化分类体系。研究指出,人类与细菌同处122号构型,当前最强的大模型智能体仅在控制维度上低一个层级(位列41号),并基于该体系对经典物理、相对论与量子力学中的观察者角色差异进行了全新阐释。
该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。
科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。
该文梳理了梁文锋在学术论文中的署名脉络。过去三年中,梁文锋极少作为第一作者或通讯作者出现在动辄上百人署名的旗舰模型整体报告中,而是将研究精力与署名重点投向最底层的原子技术,包括MLA注意力机制、MoE路由机制、mHC拓扑流形、DSpark推理算子以及DSec智能体沙盒等关键底层技术论文,展现了其对AI基础架构研发的深耕。
GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。
近期后训练已成为大模型领域备受瞩目的核心议题。有企业推出低门槛的后训练服务,旨在通过两周一次的高频迭代节奏以及1000美元起的亲民价格,推动后训练技术向更广泛的开发者普及,实现“人人可用”。由于当前所获素材信息较为有限,关于该公司的具体技术路线、优化机制以及完整商业服务形态等细节,仍有待进一步披露。
在外滩大会上,北京大学关于“长程任务学习”的合作研究引发关注,探讨AI从单次问答迈向长周期复杂任务时,模型如何通过持续交互实现进化积累。沐晨科技作为合作方参与其中,依托训练数据与科研验证能力,押注并构建面向复杂交互场景的AI新型基础设施,助力前沿模型演进。
该内容围绕相关前沿学术动态展开复盘,探讨从三维视觉向世界模型演进的技术主线。文章指出,当前人工智能的发展正从单纯理解平面画面的感知阶段,迈向能够理解三维空间、预测环境动态变化并执行动作的认知与行动阶段,空间智能因而成为 AI 融入物理世界的关键枢纽。由于现有素材信息较为精炼,更多会议复盘的具体模型细节与前沿论文分析仍有待进一步展开。