月之暗面发布 Kimi K3 模型权重与技术报告并开源三项训练 Infra 技术
月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。
推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。
月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。
推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。
月之暗面在 Kimi K3 开放日正式发布 Kimi K3 模型权重、技术报告,并开源支撑模型训练的关键 Infra 技术。Kimi K3 是拥有 2.8 万亿参数的 MoE 模型,具备原生视觉理解能力与 100 万 token 上下文窗口,支持自由下载部署。本次配套开源了专家并行通信库 MoonEP、高性能算子 FlashKDA 以及用于分布式强化学习的 AgentEnv 沙箱系统。
推荐理由:月之暗面同步开放了万亿参数混合专家模型权重、技术报告及训练基础设施,有助于开发者了解其超长上下文与细粒度通信优化方案。
通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。
推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。
通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。
推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。
DharmaOCR 在巴西葡萄牙语基准测试中取得 0.925 分,显著领先更新的 Mistral OCR4(0.798 分)和 Unlimited-OCR(0.7587 分)。该模型通过监督微调将全部参数容量集中于目标语言结构,并引入直接偏好优化(DPO)抑制重复与不连贯输出。测试结果表明,垂直领域专精训练在复杂文档抽取质量和推理稳定性上明显优于多语言通用模型。
MIT 等机构的研究人员开发了数据增强系统 GIFT(Geometric Inference Feedback Tuning),可训练视觉语言模型(VLM)将 2D 设计图像自动转换为可执行的 3D CAD 程序。
阶跃星辰公布 WAIC 2026 参展亮点,将集中展示覆盖云端与端侧的 Step 系列模型矩阵,以及智能体原生操作系统 Step AOS。获评 WAIC“镇馆之宝”的智能体手机 STEPX Neo 将首次线下公开亮相,汽车智能体也已搭载于极氪8X。此外,现场还将携手原力灵机发起 6 台机器人连续协作 15 小时拼装 8 万余块积木长城的极限挑战。
通义实验室将语音交互模型 Fun-Realtime-AudioChat 正式升级更名为 Qwen-Audio-3.0-Realtime 并上线阿里云百炼,提供 plus 和 flash 两个版本。
推荐理由:升级通过多模态双工与多教师蒸馏兼顾了低延迟抗噪和复杂工具调用,适合语音交互开发者参考。
Thinking Machines Lab 推出原生全模态开源模型 Inkling 及轻量版 Inkling-Small,现已上线 Hugging Face 并提供首日生态支持。
推荐理由:该模型采用 MoE 与原生多模态统一输入架构,为大参数量跨模态推理与量化部署提供了完整的开源落地参考。
阶跃星辰发布面向手机与汽车等终端场景的 Step Edge 端侧模型家族,涵盖基础模型、Audio、GUI 及 Gen 四类模型。该系列支持低至 0.1 秒的本地 toolcall 执行与全模态隐私保护,并在 29 项核心评测指标中取得领先;官方同时推出了配套的 Step Inference NPU 自研推理引擎以优化终端延迟。
推荐理由:阶跃星辰面向手机和汽车等场景推出端侧模型家族并配套自研推理引擎,展示了端云协同与本地执行的技术路径。
Google Research 推出面向可穿戴健康数据的大型传感器基础模型 SensorFM,基于 500 万受试者超过 1 万亿分钟的多模态无标注传感器数据进行自监督预训练。
推荐理由:原文展示了利用海量无标注传感器数据预训练基础模型的方法,读者可据此参考时序健康信号的通用表征构建方式。
Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。
推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。
Google DeepMind 宣布面向开发者推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash。
推荐理由:文章给出了两款模型的具体定价与核心延迟指标,方便开发者评估多模态生成管线的吞吐与成本。
通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。
推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。
Google 联合斯坦福等机构发表研究,评估多模态 AI 工具在辅助普通用户理解皮肤病症及后续决策时的效果。在覆盖 2,345 名受试者的对照实验中,AI 辅助使病症名称的识别准确率从常规搜索的 8% 提升至 23%,但在指导用户判断是否紧急就医等下一步决策上并无显著改善。真实社区临床测试显示,图文对照匹配能成为辅助医患沟通的参考工具,但仍需更具体的行动建议来防止用户低估病情紧急度。
通义实验室发布基于 MNN 推理引擎适配 Arm SME2 指令集的端侧大模型部署教程,提供了 Qwen3-VL-4B-Instruct 在 Android 旗舰手机上的完整落地流程。
推荐理由:文章给出了从 MNN 编译到 APK 构建的完整端侧落地流程,读者可据此复现 SME2 指令集对视觉语言模型的加速效果。
Google DeepMind 正式发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时端到端流式语音互译,并在生成翻译时保留原说话人的语调、节奏和音高。
推荐理由:模型突破了传统轮流对话式翻译的延迟限制,通过流式生成保留说话人语调与节奏,为实时跨语言沟通提供了新方案。
Google DeepMind 推出统一且无独立编码器的多模态模型 Gemma 4 12B,支持原生音频与视觉输入,采用 Apache 2.0 协议开源。该模型移除了传统的图像和音频编码器,直接将多模态信号投影至 LLM 主干,性能接近 26B MoE 模型而内存占用减少超过一半,仅需 16GB 显存或统一内存即可在笔记本电脑本地运行。
推荐理由:模型移除了传统独立的模态编码器并直接接入语言主干,展示了在消费级硬件上兼顾原生音画输入与推理效率的轻量化方案。
Google DeepMind 宣布在实验性原型 Project Genie 中接入 Google 街景图像能力,允许用户基于真实地理位置生成可交互的虚拟世界。
推荐理由:结合街景图像生成可交互世界,为 AI 智能体与机器人导航提供了锚定真实地理数据的虚拟仿真环境。
Google DeepMind 正式推出 Gemini Omni 系列模型及首款模型 Gemini Omni Flash,支持将图像、音频、视频和文本任意组合输入并生成高质量视频。
推荐理由:原文介绍了支持任意模态输入并能对话式编辑视频的新模型,读者可以了解多模态生成与推理能力结合的最新落地进展。
Google 宣布全面扩展内容透明度与验证工具,在 Search、Gemini、Chrome、Pixel 及 Google Cloud 中深入集成 SynthID 水印与 C2PA 溯源技术。
推荐理由:原文给出了从端侧拍摄到多平台搜索验证的技术落地细节,读者可以了解主流平台如何统一推进生成式内容溯源与真伪识别。
Google DeepMind 正式推出 Gemini 3.5 系列并首发上线 Gemini 3.5 Flash,重点强化复杂长程智能体与编程工作流能力。该模型在 Terminal-Bench 2.1(76.2%)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度达到其他前沿模型的 4 倍。
推荐理由:原文给出了模型在智能体与编程基准上的性能表现及吞吐速度对比,读者可以据此评估其作为生产环境主力模型的调用效率与成本。
Google DeepMind 宣布推出 AI co-clinician 医疗 AI 研究倡议,探索在医生监督下让多模态 AI 智能体协同参与患者诊疗的“三方医疗”模式。
推荐理由:研究展示了结合实时音视频的多模态医疗智能体架构,为评估 AI 辅助问诊与临床安全边界提供了详细测试数据。
Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。
推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。
Google DeepMind 推出由 Gemini 驱动的 AI 指针交互方案与实验 Demo,使用户无需切换窗口或编写复杂提示词,直接通过指向屏幕内容并配合简短语音即可完成操作。
推荐理由:原文阐述了结合视觉上下文与多模态理解的指针交互设计,读者可据此了解系统如何将传统指针操作升级为无缝的 AI 上下文触发入口。
Google Research 在 The Check Up 活动上展示了多项医疗健康 AI 进展,涵盖个人健康智能体、临床诊断辅助以及开源生态建设。研究表明个人健康智能体能结合多模态数据提供长期健康指导,AI 乳腺癌筛查系统可识别 25% 既往遗漏的间期癌症,多智能体系统 AMIE 正开展临床测试。
Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。
推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。
AWS 介绍了基于其云服务与 LiDAR 3D 点云构建端到端可扩展视觉智能流水线的实践方案。方案通过 AWS DataSync 和 Amazon S3 实现现场到云端的高效数据传输,并利用 OpenDroneMap(ODM)自动化提取数字表面模型(DSM)与数字地形模型(DTM)。整套工作流支持 GB 至 PB 级数据量的弹性伸缩与交付。
Adobe SDC 团队采用 AWS Batch 配合 GPU EC2 实例构建了大规模分布式 AI 推理架构,将 Adobe Stock 图像 embedding 计算时间从 30 天缩短至 20 小时内,综合成本降低超过 95%。
Sebastian Raschka 发布了 2025 年 7 月至 12 月的 LLM 精选研究论文清单。该清单涵盖推理模型训练与推理策略、强化学习、推理时扩展(Inference-Time Scaling)、模型架构、高效训练、扩散语言模型及多模态等分类。作者同时发布了年度回顾文章《State of LLMs 2025: Progress, Problems, and Predictions》。
AWS 介绍了在云端部署 NVIDIA Cosmos 世界基础模型(WFMs)的两种生产就绪架构,用于为自动驾驶、机器人和智能工厂等物理 AI 大规模生成合成训练数据。
SemiAnalysis 发布机器人五级自主性分类体系(Robotics Levels of Autonomy),从自主规划(Agency)与灵巧度(Dexterity)两个维度将机器人划分为 Level 0 至 Level 4 五个阶段。
推荐理由:原文基于自主规划与操作灵巧度两项维度划分出五级机器人自主性框架,读者可借此建立对通用机器人商业化落地节奏的系统认知。