Google DeepMind 发布 Gemini Omni 1.1 Flash 视频生成模型
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供更具控制力的视频生成套件并正式接入 Google AI Studio 的 Gemini API。
推荐理由:材料详述了场景延展、首尾关键帧过渡与视频参考等控制特性,开发者可据此评估其在视频工作流中的落地可行性。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供更具控制力的视频生成套件并正式接入 Google AI Studio 的 Gemini API。
推荐理由:材料详述了场景延展、首尾关键帧过渡与视频参考等控制特性,开发者可据此评估其在视频工作流中的落地可行性。
NVIDIA Developer Blog 介绍了在 NVIDIA GB300 NVL72 上运行阿里 Qwen3.8-Flash-Next 进行智能体编码的实践。
推荐理由:文章解析了在 GB300 NVL72 上运行 Qwen4 预览版模型的架构参数与长上下文特性,为开发者构建智能体编码工作流提供了参考。
智谱正式上线并开源 GLM-5 系列原生多模态模型 GLM-5.3-Flash(320B-A18B),在综合智能指数与编程评测中取得与 Claude Opus 4.8 相当的表现。
推荐理由:该模型在综合评测中追平海外顶级旗舰,并通过混合注意力架构与国产芯片部署大幅压低了调用成本。
DeepSeek 实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台,支持图文混合输入与各类 Agent 框架集成。
推荐理由:原文给出了纯文本与多模态基准对比以及按 token 计费规则,开发者可以据此评估多模态智能体任务的接入成本。
Sentence Transformers 在 v6.0 更新中引入 MultiVectorEncoder,原生支持 ColBERT 风格的延迟交互(Late Interaction)检索模型。
推荐理由:库更新统一了 ColBERT 与 ColPali 等延迟交互模型的接口,读者可据此在 RAG 中低成本接入多向量检索。
Google DeepMind 推出多语种手语转文本模型 SL2T,并首次落地 Pixel 11 的 Gboard 输入法与 Live Transcribe,首发支持美国手语(ASL)转英语听写。
推荐理由:该模型跳过传统手语标注直接将姿态骨骼坐标映射为文本,并落地手机输入法,展现了端云协同下多模态交互落地的具体路径。
Google Research 与 Google DeepMind 推出基于 Gemini 和 Project Astra 的医疗 AI 系统 AMIE (Video),实现了专家级实时音视频临床问诊。
推荐理由:研究通过解耦对话、规划与感知的异步多智能体架构,首次实现了音视频多模态下的实时医疗问诊与查体引导。
Meta 发布多模态模型 Muse Glimmer 并采用 Apache 2.0 协议开源,该模型参数量为 30B,包含 2B 视觉编码器与 28B 文本解码器,专为本地 Agent、隐私计算、编码和文档分析设计。
推荐理由:Meta 开源 30B 本地端多模态智能体模型并采用 Apache 2.0 协议,为开发者提供了兼顾隐私与本地部署的工具调用与编码模型选择。
Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。
推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并正式在 Google Flow Music 中上线。新模型在旋律结构复杂度与自然度、歌词质量与结构感知、以及人声发音和情感表现力上均有提升。同时,它增强了创作控制能力,方便用户调整生成音频的节奏和时长。
推荐理由:原文列举了旋律、歌词、人声表现力与节奏时长控制等维度的升级,读者可以据此评估 AI 音乐生成的可用性变化。
月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。
推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。
月之暗面在 Kimi K3 开放日正式发布 Kimi K3 模型权重、技术报告,并开源支撑模型训练的关键 Infra 技术。Kimi K3 是拥有 2.8 万亿参数的 MoE 模型,具备原生视觉理解能力与 100 万 token 上下文窗口,支持自由下载部署。本次配套开源了专家并行通信库 MoonEP、高性能算子 FlashKDA 以及用于分布式强化学习的 AgentEnv 沙箱系统。
推荐理由:月之暗面同步开放了万亿参数混合专家模型权重、技术报告及训练基础设施,有助于开发者了解其超长上下文与细粒度通信优化方案。
通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。
推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。
通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。
推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。
通义实验室将语音交互模型 Fun-Realtime-AudioChat 正式升级更名为 Qwen-Audio-3.0-Realtime 并上线阿里云百炼,提供 plus 和 flash 两个版本。
推荐理由:升级通过多模态双工与多教师蒸馏兼顾了低延迟抗噪和复杂工具调用,适合语音交互开发者参考。
Thinking Machines Lab 推出原生全模态开源模型 Inkling 及轻量版 Inkling-Small,现已上线 Hugging Face 并提供首日生态支持。
推荐理由:该模型采用 MoE 与原生多模态统一输入架构,为大参数量跨模态推理与量化部署提供了完整的开源落地参考。
阶跃星辰发布面向手机与汽车等终端场景的 Step Edge 端侧模型家族,涵盖基础模型、Audio、GUI 及 Gen 四类模型。该系列支持低至 0.1 秒的本地 toolcall 执行与全模态隐私保护,并在 29 项核心评测指标中取得领先;官方同时推出了配套的 Step Inference NPU 自研推理引擎以优化终端延迟。
推荐理由:阶跃星辰面向手机和汽车等场景推出端侧模型家族并配套自研推理引擎,展示了端云协同与本地执行的技术路径。
Google Research 推出面向可穿戴健康数据的大型传感器基础模型 SensorFM,基于 500 万受试者超过 1 万亿分钟的多模态无标注传感器数据进行自监督预训练。
推荐理由:原文展示了利用海量无标注传感器数据预训练基础模型的方法,读者可据此参考时序健康信号的通用表征构建方式。
Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。
推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。
Google DeepMind 宣布面向开发者推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash。
推荐理由:文章给出了两款模型的具体定价与核心延迟指标,方便开发者评估多模态生成管线的吞吐与成本。