跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 61–74 条 · 共 74 条
7月1日周三
6月16日周二
  1. 通义实验室 公众号78

    通义实验室发布具身智能基础模型套件 Qwen-Robot

    通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。

    推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。

6月11日周四
  1. 通义实验室 公众号66

    通义实验室详解 MNN 适配 Arm SME2:Qwen3-VL-4B 端侧 Prefill 提速 81%

    通义实验室发布基于 MNN 推理引擎适配 Arm SME2 指令集的端侧大模型部署教程,提供了 Qwen3-VL-4B-Instruct 在 Android 旗舰手机上的完整落地流程。

    推荐理由:文章给出了从 MNN 编译到 APK 构建的完整端侧落地流程,读者可据此复现 SME2 指令集对视觉语言模型的加速效果。

6月9日周二
  1. Google DeepMind83

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate 支持 70 多种语言近实时语音互译

    Google DeepMind 正式发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时端到端流式语音互译,并在生成翻译时保留原说话人的语调、节奏和音高。

    推荐理由:模型突破了传统轮流对话式翻译的延迟限制,通过流式生成保留说话人语调与节奏,为实时跨语言沟通提供了新方案。

  2. Google DeepMind83

    Google DeepMind 推出统一无编码器多模态模型 Gemma 4 12B

    Google DeepMind 推出统一且无独立编码器的多模态模型 Gemma 4 12B,支持原生音频与视觉输入,采用 Apache 2.0 协议开源。该模型移除了传统的图像和音频编码器,直接将多模态信号投影至 LLM 主干,性能接近 26B MoE 模型而内存占用减少超过一半,仅需 16GB 显存或统一内存即可在笔记本电脑本地运行。

    推荐理由:模型移除了传统独立的模态编码器并直接接入语言主干,展示了在消费级硬件上兼顾原生音画输入与推理效率的轻量化方案。

5月18日周一
  1. Google DeepMind88

    Google DeepMind 发布 Gemini Omni 与 Gemini Omni Flash 视频生成模型

    Google DeepMind 正式推出 Gemini Omni 系列模型及首款模型 Gemini Omni Flash,支持将图像、音频、视频和文本任意组合输入并生成高质量视频。

    推荐理由:原文介绍了支持任意模态输入并能对话式编辑视频的新模型,读者可以了解多模态生成与推理能力结合的最新落地进展。

5月17日周日
  1. Google DeepMind65

    Google 扩展内容透明度与溯源工具,覆盖 Search、Gemini、Pixel 及云端 API

    Google 宣布全面扩展内容透明度与验证工具,在 Search、Gemini、Chrome、Pixel 及 Google Cloud 中深入集成 SynthID 水印与 C2PA 溯源技术。

    推荐理由:原文给出了从端侧拍摄到多平台搜索验证的技术落地细节,读者可以了解主流平台如何统一推进生成式内容溯源与真伪识别。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash:主打智能体与编程能力,输出速度提升 4 倍

    Google DeepMind 正式推出 Gemini 3.5 系列并首发上线 Gemini 3.5 Flash,重点强化复杂长程智能体与编程工作流能力。该模型在 Terminal-Bench 2.1(76.2%)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度达到其他前沿模型的 4 倍。

    推荐理由:原文给出了模型在智能体与编程基准上的性能表现及吞吐速度对比,读者可以据此评估其作为生产环境主力模型的调用效率与成本。

4月30日周四
4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布开源模型 Gemma 4:覆盖端侧与桌面规模并采用 Apache 2.0 协议

    Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。

    推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。

3月29日周日
  1. Google DeepMind68

    Google DeepMind 探索 AI 时代鼠标指针交互:结合 Gemini 实现即指即问

    Google DeepMind 推出由 Gemini 驱动的 AI 指针交互方案与实验 Demo,使用户无需切换窗口或编写复杂提示词,直接通过指向屏幕内容并配合简短语音即可完成操作。

    推荐理由:原文阐述了结合视觉上下文与多模态理解的指针交互设计,读者可据此了解系统如何将传统指针操作升级为无缝的 AI 上下文触发入口。

2月25日周三
  1. Sebastian Raschka73

    2026 年初开源大模型架构横向对比:从注意力混合机制到长上下文推理优化

    Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。

    推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。

7月31日周四
  1. SemiAnalysis · 算力产业68

    SemiAnalysis 提出机器人五级自主性分级框架

    SemiAnalysis 发布机器人五级自主性分类体系(Robotics Levels of Autonomy),从自主规划(Agency)与灵巧度(Dexterity)两个维度将机器人划分为 Level 0 至 Level 4 五个阶段。

    推荐理由:原文基于自主规划与操作灵巧度两项维度划分出五级机器人自主性框架,读者可借此建立对通用机器人商业化落地节奏的系统认知。