跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 41–60 条 · 共 73 条
8月28日周五
8月27日周四
8月26日周三
  1. 智谱 公众号85

    智谱开源原生多模态模型 GLM-5.3-Flash

    智谱正式上线并开源 GLM-5 系列原生多模态模型 GLM-5.3-Flash(320B-A18B),在综合智能指数与编程评测中取得与 Claude Opus 4.8 相当的表现。

    推荐理由:该模型在综合评测中追平海外顶级旗舰,并通过混合注意力架构与国产芯片部署大幅压低了调用成本。

8月21日周五
8月18日周二
8月12日周三
  1. Google DeepMind73

    Google DeepMind 推出手语转文本模型 SL2T

    Google DeepMind 推出多语种手语转文本模型 SL2T,并首次落地 Pixel 11 的 Gboard 输入法与 Live Transcribe,首发支持美国手语(ASL)转英语听写。

    推荐理由:该模型跳过传统手语标注直接将姿态骨骼坐标映射为文本,并落地手机输入法,展现了端云协同下多模态交互落地的具体路径。

8月10日周一
  1. Hugging Face84

    Meta 开源多模态模型 Muse Glimmer 30B 并上线 Hugging Face

    Meta 发布多模态模型 Muse Glimmer 并采用 Apache 2.0 协议开源,该模型参数量为 30B,包含 2B 视觉编码器与 28B 文本解码器,专为本地 Agent、隐私计算、编码和文档分析设计。

    推荐理由:Meta 开源 30B 本地端多模态智能体模型并采用 Apache 2.0 协议,为开发者提供了兼顾隐私与本地部署的工具调用与编码模型选择。

7月30日周四
  1. Google DeepMind81

    Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,支持连续视频理解与多机协同

    Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。

    推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。

  2. Google DeepMind64

    Google DeepMind 推出音乐生成模型 Lyria 3.5 并在 Google Flow Music 上线

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并正式在 Google Flow Music 中上线。新模型在旋律结构复杂度与自然度、歌词质量与结构感知、以及人声发音和情感表现力上均有提升。同时,它增强了创作控制能力,方便用户调整生成音频的节奏和时长。

    推荐理由:原文列举了旋律、歌词、人声表现力与节奏时长控制等维度的升级,读者可以据此评估 AI 音乐生成的可用性变化。

7月27日周一
  1. 月之暗面 Kimi 公众号90

    月之暗面发布 Kimi K3 模型权重与技术报告并开源三项训练 Infra 技术

    月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。

    推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。

  2. 月之暗面 Kimi 公众号88

    月之暗面发布 Kimi K3:开放 2.8 万亿参数 MoE 模型权重、技术报告与训练 Infra

    月之暗面在 Kimi K3 开放日正式发布 Kimi K3 模型权重、技术报告,并开源支撑模型训练的关键 Infra 技术。Kimi K3 是拥有 2.8 万亿参数的 MoE 模型,具备原生视觉理解能力与 100 万 token 上下文窗口,支持自由下载部署。本次配套开源了专家并行通信库 MoonEP、高性能算子 FlashKDA 以及用于分布式强化学习的 AgentEnv 沙箱系统。

    推荐理由:月之暗面同步开放了万亿参数混合专家模型权重、技术报告及训练基础设施,有助于开发者了解其超长上下文与细粒度通信优化方案。

7月20日周一
  1. 通义实验室 公众号73

    通义实验室发布 Qwen-Audio-3.0-TTS 语音合成模型

    通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。

    推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。

7月17日周五
  1. 通义实验室 公众号79

    通义实验室发布实时多模态交互模型 Wan-Streamer v0.2

    通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。

    推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。

7月15日周三
7月12日周日
  1. 阶跃 StepFun 公众号66

    阶跃星辰发布 Step Edge 端侧模型家族

    阶跃星辰发布面向手机与汽车等终端场景的 Step Edge 端侧模型家族,涵盖基础模型、Audio、GUI 及 Gen 四类模型。该系列支持低至 0.1 秒的本地 toolcall 执行与全模态隐私保护,并在 29 项核心评测指标中取得领先;官方同时推出了配套的 Step Inference NPU 自研推理引擎以优化终端延迟。

    推荐理由:阶跃星辰面向手机和汽车等场景推出端侧模型家族并配套自研推理引擎,展示了端云协同与本地执行的技术路径。

7月9日周四
  1. Google Research71

    Google 发布 SensorFM:基于万亿分钟可穿戴健康数据的传感器基础模型

    Google Research 推出面向可穿戴健康数据的大型传感器基础模型 SensorFM,基于 500 万受试者超过 1 万亿分钟的多模态无标注传感器数据进行自监督预训练。

    推荐理由:原文展示了利用海量无标注传感器数据预训练基础模型的方法,读者可据此参考时序健康信号的通用表征构建方式。

7月6日周一
  1. Hugging Face63

    Photoroom 详解文生图模型 PRX 数据工程策略:从 VLM 重打标到流式训练

    Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。

    推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。

7月1日周三