跳到正文
9月30日 · 周三

#多模态

今天9月30日周三
  1. Claude 官方博客(网页)86

    Anthropic 发布 Claude Fable 5.1 大模型

    Anthropic 正式发布 Claude Fable 5.1 大语言模型,主打长周期、异步及跨应用的复杂编码与深度知识工作。模型 API 定价为输入每百万 token 10 美元、输出每百万 token 50 美元,缓存读取费用降至每百万 token 0.25 美元,已面向订阅用户及主要云平台开放。

    推荐理由:原文详细说明了新模型的定价变化、降本幅度与安全路由机制,有助于评估复杂长周期任务的迁移成本。

  2. vLLM 官方博客(网页)72

    vLLM-Omni 推出分布式分层卸载技术,支持超显存容量 DiT 模型高效推理

    vLLM-Omni 推出分布式分层卸载(DLO)技术,通过 Meta 设备与 mmap 加载、权重切分重构、双缓冲预取以及数据并行多并发,使单卡显存不足的超大视频生成模型可在多卡 GPU 或 NPU 上高效运行。

    推荐理由:vLLM-Omni 结合 mmap 与多流 AllGather 卸载降低显存与内存峰值,为大参数量扩散模型的低成本分布式推理提供了落地路径。

  3. vLLM 官方博客(网页)61

    VeRL-Omni v0.2.0 发布:加速扩散模型强化学习与全模态训练

    VeRL-Omni 正式发布 v0.2.0 版本,重点提升扩散模型与全模态强化学习的训练吞吐与系统稳定性。

    推荐理由:该版本通过请求级批处理和标准化适配器,解决了扩散模型与全模态大模型强化学习中高延迟和架构耦合的问题。

  4. vLLM 官方博客(网页)75

    vLLM-Omni 支持 MiniMax H3 系统级优化与 FastH3 实时推理

    vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。

    推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。

  5. vLLM 官方博客(网页)64

    vLLM 集成 PyNvVideoCodec 硬件视频解码以提升多 GPU 视频处理吞吐

    vLLM 宣布集成 PyNvVideoCodec 以支持 NVIDIA GPU 硬件视频解码(NVDEC),将视频解码工作负载从 CPU 转移至专用硬件。该方案消除了多 GPU 节点运行视觉语言模型时 CPU 易满载的瓶颈,在 8×H100 配置下使视频描述任务的吞吐量达到 CPU 解码方案的两倍以上。

    推荐理由:通过将视频解码从 CPU 卸载至 GPU 硬件解码器,解决了多卡视觉模型推理中的预处理瓶颈并给出了部署配置参考。

  6. AITNT · AI头条(网页)79

    可灵AI发布 Kling 4.0 及 Flash 版视频生成模型

    可灵AI宣布最新一代旗舰视频生成模型 Kling 4.0 开启内测并计划于10月上线,同时推出轻量版 Kling 4.0 Flash。Kling 4.0 单次原生生成时长达到30秒,结合续拍最长可达2分钟,支持最多10张关键帧与15个参考素材输入,并新增双通道立体声、21:9超宽画幅与10-bit HDR高规格输出。

    推荐理由:新版本将原生生成时长提升至30秒并支持10张关键帧控制,反映出视频生成正从短片段生成转向长镜头与专业叙事流程。

  7. AITNT · AI头条(网页)89

    AMD 宣布以约 82 亿美元全股票收购李飞飞空间智能初创公司 World Labs

    AMD 正式宣布与李飞飞创立的初创公司 World Labs 签署协议,将以全股票方式出资约 82 亿美元(约合 550 亿元人民币)进行收购,交易预计在 2026 年底前完成。

    推荐理由:AMD 通过收购将前沿空间智能研究绑定自身芯片体系,旨在为物理 AI 与机器人工作负载的软硬件协同提前布局。

9月29日周二
  1. Microsoft Research67

    Microsoft Research 发布生物学 AI 研究系统 Quine

    Microsoft Research 推出生物学 AI 研究系统 Quine,由多模态生物学世界模型以及连接科研工具、文献与湿实验的交互框架组成。系统联合学习基因组、蛋白质、细胞状态及生物成像等跨尺度数据,以预测干预后的生物状态演变;在与 Broad Institute 合作的胰腺癌研究中,Quine 快速完成化合物筛选并在湿实验中验证了候选分子。

    推荐理由:原文展示了生物学世界模型与湿实验结合的闭环流程,读者可据此了解 AI 辅助跨模态生物学推理与药物筛选的具体范式。

  2. 爱范儿 · AI 筛选73

    神秘 AI 模型 Space Bunny 实测:支持草图生成 3D 网页与 Agent 编程,分词特征指向 MiniMax

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 上线,凭借快速响应、草图生成可交互 3D 网页及 Agent 编程能力引发大量调用。实测显示其能直接理解粗糙草图并生成包含动效的前端页面,但在精细视觉质感上与旗舰模型仍有差距。分词特征与代码线索分析显示,该模型可能来自 MiniMax 家族。

    推荐理由:实测展现了该模型将简单草图快速转化为可交互 3D 网页的能力,读者可据此了解轻量级 Agent 编程的适用边界。

  3. 量子位89

    AMD 拟以 82 亿美元全股票收购李飞飞创立的空间智能公司 World Labs

    AMD 宣布签署协议,将以 82 亿美元全股票收购李飞飞创办的空间智能公司 World Labs,交易预计 2026 年底前完成。交易交割后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报,联合创始人 Justin Johnson 和 Ben Mildenhall 则带领团队并入 AMD 组建前沿 AI 研究组织。

    推荐理由:芯片巨头通过并购前沿空间模型团队切入物理世界模拟与具身智能负载,反映出底层硬件与三维生成架构深度绑定的趋势。

9月25日周五
  1. Google Research64

    Google 提出 AI 视频联合导演框架,推进长时长连贯视频生成

    Google Research 推出一套面向长时长叙事视频的多智能体框架体系,涵盖 Co-Director、CANVAS、A²RD 和 VQQA 四项核心研究,旨在解决视频扩散模型在多镜头场景中的语义漂移和级联错误。

    推荐理由:Google 将长视频生成解构为多智能体编排与世界状态追踪,提供了解决多镜头叙事中角色与场景漂移的成套系统方案。

  2. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时对话能力与低延迟流式视频生成结合,赋予对话 AI 具备自然口型与表情的动态视觉形象。

    推荐理由:原文介绍了原生实时对话结合流式数字人形象的能力与技术细节,读者可以据此了解多模态交互在企业场景中的最新落地形式。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。

    推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。

9月22日周二
  1. 腾讯混元 公众号68

    混元图像 3.5 预览版发布,腾讯推出高性价比专业级生图模型

    腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。

    推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。

    推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。

9月15日周二
  1. 阶跃 StepFun 公众号73

    阶跃星辰发布 StepAudio 3 系列语音大模型

    阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。

    推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。

9月10日周四
  1. DeepSeek 公众号89

    DeepSeek 正式发布 V4.1 Flash 原生多模态模型并开源

    深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。

    推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。

8月26日周三
  1. 智谱 公众号85

    智谱开源原生多模态模型 GLM-5.3-Flash

    智谱正式上线并开源 GLM-5 系列原生多模态模型 GLM-5.3-Flash(320B-A18B),在综合智能指数与编程评测中取得与 Claude Opus 4.8 相当的表现。

    推荐理由:该模型在综合评测中追平海外顶级旗舰,并通过混合注意力架构与国产芯片部署大幅压低了调用成本。

8月21日周五
  1. DeepSeek 公众号84

    DeepSeek 上线 DeepSeek-V4-Flash-Vision-Exp 并开启多模态 API 服务

    DeepSeek 实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台,支持图文混合输入与各类 Agent 框架集成。

    推荐理由:原文给出了纯文本与多模态基准对比以及按 token 计费规则,开发者可以据此评估多模态智能体任务的接入成本。

7月20日周一
  1. 通义实验室 公众号73

    通义实验室发布 Qwen-Audio-3.0-TTS 语音合成模型

    通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。

    推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。