vLLM 官方首发支持 1T 多模态模型 TML Inkling
vLLM 宣布首发支持 Thinking Machines Lab 推出的 1T 参数原生多模态模型 TML Inkling,覆盖 NVFP4 与 BF16 两个版本,原生支持文本、图像与音频输入及最高 1M 上下文。
推荐理由:框架通过短卷积分片与通信融合等算子优化完成了万亿多模态模型适配,为超大模型长上下文推理提供了工程参考。
vLLM 宣布首发支持 Thinking Machines Lab 推出的 1T 参数原生多模态模型 TML Inkling,覆盖 NVFP4 与 BF16 两个版本,原生支持文本、图像与音频输入及最高 1M 上下文。
推荐理由:框架通过短卷积分片与通信融合等算子优化完成了万亿多模态模型适配,为超大模型长上下文推理提供了工程参考。
Anthropic 正式发布 Claude Fable 5.1 大语言模型,主打长周期、异步及跨应用的复杂编码与深度知识工作。模型 API 定价为输入每百万 token 10 美元、输出每百万 token 50 美元,缓存读取费用降至每百万 token 0.25 美元,已面向订阅用户及主要云平台开放。
推荐理由:原文详细说明了新模型的定价变化、降本幅度与安全路由机制,有助于评估复杂长周期任务的迁移成本。
vLLM-Omni 推出分布式分层卸载(DLO)技术,通过 Meta 设备与 mmap 加载、权重切分重构、双缓冲预取以及数据并行多并发,使单卡显存不足的超大视频生成模型可在多卡 GPU 或 NPU 上高效运行。
推荐理由:vLLM-Omni 结合 mmap 与多流 AllGather 卸载降低显存与内存峰值,为大参数量扩散模型的低成本分布式推理提供了落地路径。
VeRL-Omni 正式发布 v0.2.0 版本,重点提升扩散模型与全模态强化学习的训练吞吐与系统稳定性。
推荐理由:该版本通过请求级批处理和标准化适配器,解决了扩散模型与全模态大模型强化学习中高延迟和架构耦合的问题。
vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。
推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。
vLLM 宣布集成 PyNvVideoCodec 以支持 NVIDIA GPU 硬件视频解码(NVDEC),将视频解码工作负载从 CPU 转移至专用硬件。该方案消除了多 GPU 节点运行视觉语言模型时 CPU 易满载的瓶颈,在 8×H100 配置下使视频描述任务的吞吐量达到 CPU 解码方案的两倍以上。
推荐理由:通过将视频解码从 CPU 卸载至 GPU 硬件解码器,解决了多卡视觉模型推理中的预处理瓶颈并给出了部署配置参考。
Microsoft Research 推出生物学 AI 研究系统 Quine,由多模态生物学世界模型以及连接科研工具、文献与湿实验的交互框架组成。系统联合学习基因组、蛋白质、细胞状态及生物成像等跨尺度数据,以预测干预后的生物状态演变;在与 Broad Institute 合作的胰腺癌研究中,Quine 快速完成化合物筛选并在湿实验中验证了候选分子。
推荐理由:原文展示了生物学世界模型与湿实验结合的闭环流程,读者可据此了解 AI 辅助跨模态生物学推理与药物筛选的具体范式。
Google Research 推出一套面向长时长叙事视频的多智能体框架体系,涵盖 Co-Director、CANVAS、A²RD 和 VQQA 四项核心研究,旨在解决视频扩散模型在多镜头场景中的语义漂移和级联错误。
推荐理由:Google 将长视频生成解构为多智能体编排与世界状态追踪,提供了解决多镜头叙事中角色与场景漂移的成套系统方案。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时对话能力与低延迟流式视频生成结合,赋予对话 AI 具备自然口型与表情的动态视觉形象。
推荐理由:原文介绍了原生实时对话结合流式数字人形象的能力与技术细节,读者可以据此了解多模态交互在企业场景中的最新落地形式。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。
推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。
推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。
阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。
推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。
深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。
推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。
智谱正式上线并开源 GLM-5 系列原生多模态模型 GLM-5.3-Flash(320B-A18B),在综合智能指数与编程评测中取得与 Claude Opus 4.8 相当的表现。
推荐理由:该模型在综合评测中追平海外顶级旗舰,并通过混合注意力架构与国产芯片部署大幅压低了调用成本。
DeepSeek 实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台,支持图文混合输入与各类 Agent 框架集成。
推荐理由:原文给出了纯文本与多模态基准对比以及按 token 计费规则,开发者可以据此评估多模态智能体任务的接入成本。
通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。
推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。
通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。
推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。
通义实验室将语音交互模型 Fun-Realtime-AudioChat 正式升级更名为 Qwen-Audio-3.0-Realtime 并上线阿里云百炼,提供 plus 和 flash 两个版本。
推荐理由:升级通过多模态双工与多教师蒸馏兼顾了低延迟抗噪和复杂工具调用,适合语音交互开发者参考。
通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。
推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。