NVIDIA 推出开源 3D CT 视觉语言模型 NV-Reason-CT,支持放射科思维链推理
NVIDIA 推出开源 3D CT 视觉语言模型 NV-Reason-CT,旨在支持放射科医生的思维链(CoT)推理。针对通用前沿大模型在三维容积成像上表现欠佳、多数开源医疗 AI 模型缺乏对高密度 3D CT 扫描支持的痛点,该模型专门针对临床三维影像推理进行优化。
NVIDIA 推出开源 3D CT 视觉语言模型 NV-Reason-CT,旨在支持放射科医生的思维链(CoT)推理。针对通用前沿大模型在三维容积成像上表现欠佳、多数开源医疗 AI 模型缺乏对高密度 3D CT 扫描支持的痛点,该模型专门针对临床三维影像推理进行优化。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。
推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。
NVIDIA 在新加坡 AI 日展示了与东南亚多国公共部门及企业的合作成果,推动 Nemotron 开源模型、Cosmos 世界模型和 Vera Rubin 计算平台在当地的规模化落地。
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。
MIT 与哈佛等机构的研究人员在 Nature 发表名为 xvr 的 AI 框架,能在数秒内将微创手术中的实时 2D X 射线与术前 3D CT 或 MRI 扫描进行亚毫米级精度的空间配准。该技术基于物理仿真生成合成 X 射线预训练基础模型,针对新患者的个性化微调时间缩短至约 5 分钟,在 5 家医院的多部位真实数据集上显著优于现有 AI 配准方法,可用于急诊介入手术与手术机器人辅助导航。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。
推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。
Google 推进多语言 AI 技术,推出支持 70 种语言和 2,000+ 语言对实时翻译的 Gemini 3.5 Live Translate,以及高精度语音转文本模型 Gemini 3.5 Transcribe。为解决网络受限环境下的使用需求,Google 还发布了基于 Gemini 构建的轻量级开源翻译模型家族 TranslateGemma,覆盖 55 种语言并支持端侧离线高效运行。
阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。
推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。
深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。
推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。
Hugging Face 团队基于 Gradio Workflow 画布推出 Workflow1111,通过 73 个节点和 11 条管线重构了 AUTOMATIC1111 的核心功能。
推荐理由:展示了如何用可视化节点图复构复杂生图系统,且每个输出节点均可自动转为 REST 接口与 MCP 工具供智能体调用。
编码-预填充-解码(EPD)解耦是一种多模态模型推理优化技术,将视觉编码器阶段与预填充和解码阶段分离。该技术在图像密集型提示词、中短长度输出以及量化 MoE 模型场景中最为有效。文章介绍了结合 NVIDIA Dynamo 使用 EPD 解耦的具体时机与方法,最高可实现 5 倍加速。
Google DeepMind 与电影制作团队合作推出纪录短片《Love, Rendered》,利用 AI 技术重现了一对结婚超 70 年夫妇未曾被影像记录的初遇记忆。团队结合生成模型修复黑白老照片,并通过动作捕捉模型将老人当下的微表情与神态映射至年轻形象。用户也可在 Gemini 应用中上传老照片进行修复与上色。
NeoMME 推出 260M 与 800M 原生多语言多模态编码器,采用单塔双向 Transformer 从头预训练,无需独立视觉塔或自回归解码器。微调版 NeoMME-Retriever 在单次前向传播中同时输出稠密与后期交互嵌入,在 ViDoRe v3 达到帕累托最优,并可在单张 NVIDIA L40S 上以每秒 51 页的速度编码 2048×2048 图像。
推荐理由:原文开源了单塔架构的多模态原生编码器与检索微调权重,读者可参考其在视觉文档检索与索引压缩上的落地实践。
Google 汇总了 8 月的多项重大 AI 进展,包括发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe、Gemini Omni 1.1 Flash 以及搭载 Tensor G6 芯片的 Pixel 11 系列设备。
Google 联合 NASA JPL 提出基于 Swin-S Vision Transformer 的深度学习框架 MAPL-EMIT,用于自动化检测、量化并定位太空高光谱卫星数据中的甲烷羽流。
推荐理由:研究展示了如何利用物理仿真训练视觉模型解析太空高光谱遥感数据,为大范围环境监测提供了自动化工具。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解(agentic video understanding)功能,可将 token 消耗降低最高 88%、成本降低最高 66%,并将准确率提升最高 7%。
推荐理由:原文展示了模型通过主动调用工具按需动态分析视频的机制,为长视频处理的成本与精度优化提供了具体参考。
Google Research 推出实验性系统“行星预测引擎”(PPE),可直接根据自然语言查询自主完成地理空间数据发现、清洗、特征工程、模型训练与评估的全流程。
推荐理由:该研究通过大语言模型编排自动化全流程地理空间建模,将传统需数周的手工数据整理与特征工程压缩至数分钟。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供更具控制力的视频生成套件并正式接入 Google AI Studio 的 Gemini API。
推荐理由:材料详述了场景延展、首尾关键帧过渡与视频参考等控制特性,开发者可据此评估其在视频工作流中的落地可行性。
NVIDIA Developer Blog 介绍了在 NVIDIA GB300 NVL72 上运行阿里 Qwen3.8-Flash-Next 进行智能体编码的实践。
推荐理由:文章解析了在 GB300 NVL72 上运行 Qwen4 预览版模型的架构参数与长上下文特性,为开发者构建智能体编码工作流提供了参考。
智谱正式上线并开源 GLM-5 系列原生多模态模型 GLM-5.3-Flash(320B-A18B),在综合智能指数与编程评测中取得与 Claude Opus 4.8 相当的表现。
推荐理由:该模型在综合评测中追平海外顶级旗舰,并通过混合注意力架构与国产芯片部署大幅压低了调用成本。
Google 提出研究原型 AgentHands,专为 Android XR 等平台设计,可将大语言模型推理转化为与语音实时同步的三维交互手势。系统通过环境感知构建 3D 边界框,并利用词级时间戳协同 TTS 语音与动画引擎,在物理空间中精准完成指示与动作模拟。在兰花养护和 3D 打印机操作测试中,该技术显著提升了具身智能体的空间交互效果。
Google Search 介绍了利用其 AI 与视觉搜索工具升级家居装饰的 5 种方法。用户可使用 AI Mode 上传房间照片预览家具摆放效果,通过 Google Lens 和 Circle to Search 即时搜索同款装饰与复古好物。此外,Search Live 支持通过实时相机画面与语音指导 DIY 安装,搜索自带的比价与价格追踪功能还可监控商品降价。
DeepSeek 实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台,支持图文混合输入与各类 Agent 框架集成。
推荐理由:原文给出了纯文本与多模态基准对比以及按 token 计费规则,开发者可以据此评估多模态智能体任务的接入成本。
针对视觉语言模型(VLM)训练数据分散且无法集中原始记录的问题,NVIDIA 介绍了如何使用 NVIDIA FLARE 构建联邦多模态 AI 训练工作流。该方案支持在各本地数据站点之间协同训练模型,以适应视觉问答、图像标注和图文推理等任务。
Clario 基于 AWS 构建了自动化检测方案,利用 Amazon Bedrock 上的 Claude Sonnet 4.5 与 Amazon Textract 识别临床试验 DICOM 图像中的 PHI 和 PII。
Sentence Transformers 在 v6.0 更新中引入 MultiVectorEncoder,原生支持 ColBERT 风格的延迟交互(Late Interaction)检索模型。
推荐理由:库更新统一了 ColBERT 与 ColPali 等延迟交互模型的接口,读者可据此在 RAG 中低成本接入多向量检索。
OlmoEarth Studio 现已支持按需计算并导出基于开源 OlmoEarth 基座模型的地球观测嵌入向量。用户可通过界面或 API 自定义区域、时间跨度、10-80 米空间分辨率及三种不同尺寸编码器(Nano、Tiny、Base),导出量化为 int8 的云优化 GeoTIFF 格式栅格。
MindTopo 评测基准针对多模态模型(VLM)发布,旨在从连通性、分离、顺序、包围与绳结五个维度评估其空间拓扑推理与交互规划能力。测试显示,主流闭源与开源模型在静态识别上的表现普遍优于交互规划,但整体均远落后于人类水平。模型的失败主要集中在多步规划阶段,容易在动态变化中丢失结构追踪或违反物理约束。
Google DeepMind 推出多语种手语转文本模型 SL2T,并首次落地 Pixel 11 的 Gboard 输入法与 Live Transcribe,首发支持美国手语(ASL)转英语听写。
推荐理由:该模型跳过传统手语标注直接将姿态骨骼坐标映射为文本,并落地手机输入法,展现了端云协同下多模态交互落地的具体路径。
Google Research 与 Google DeepMind 推出基于 Gemini 和 Project Astra 的医疗 AI 系统 AMIE (Video),实现了专家级实时音视频临床问诊。
推荐理由:研究通过解耦对话、规划与感知的异步多智能体架构,首次实现了音视频多模态下的实时医疗问诊与查体引导。
微软研究院推出胸部 X 光视觉语言模型 CARE-X,通过结合自由文本生成与结构化预测,统一支持放射学报告生成、校准诊断等多类临床判读任务。该模型利用强化学习(DAPO)在多任务场景中奖励临床正确性,并在印度 Narayana Health 的真实临床数据上完成了验证。
MIT CSAIL 与清华大学等机构研究人员推出物理预训练方法 GeoPT,利用 130 万个合成动力学样本让模型预先掌握基础物理规律,提升 3D 物理场景仿真能力。
Meta 发布多模态模型 Muse Glimmer 并采用 Apache 2.0 协议开源,该模型参数量为 30B,包含 2B 视觉编码器与 28B 文本解码器,专为本地 Agent、隐私计算、编码和文档分析设计。
推荐理由:Meta 开源 30B 本地端多模态智能体模型并采用 Apache 2.0 协议,为开发者提供了兼顾隐私与本地部署的工具调用与编码模型选择。
Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。
推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并正式在 Google Flow Music 中上线。新模型在旋律结构复杂度与自然度、歌词质量与结构感知、以及人声发音和情感表现力上均有提升。同时,它增强了创作控制能力,方便用户调整生成音频的节奏和时长。
推荐理由:原文列举了旋律、歌词、人声表现力与节奏时长控制等维度的升级,读者可以据此评估 AI 音乐生成的可用性变化。
月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。
推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。
月之暗面在 Kimi K3 开放日正式发布 Kimi K3 模型权重、技术报告,并开源支撑模型训练的关键 Infra 技术。Kimi K3 是拥有 2.8 万亿参数的 MoE 模型,具备原生视觉理解能力与 100 万 token 上下文窗口,支持自由下载部署。本次配套开源了专家并行通信库 MoonEP、高性能算子 FlashKDA 以及用于分布式强化学习的 AgentEnv 沙箱系统。
推荐理由:月之暗面同步开放了万亿参数混合专家模型权重、技术报告及训练基础设施,有助于开发者了解其超长上下文与细粒度通信优化方案。
通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。
推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。
通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。
推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。
DharmaOCR 在巴西葡萄牙语基准测试中取得 0.925 分,显著领先更新的 Mistral OCR4(0.798 分)和 Unlimited-OCR(0.7587 分)。该模型通过监督微调将全部参数容量集中于目标语言结构,并引入直接偏好优化(DPO)抑制重复与不连贯输出。测试结果表明,垂直领域专精训练在复杂文档抽取质量和推理稳定性上明显优于多语言通用模型。