跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 73 条
9月30日周三
  1. Ars Technica · AI 筛选81

    AMD 宣布以 82 亿美元收购李飞飞创立的世界模型初创公司 World Labs

    AMD 与世界模型初创公司 World Labs 联合宣布,AMD 将在年底前以 82 亿美元收购 World Labs,交易尚待监管批准。World Labs 由李飞飞等人于 2024 年创立,专注于研发可模拟物理世界的 AI 模型并推出了 Marble 等 3D 生成工具。该收购将补齐 AMD 在机器人合成数据训练与世界模型技术栈上的能力。

    推荐理由:AMD 通过收购李飞飞团队补齐物理世界模拟能力,有助于在机器人合成数据领域缩小与竞争对手的技术差距。

  2. The Decoder89

    AMD 拟斥资 82 亿美元全股票收购世界模型初创公司 World Labs

    芯片制造商 AMD 宣布将以约 82 亿美元的全股票交易收购空间智能初创公司 World Labs,交易预计于 2026 年底前完成。World Labs 创始人李飞飞将加入 AMD 领导团队担任执行副总裁兼首席科学家,直接向首席执行官 Lisa Su 汇报并领导前沿研究。AMD 计划通过获取世界模型算法专长来更深入理解端到端工作负载,从而指导未来芯片硬件路线图的构建。

    推荐理由:原文披露了交易结构与战略意图,读者可以据此了解芯片厂商通过整合世界模型算法团队来指导硬件演进的路径。

9月29日周二
  1. The Next Platform85

    AMD 拟以 82 亿美元全股票收购李飞飞创立的世界模型初创公司 World Labs

    AMD 达成协议将以价值 82 亿美元的全股票交易收购由李飞飞等人创立的世界模型初创公司 World Labs。World Labs 估值在今年 2 月的 B 轮融资中约为 50 亿美元,旗下开发了 Marble 世界模型及 Atlas 多模态自回归扩散引擎。

    推荐理由:AMD 以全股票交易溢价收购世界模型团队,展现了芯片厂商通过自建前沿模型与软硬件生态应对竞争的战略意图。

  2. Microsoft Research67

    Microsoft Research 发布生物学 AI 研究系统 Quine

    Microsoft Research 推出生物学 AI 研究系统 Quine,由多模态生物学世界模型以及连接科研工具、文献与湿实验的交互框架组成。系统联合学习基因组、蛋白质、细胞状态及生物成像等跨尺度数据,以预测干预后的生物状态演变;在与 Broad Institute 合作的胰腺癌研究中,Quine 快速完成化合物筛选并在湿实验中验证了候选分子。

    推荐理由:原文展示了生物学世界模型与湿实验结合的闭环流程,读者可据此了解 AI 辅助跨模态生物学推理与药物筛选的具体范式。

  3. 爱范儿 · AI 筛选73

    神秘 AI 模型 Space Bunny 实测:支持草图生成 3D 网页与 Agent 编程,分词特征指向 MiniMax

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 上线,凭借快速响应、草图生成可交互 3D 网页及 Agent 编程能力引发大量调用。实测显示其能直接理解粗糙草图并生成包含动效的前端页面,但在精细视觉质感上与旗舰模型仍有差距。分词特征与代码线索分析显示,该模型可能来自 MiniMax 家族。

    推荐理由:实测展现了该模型将简单草图快速转化为可交互 3D 网页的能力,读者可据此了解轻量级 Agent 编程的适用边界。

  4. Solidot · AI 筛选89

    AMD 以 82 亿美元全股票收购 World Labs,李飞飞将出任首席科学家

    AMD 宣布以约 82 亿美元全股票方式收购李飞飞联合创办的 AI 初创公司 World Labs。World Labs 专注于开发世界模型且此前已融资超 12 亿美元,交易完成后李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接向董事长兼 CEO 苏姿丰汇报。

    推荐理由:AMD通过巨额全股票收购将前沿世界模型团队与顶尖学者招入麾下,反映出芯片巨头加速构建软硬件协同能力的战略布局。

  5. 爱范儿 · AI 筛选89

    AMD 宣布以 82 亿美元收购李飞飞创立的 World Labs

    AMD 宣布与李飞飞创立的空间智能公司 World Labs 签署最终协议,将以全股票方式作价约 82 亿美元进行收购,交易预计在 2026 年底前完成。交易完成后李飞飞将出任 AMD 执行副总裁兼首席科学家,团队将继续推进三维环境生成与机器人仿真模型的研发。AMD 计划通过软硬件协同开发,针对物理 AI、机器人与仿真等未来多样化计算负载优化底层计算基础设施。

    推荐理由:芯片厂商通过整合空间智能与三维仿真模型团队,展示了将算法研究深度绑定硬件设计的生态布局路径。

  6. 量子位89

    AMD 拟以 82 亿美元全股票收购李飞飞创立的空间智能公司 World Labs

    AMD 宣布签署协议,将以 82 亿美元全股票收购李飞飞创办的空间智能公司 World Labs,交易预计 2026 年底前完成。交易交割后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报,联合创始人 Justin Johnson 和 Ben Mildenhall 则带领团队并入 AMD 组建前沿 AI 研究组织。

    推荐理由:芯片巨头通过并购前沿空间模型团队切入物理世界模拟与具身智能负载,反映出底层硬件与三维生成架构深度绑定的趋势。

9月25日周五
  1. Google Research64

    Google 提出 AI 视频联合导演框架,推进长时长连贯视频生成

    Google Research 推出一套面向长时长叙事视频的多智能体框架体系,涵盖 Co-Director、CANVAS、A²RD 和 VQQA 四项核心研究,旨在解决视频扩散模型在多镜头场景中的语义漂移和级联错误。

    推荐理由:Google 将长视频生成解构为多智能体编排与世界状态追踪,提供了解决多镜头叙事中角色与场景漂移的成套系统方案。

  2. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时对话能力与低延迟流式视频生成结合,赋予对话 AI 具备自然口型与表情的动态视觉形象。

    推荐理由:原文介绍了原生实时对话结合流式数字人形象的能力与技术细节,读者可以据此了解多模态交互在企业场景中的最新落地形式。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。

    推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。

9月22日周二
  1. 腾讯混元 公众号68

    混元图像 3.5 预览版发布,腾讯推出高性价比专业级生图模型

    腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。

    推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。

    推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。

9月15日周二
9月10日周四
  1. DeepSeek 公众号89

    DeepSeek 正式发布 V4.1 Flash 原生多模态模型并开源

    深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。

    推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。

9月3日周四
  1. Hugging Face68

    NeoMME 原生多模态编码器发布:260M 与 800M 单塔架构开源

    NeoMME 推出 260M 与 800M 原生多语言多模态编码器,采用单塔双向 Transformer 从头预训练,无需独立视觉塔或自回归解码器。微调版 NeoMME-Retriever 在单次前向传播中同时输出稠密与后期交互嵌入,在 ViDoRe v3 达到帕累托最优,并可在单张 NVIDIA L40S 上以每秒 51 页的速度编码 2048×2048 图像。

    推荐理由:原文开源了单塔架构的多模态原生编码器与检索微调权重,读者可参考其在视觉文档检索与索引压缩上的落地实践。

9月2日周三
  1. Google Research62

    Google 联合 NASA JPL 推出 MAPL-EMIT:利用深度学习从太空监测全球甲烷排放

    Google 联合 NASA JPL 提出基于 Swin-S Vision Transformer 的深度学习框架 MAPL-EMIT,用于自动化检测、量化并定位太空高光谱卫星数据中的甲烷羽流。

    推荐理由:研究展示了如何利用物理仿真训练视觉模型解析太空高光谱遥感数据,为大范围环境监测提供了自动化工具。

  2. Google DeepMind79

    Google DeepMind 为 Gemini 推出智能体视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解(agentic video understanding)功能,可将 token 消耗降低最高 88%、成本降低最高 66%,并将准确率提升最高 7%。

    推荐理由:原文展示了模型通过主动调用工具按需动态分析视频的机制,为长视频处理的成本与精度优化提供了具体参考。

8月28日周五
  1. Google Research64

    Google 提出行星预测引擎 PPE:基于 Earth AI 自动化全流程地理空间建模

    Google Research 推出实验性系统“行星预测引擎”(PPE),可直接根据自然语言查询自主完成地理空间数据发现、清洗、特征工程、模型训练与评估的全流程。

    推荐理由:该研究通过大语言模型编排自动化全流程地理空间建模,将传统需数周的手工数据整理与特征工程压缩至数分钟。