跳到正文
7月16日周四
7月15日周三
  1. 阶跃 StepFun 公众号28

    阶跃星辰公布 WAIC 2026 展区亮点

    阶跃星辰公布 WAIC 2026 参展亮点,将集中展示覆盖云端与端侧的 Step 系列模型矩阵,以及智能体原生操作系统 Step AOS。获评 WAIC“镇馆之宝”的智能体手机 STEPX Neo 将首次线下公开亮相,汽车智能体也已搭载于极氪8X。此外,现场还将携手原力灵机发起 6 台机器人连续协作 15 小时拼装 8 万余块积木长城的极限挑战。

7月12日周日
  1. 阶跃 StepFun 公众号66

    阶跃星辰发布 Step Edge 端侧模型家族

    阶跃星辰发布面向手机与汽车等终端场景的 Step Edge 端侧模型家族,涵盖基础模型、Audio、GUI 及 Gen 四类模型。该系列支持低至 0.1 秒的本地 toolcall 执行与全模态隐私保护,并在 29 项核心评测指标中取得领先;官方同时推出了配套的 Step Inference NPU 自研推理引擎以优化终端延迟。

    推荐理由:阶跃星辰面向手机和汽车等场景推出端侧模型家族并配套自研推理引擎,展示了端云协同与本地执行的技术路径。

7月9日周四
  1. Google Research71

    Google 发布 SensorFM:基于万亿分钟可穿戴健康数据的传感器基础模型

    Google Research 推出面向可穿戴健康数据的大型传感器基础模型 SensorFM,基于 500 万受试者超过 1 万亿分钟的多模态无标注传感器数据进行自监督预训练。

    推荐理由:原文展示了利用海量无标注传感器数据预训练基础模型的方法,读者可据此参考时序健康信号的通用表征构建方式。

7月6日周一
  1. Hugging Face63

    Photoroom 详解文生图模型 PRX 数据工程策略:从 VLM 重打标到流式训练

    Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。

    推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。

7月1日周三
6月16日周二
  1. 通义实验室 公众号78

    通义实验室发布具身智能基础模型套件 Qwen-Robot

    通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。

    推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。

6月13日周六
  1. Google Research53

    Google 研究探讨 AI 如何辅助用户理解皮肤疾病

    Google 联合斯坦福等机构发表研究,评估多模态 AI 工具在辅助普通用户理解皮肤病症及后续决策时的效果。在覆盖 2,345 名受试者的对照实验中,AI 辅助使病症名称的识别准确率从常规搜索的 8% 提升至 23%,但在指导用户判断是否紧急就医等下一步决策上并无显著改善。真实社区临床测试显示,图文对照匹配能成为辅助医患沟通的参考工具,但仍需更具体的行动建议来防止用户低估病情紧急度。

6月11日周四
  1. 通义实验室 公众号66

    通义实验室详解 MNN 适配 Arm SME2:Qwen3-VL-4B 端侧 Prefill 提速 81%

    通义实验室发布基于 MNN 推理引擎适配 Arm SME2 指令集的端侧大模型部署教程,提供了 Qwen3-VL-4B-Instruct 在 Android 旗舰手机上的完整落地流程。

    推荐理由:文章给出了从 MNN 编译到 APK 构建的完整端侧落地流程,读者可据此复现 SME2 指令集对视觉语言模型的加速效果。

6月9日周二
  1. Google DeepMind83

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate 支持 70 多种语言近实时语音互译

    Google DeepMind 正式发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时端到端流式语音互译,并在生成翻译时保留原说话人的语调、节奏和音高。

    推荐理由:模型突破了传统轮流对话式翻译的延迟限制,通过流式生成保留说话人语调与节奏,为实时跨语言沟通提供了新方案。

  2. Google DeepMind83

    Google DeepMind 推出统一无编码器多模态模型 Gemma 4 12B

    Google DeepMind 推出统一且无独立编码器的多模态模型 Gemma 4 12B,支持原生音频与视觉输入,采用 Apache 2.0 协议开源。该模型移除了传统的图像和音频编码器,直接将多模态信号投影至 LLM 主干,性能接近 26B MoE 模型而内存占用减少超过一半,仅需 16GB 显存或统一内存即可在笔记本电脑本地运行。

    推荐理由:模型移除了传统独立的模态编码器并直接接入语言主干,展示了在消费级硬件上兼顾原生音画输入与推理效率的轻量化方案。

5月18日周一
  1. Google DeepMind88

    Google DeepMind 发布 Gemini Omni 与 Gemini Omni Flash 视频生成模型

    Google DeepMind 正式推出 Gemini Omni 系列模型及首款模型 Gemini Omni Flash,支持将图像、音频、视频和文本任意组合输入并生成高质量视频。

    推荐理由:原文介绍了支持任意模态输入并能对话式编辑视频的新模型,读者可以了解多模态生成与推理能力结合的最新落地进展。

5月17日周日
  1. Google DeepMind65

    Google 扩展内容透明度与溯源工具,覆盖 Search、Gemini、Pixel 及云端 API

    Google 宣布全面扩展内容透明度与验证工具,在 Search、Gemini、Chrome、Pixel 及 Google Cloud 中深入集成 SynthID 水印与 C2PA 溯源技术。

    推荐理由:原文给出了从端侧拍摄到多平台搜索验证的技术落地细节,读者可以了解主流平台如何统一推进生成式内容溯源与真伪识别。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash:主打智能体与编程能力,输出速度提升 4 倍

    Google DeepMind 正式推出 Gemini 3.5 系列并首发上线 Gemini 3.5 Flash,重点强化复杂长程智能体与编程工作流能力。该模型在 Terminal-Bench 2.1(76.2%)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度达到其他前沿模型的 4 倍。

    推荐理由:原文给出了模型在智能体与编程基准上的性能表现及吞吐速度对比,读者可以据此评估其作为生产环境主力模型的调用效率与成本。

4月30日周四
4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布开源模型 Gemma 4:覆盖端侧与桌面规模并采用 Apache 2.0 协议

    Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。

    推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。

3月29日周日
  1. Google DeepMind68

    Google DeepMind 探索 AI 时代鼠标指针交互:结合 Gemini 实现即指即问

    Google DeepMind 推出由 Gemini 驱动的 AI 指针交互方案与实验 Demo,使用户无需切换窗口或编写复杂提示词,直接通过指向屏幕内容并配合简短语音即可完成操作。

    推荐理由:原文阐述了结合视觉上下文与多模态理解的指针交互设计,读者可据此了解系统如何将传统指针操作升级为无缝的 AI 上下文触发入口。

3月18日周三
  1. Google Research55

    Google 展现医疗 AI 最新成果:从个人健康智能体到临床筛查与开源生态

    Google Research 在 The Check Up 活动上展示了多项医疗健康 AI 进展,涵盖个人健康智能体、临床诊断辅助以及开源生态建设。研究表明个人健康智能体能结合多模态数据提供长期健康指导,AI 乳腺癌筛查系统可识别 25% 既往遗漏的间期癌症,多智能体系统 AMIE 正开展临床测试。

2月25日周三
  1. Sebastian Raschka73

    2026 年初开源大模型架构横向对比:从注意力混合机制到长上下文推理优化

    Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。

    推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。

1月28日周三
  1. AWS HPC40

    基于 AWS 与 LiDAR 3D 点云构建端到端可扩展视觉智能流水线

    AWS 介绍了基于其云服务与 LiDAR 3D 点云构建端到端可扩展视觉智能流水线的实践方案。方案通过 AWS DataSync 和 Amazon S3 实现现场到云端的高效数据传输,并利用 OpenDroneMap(ODM)自动化提取数字表面模型(DSM)与数字地形模型(DTM)。整套工作流支持 GB 至 PB 级数据量的弹性伸缩与交付。

1月20日周二
12月30日周二
  1. Sebastian Raschka41

    LLM 研究论文清单:2025年7月至12月

    Sebastian Raschka 发布了 2025 年 7 月至 12 月的 LLM 精选研究论文清单。该清单涵盖推理模型训练与推理策略、强化学习、推理时扩展(Inference-Time Scaling)、模型架构、高效训练、扩散语言模型及多模态等分类。作者同时发布了年度回顾文章《State of LLMs 2025: Progress, Problems, and Predictions》。

11月25日周二
7月31日周四
  1. SemiAnalysis · 算力产业68

    SemiAnalysis 提出机器人五级自主性分级框架

    SemiAnalysis 发布机器人五级自主性分类体系(Robotics Levels of Autonomy),从自主规划(Agency)与灵巧度(Dexterity)两个维度将机器人划分为 Level 0 至 Level 4 五个阶段。

    推荐理由:原文基于自主规划与操作灵巧度两项维度划分出五级机器人自主性框架,读者可借此建立对通用机器人商业化落地节奏的系统认知。