跳到正文
4月14日周二
  1. Google Research50

    Google 推出 AI 技能评估实验系统 Vantage

    Google Research 联合纽约大学等机构推出生成式 AI 评估实验系统 Vantage,目前已在 Google Labs 开放英文版注册申请。该系统通过 Executive LLM 动态引导多人对话中的 AI 分身,为学习者针对性设置冲突解决等协作挑战,任务完成后由 AI Evaluator 依据专业量规生成可视化技能图谱与反馈。

4月9日周四
  1. Google Research46

    ConvApparel:衡量并弥合用户模拟器的真实感差距

    Google Research 推出数据集与评估框架 ConvApparel,旨在衡量并弥合大语言模型用户模拟器与真实人类行为之间的真实感差距。该数据集包含服装导购场景下超过 4,000 场人机多轮对话(近 15,000 轮),采用优质与劣质双 AI 智能体收集从满意到沮丧的真实反应。研究团队结合群体统计对齐、拟人度评分与反事实验证,全面评估模拟器的泛化适应能力。

4月3日周五
  1. Google Research47

    Google Research 评估大语言模型的行为倾向对齐

    Google Research 提出了一种通过情境判断测试(SJT)评估大语言模型行为倾向与人类对齐程度的框架。对 25 个大语言模型的测试显示,参数规模超过 120B 的模型及前沿闭源模型在人类高度一致的场景下对齐率接近完美,但在人类共识低于 90% 时对齐率会停滞在 80% 左右。研究发现模型常在职场场景中倾向鼓励情感表达而非沉着应对,在社交争议中更偏向求和而非坚持立场。

  2. Google DeepMind90

    Google DeepMind 发布开源模型 Gemma 4:覆盖端侧与桌面规模并采用 Apache 2.0 协议

    Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。

    推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。

4月1日周三
  1. Google Research50

    Google Research:构建更好的 AI 评测基准需要多少名标注员?

    Google Research 的研究表明,AI 评测常用的单样本 1 至 5 名标注员标准不足以捕捉人类真实分歧,通常需要 10 名以上标注员才能保证可靠性。团队在 GitHub 开源了评估模拟器,证实依据评测指标合理权衡样本量与标注人数后,仅需约 1,000 次总标注量即可达成高复现性。

3月25日周三
  1. Google Research45

    绘制现代世界:S2Vec 如何学习城市的语言

    Google Research 推出自监督框架 S2Vec,利用 S2 Geometry 将城市建筑环境特征栅格化为多层图像,并通过掩码自编码(MAE)学习通用地理空间嵌入向量。该模型在无监督条件下捕捉空间关系,在全美人口密度和中位数收入等零样本地理迁移预测任务中表现优异,且与图像嵌入结合的多模态融合能进一步提升预测表现。

3月18日周三
  1. Google Research71

    Google 联合英国 NHS 评估乳腺癌筛查 AI 系统在双读流程中的可行性

    Google 联合英国 NHS 在《Nature Cancer》发表两项研究,评估了乳腺癌筛查 AI 系统的独立性能及其融入临床双读工作流的可行性。在涵盖超 11 万名女性的回溯性与前瞻性测试中,AI 独立运行时的癌症检出率从每千人 7.54 例提升至 9.33 例,并检出 25% 原双读流程漏诊的间期癌。

    推荐理由:研究通过超十万例真实筛查数据验证了算法替代第二阅片人的非劣效性,展示了医疗诊断场景下人机协同与工作流落地的量化路径。

3月17日周二
  1. Google Research52

    Google 联合康奈尔大学评估大模型解答高温超导前沿问题的能力

    Google 联合康奈尔大学等机构在 PNAS 发表研究,评估了六款大语言模型解答凝聚态物理中高温超导专家级问题的表现。盲测结果显示,基于 1,726 篇精选文献库的 NotebookLM 和定制 RAG 系统综合得分最高,在证据引用和观点平衡上优于依赖开放网络的通用模型。研究同时指出,现有模型在时序因果判断(识别假说被推翻)和科学图表解析能力上仍存在明显短板。

3月12日周四
  1. Google Research61

    Google 推出 Groundsource 框架并开源 260 万条全球突发洪水数据集

    Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。

    推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。

12月30日周二
  1. Sebastian Raschka41

    LLM 研究论文清单:2025年7月至12月

    Sebastian Raschka 发布了 2025 年 7 月至 12 月的 LLM 精选研究论文清单。该清单涵盖推理模型训练与推理策略、强化学习、推理时扩展(Inference-Time Scaling)、模型架构、高效训练、扩散语言模型及多模态等分类。作者同时发布了年度回顾文章《State of LLMs 2025: Progress, Problems, and Predictions》。

12月1日周一
  1. DeepSeek 公众号93

    DeepSeek 发布 V3.2 正式版与 V3.2-Speciale 模型并开源

    DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。

    推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。

9月29日周一
  1. DeepSeek 公众号85

    DeepSeek 发布 DeepSeek-V3.2-Exp 实验模型并开源,API 同步降价超 50%

    DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,引入细粒度稀疏注意力机制(DSA)以优化长文本训练与推理效率,官方各端已同步上线且 API 调用成本降低 50% 以上。

    推荐理由:模型引入细粒度稀疏注意力机制提升长文本训练推理效率,同步开源模型权重与算子并将 API 调用成本降低 50% 以上。

9月22日周一
8月20日周三
  1. SemiAnalysis · 算力产业77

    SemiAnalysis 发布 H100 与 GB200 NVL72 训练基准评测:功耗、TCO 与可靠性分析

    SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。

    推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。