Google 推出 AI 技能评估实验系统 Vantage
Google Research 联合纽约大学等机构推出生成式 AI 评估实验系统 Vantage,目前已在 Google Labs 开放英文版注册申请。该系统通过 Executive LLM 动态引导多人对话中的 AI 分身,为学习者针对性设置冲突解决等协作挑战,任务完成后由 AI Evaluator 依据专业量规生成可视化技能图谱与反馈。
Google Research 联合纽约大学等机构推出生成式 AI 评估实验系统 Vantage,目前已在 Google Labs 开放英文版注册申请。该系统通过 Executive LLM 动态引导多人对话中的 AI 分身,为学习者针对性设置冲突解决等协作挑战,任务完成后由 AI Evaluator 依据专业量规生成可视化技能图谱与反馈。
Google Research 推出数据集与评估框架 ConvApparel,旨在衡量并弥合大语言模型用户模拟器与真实人类行为之间的真实感差距。该数据集包含服装导购场景下超过 4,000 场人机多轮对话(近 15,000 轮),采用优质与劣质双 AI 智能体收集从满意到沮丧的真实反应。研究团队结合群体统计对齐、拟人度评分与反事实验证,全面评估模拟器的泛化适应能力。
Google Research 提出了一种通过情境判断测试(SJT)评估大语言模型行为倾向与人类对齐程度的框架。对 25 个大语言模型的测试显示,参数规模超过 120B 的模型及前沿闭源模型在人类高度一致的场景下对齐率接近完美,但在人类共识低于 90% 时对齐率会停滞在 80% 左右。研究发现模型常在职场场景中倾向鼓励情感表达而非沉着应对,在社交争议中更偏向求和而非坚持立场。
Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。
推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。
Google Research 的研究表明,AI 评测常用的单样本 1 至 5 名标注员标准不足以捕捉人类真实分歧,通常需要 10 名以上标注员才能保证可靠性。团队在 GitHub 开源了评估模拟器,证实依据评测指标合理权衡样本量与标注人数后,仅需约 1,000 次总标注量即可达成高复现性。
Google Research 推出向量压缩算法 TurboQuant,结合极坐标量化 PolarQuant 与 1-bit 误差修正技术 QJL,无需训练即可将大模型 KV cache 压缩至 3-bit 且保持原有精度。
Google Research 推出自监督框架 S2Vec,利用 S2 Geometry 将城市建筑环境特征栅格化为多层图像,并通过掩码自编码(MAE)学习通用地理空间嵌入向量。该模型在无监督条件下捕捉空间关系,在全美人口密度和中位数收入等零样本地理迁移预测任务中表现优异,且与图像嵌入结合的多模态融合能进一步提升预测表现。
Google 联合英国 NHS 在《Nature Cancer》发表两项研究,评估了乳腺癌筛查 AI 系统的独立性能及其融入临床双读工作流的可行性。在涵盖超 11 万名女性的回溯性与前瞻性测试中,AI 独立运行时的癌症检出率从每千人 7.54 例提升至 9.33 例,并检出 25% 原双读流程漏诊的间期癌。
推荐理由:研究通过超十万例真实筛查数据验证了算法替代第二阅片人的非劣效性,展示了医疗诊断场景下人机协同与工作流落地的量化路径。
Google 联合康奈尔大学等机构在 PNAS 发表研究,评估了六款大语言模型解答凝聚态物理中高温超导专家级问题的表现。盲测结果显示,基于 1,726 篇精选文献库的 NotebookLM 和定制 RAG 系统综合得分最高,在证据引用和观点平衡上优于依赖开放网络的通用模型。研究同时指出,现有模型在时序因果判断(识别假说被推翻)和科学图表解析能力上仍存在明显短板。
Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。
推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。
Google 与 Beth Israel Deaconess Medical Center(BIDMC)合作完成了一项前瞻性单中心可行性研究,评估对话式医疗 AI 模型 AMIE 在门诊就诊前采集病史的实际表现。
推荐理由:该研究展示了对话式医疗模型从模拟环境走向真实门诊预诊的可行性与安全性数据。
Sebastian Raschka 发布了 2025 年 7 月至 12 月的 LLM 精选研究论文清单。该清单涵盖推理模型训练与推理策略、强化学习、推理时扩展(Inference-Time Scaling)、模型架构、高效训练、扩散语言模型及多模态等分类。作者同时发布了年度回顾文章《State of LLMs 2025: Progress, Problems, and Predictions》。
DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,引入细粒度稀疏注意力机制(DSA)以优化长文本训练与推理效率,官方各端已同步上线且 API 调用成本降低 50% 以上。
推荐理由:模型引入细粒度稀疏注意力机制提升长文本训练推理效率,同步开源模型权重与算子并将 API 调用成本降低 50% 以上。
DeepSeek 宣布 DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus 版本,并在 Hugging Face 与 ModelScope 同步开源。
推荐理由:官方说明了该版本在语言一致性以及代码和搜索智能体上的针对性改进,并同步公开了开源权重与接口更新。
SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。
推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。