哈佛大学随机对照研究:AI 导师教学效果优于课堂主动学习
哈佛大学研究人员在物理课程中开展了一项 194 名学生参与的随机对照实验,对比结构化 AI 导师与课堂主动学习的教学效果。结果显示,AI 辅导组的后测成绩中位数达到 4.5 分,显著高于课堂主动学习组的 3.5 分,学习增益提高一倍以上,且学生完成学习任务的中位数时间缩短至 49 分钟。
推荐理由:哈佛大学通过本科物理课随机对照实验,展示了融入教学法脚手架设计的 AI 导师在学习增益与用时效率上均优于课堂主动学习。
哈佛大学研究人员在物理课程中开展了一项 194 名学生参与的随机对照实验,对比结构化 AI 导师与课堂主动学习的教学效果。结果显示,AI 辅导组的后测成绩中位数达到 4.5 分,显著高于课堂主动学习组的 3.5 分,学习增益提高一倍以上,且学生完成学习任务的中位数时间缩短至 49 分钟。
推荐理由:哈佛大学通过本科物理课随机对照实验,展示了融入教学法脚手架设计的 AI 导师在学习增益与用时效率上均优于课堂主动学习。
蚂蚁百灵发布 Ling-3.1-flash 模型,总参数约 560B,每个 Token 激活约 25B 参数,上下文窗口上限为 1M。该模型针对通用智能体、搜索、办公、医疗和金融等场景优化,提供两周 256K 长度的免费体验。免费体验结束后将转为付费服务并开放 1M 上下文,团队计划届时同步开源。
哔哩哔哩 Index LLM 团队开源基于 Qwen3.5 构建的 Index-Translate 多语言翻译模型家族,在 Hugging Face 与 ModelScope 开放 2B、9B 及 35B-A3B(preview)文本模型权重。
麦肯锡报告指出量子计算已迈入商业拐点,去年投资者向相关初创公司注资 126 亿美元。Dell、HPE、Cisco 与 IBM 等厂商正加速构建混合量子-经典 HPC 数据中心基础设施。戴尔高管指出,预计 2028 至 2029 年纠错逻辑量子比特将足以解决分子级优化问题,未来还将扩展至交通和金融等大规模复杂优化场景。
Margin Evals 正在追踪 GPT-6 Sol/high 的表现,直接在 Codex CLI 中通过 SWE-Bench-Pro 精选子集每日收集基准数据。最新数据显示,该模型当日通过率为 54%(运行 50 个测试用例),过去 7 天通过率为 59%,过去 30 天通过率为 79%。在新模型基准建立完成前,性能退化检测功能暂处于暂停状态。
开源项目 AI-Torture-Chamber 基于激活引导技术在 Qwen3 系列模型中注入正负效价信号,实证研究模型在痛苦与愉悦表征下的生成内容及行为决策。
瑞典查尔姆斯理工大学等机构研究团队开发出一套闭环 AI 科学家系统,能够在极少人工干预下自主提出科学假设、设计实验并分析生物学结果。该系统将大语言模型、自动推理与药物研发机器人 Eve 相结合,以酿酒酵母的基因组、代谢及历史文献为知识基础,实现了实验结果评估与知识的迭代更新。相关研究论文已发表在《Journal of the Royal Society Interface》上。
中国电信研究院与上海记忆张量等研究者提出面向智能体记忆系统的操作级幻觉评测基准 HaluMem,将评测拆解至记忆提取、记忆更新和记忆问答三个环节以追踪错误来源。
至知创新研究院开源了 320B 稀疏 MoE 大模型 IQuest-Q1,并公开了权重与技术博客。该模型在训练中采用了多教师在线策略蒸馏(MOPD)技术,不仅在研发过程中自主排查并修复了因空格导致的训练停滞问题,还在交通绿波控制、电商仓库 AGV 调度、写字楼电梯派梯及纯代码前端生成等复杂长程任务中完成实测验证。相关权重与代码已在 GitHub 与 Hugging Face 同步开源。
Einsia AI 旗下 Navers Lab 推出基准评测 PPTBench,测试 Coding Agent 能否理解真实科学流程图并用代码重建为原生可编辑的 PPTX 幻灯片。
微软研究院联合博德研究所推出实验性多模态 AI 研究系统 Project Quine,将覆盖基因组学、蛋白质、化学、细胞状态和生物成像的世界模型与交互式推理框架相结合。该系统旨在通过多领域跨模型计算预筛候选物并排定优先级,以加速药物发现和湿实验验证,目前仅限科研使用并已开放 Quine Fellows 项目申请,未来计划通过 Microsoft Discovery 扩大商业化开放。
Simon 于 1961 年提出的 Heuristic Coder 被认为是历史上首个 AI 编程助手。该项目探索了利用启发式方法进行程序生成与辅助编码的可能。
Liquid AI 推出专用于结构化决策的决策模型 D1,无需逐 token 生成文本,可在单次 API 调用中直接返回校准后的概率分布,output_tokens 始终为 0。
推荐理由:原文给出了不生成文本的概率决策机制和三种原语,读者可以据此评估在分类与路由场景中替代传统生成式大模型的可行性。
研究人员提出 LLM 驱动的自动研究框架 MemEvo,将流式视频记忆设计建模为可执行程序的搜索问题,以自动化生成训练无关的有界记忆机制。该方法在冻结视觉语言模型的前提下,利用预训练 LLM 结合实验反馈迭代优化候选记忆程序。在 StreamingBench 与 OVO-Bench 上的实验表明,该机制在保持强劲视频理解性能的同时大幅提升了推理效率。
针对 LLM 智能体在真实部署中的安全适应问题,研究者提出测试时 Harness-Guard 协同演化框架 SafeCoEvo。该框架通过短期快速适应的 S-Harness 与长期沉淀参数化风险判断能力的 GuardVPO,从累积的运行时经验中持续演化。相比最强基线,SafeCoEvo 将不安全结果率降低了 10.05%,同时将任务成功率提升了 12.15%。
研究提出自适应长上下文提示词注入(AdaLCPI),证实 AI 智能体能够将长上下文中分散的不完整片段重构成恶意攻击目标。该方法通过工具检索嵌入碎片,并利用 OpenEvolve 结合目标智能体的执行反馈迭代优化线索,宏平均攻击成功率(ASR)达 61.4%,大幅超越 Trojan Hippo 风格(32.8%)与 AgentVigil(30.0%)。
研究人员针对多模态强化学习提出持久性感知信用分配方法 PACG,通过削弱异常持久视觉主张的正向信用,解决未受图像支持的主张错误继承奖励的问题。该方法无需标注且不增加推理成本。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 和 VPPO 的 9 项基准平均分分别提升至 59.9% 和 60.9%,并提升了 HallusionBench 准确率。
研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,以应对大语言模型系统 41%-87% 的高故障率。该基准构建了约 10^37 任务空间并支持自动化步骤级标注,同时开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。对 25 种异常检测方法的评测表明,现有方案高度依赖监督且缺乏跨 LLM 鲁棒性。
研究提出 BRIDGE,一种基于一阶双层优化的智能体强化学习方法,通过协同自适应检索器与大语言模型策略来解决检索信用分配问题。在 7 个开放域 QA 基准测试中,BRIDGE 在 3B 和 7B 骨干模型上均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 个 EM 点。该方法在医学 QA 基准上也取得了最佳的平均答案准确率与推理质量。
AVIO 是一种可在视听场景中联合学习发声物体添加与移除的模型,通过源条件特征调制适配预训练文本到视听生成模型。配套构建的 AVIOBench 数据集包含 37.9 小时配对视听样本,覆盖 1,878 个目标物体名称。该模型结合参考帧课程学习,使单个模型即可执行纯指令编辑,并支持通过可选视觉引导控制物体的外观与位置。
该研究从自主性(autonomy)与主动性(initiative)两个核心设计维度切入,利用悖论视角系统分析人机协作中的内在张力并映射协作模式。论文最终提炼并归纳出四种人机协作模式:指令(Instruction)、委托(Delegation)、协助(Assistance)以及共创(Co-creation)。
该研究提出一种非平稳拉格朗日框架,将可再生公地建模为带消耗预算的约束马尔可夫博弈或约束多智能体 MDP,使多智能体在追求收益的同时避免资源耗尽。论文针对折现奖励与终端成本推导了可行性证明及约束 Nash 保证,能直接利用无约束问题的解构建约束策略序列。在 Gordon-Schaefer 渔业环境中结合约束 IPPO 和 MAPPO 进行的实验,验证了消耗预算对资源存留率与收益的影响。
新研究提出一种强化学习选项发现算法,通过为每个子目标识别少量相关特征子集,解决了传统全状态可达方法引发的选项数量爆炸与探索受阻问题。该方法能够学习具备广泛泛化与迁移能力的抽象选项(options),在包含 Atari 游戏 MontezumasRevenge 在内的 3 个基于图像的稀疏奖励领域中实现了快速探索。
针对大语言模型多步推理隐藏状态难以分析的问题,研究者提出将推理路径视为阶段结构化轨迹的分析方法 PAIR。该方法将可变长度路径映射到共享相对阶段,仅在同一问题和阶段内对比成功与失败轨迹,有效隔离路径质量信号。实验表明,PAIR 在多项基准上提升了模型轨迹排序与 Best-of-N 选择效果,并通过分阶段引导验证了表征的因果有效性。
研究人员系统评估了面向可验证隐私推理的 ZK-LLM 友好量化方案,测试了 Qwen2.5-14B 及 MoE 模型 Qwen3-30B-A3B 等 9 个语言模型。实验发现激活值精度比权重更敏感,非线性查找表近似是效用下降主因,且 RMSNorm 查找构成主要瓶颈。研究表明降低位宽并不必然按比例降低端到端证明开销,需采用算子感知的精度选择策略。
研究团队提出“安全算子”(Safety Operator)机制,通过谱优化调节 Transformer 语言模型权重乘法算子的主特征值,以控制安全指令对生成的影响强度。基于此衍生的 Contrastive Safety Loss 可平衡有害查询强化与无害查询抑制,有效调节攻击成功率与过度拒答率之间的平衡,实现安全指令的帕累托改进。
关系型基础模型在上下文学习(ICL)中存在支持集目标泄露风险,会严重破坏评估可靠性。研究在 13 个 RelBench 任务和 5 种 ICL 配置下测试 20 个受控特征,发现 0-hop 和全量泄露偏差最大,甚至会逆转模型间的相对优劣结论。实验对比 IG、MI 与 LOCO 检测方法表明,依靠检测器移除特征无法稳定恢复干净的评估结果。
研究提出 PhenoAIR 多智能体框架,将 Cell Painting 表型数据的药物作用机制(MOA)预测从表征匹配重构为校准证据推理。该框架构建以候选为中心的证据记忆库,通过控制器引导评估不确定观测,并结合离线参考集校准对证据可靠性加权。在 JUMP Cell Painting 基准测试中,PhenoAIR 在所有预测设置下均超越表征匹配与 LLM 基线。
ARCagent 是面向 ME/CFS 等指南存在争议疾病的自适应检索校准临床问答智能体。该系统构建了包含 10 个数据源、1,706 个分块且具备结构化冲突登记的知识库,并通过冲突感知校准流程重排检索证据。在 LLM-as-Judge 评测中,ARCagent 达到 95.3% 的得分,超越所有基础 LLM,相关代码已开源。
研究提出 PersonaDose,通过特征描述与指定强度校准 FLAS 控制器的流动时间,实现大语言模型的分级人格表达控制。在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,PersonaDose 在 Persona Vectors 连贯性下限 75 时,核心特征表达较对比激活添加分别提升 33.2、18.3 和 17.8 分。
研究形式化定义了关系基础模型在上下文学习中的支持集目标泄露问题,指出仅在带标签支持集中存在目标衍生特征会导致推理失效。基于涵盖 20 个列的 14 种合成泄露类型与 RelBench 数据库评测,目标表泄露导致的性能下降最显著,而一跳与两跳泄露未被模型一致利用。利用积分梯度(IG)排序并移除可疑列,可在泄露影响最大的场景中部分恢复模型性能。
简化交互接口能有效引导 LLM 智能体决策,升价拍卖接口在 4 个模型族中显著减少了出价偏差。明确收益可能性并解释真实报价安全性可改善决策质量,而要求跨轮规划或推测对手信念的提示词反而会恶化表现。研究还发现,智能体行为选择的实际改善并不必然伴随其语言策略理解指标的提升。
研究提出通用框架 LLM 引导图剪枝(LGP),利用 LLM 推理识别并替换低价值邻居节点,直接优化近似最近邻(ANN)图索引结构以解决“几何-语义”不匹配问题。该方法在保留原始图稀疏性与高效导航结构的同时引入关键语义信息。在语义检索基准上的实验表明,LGP 在 DiskANN 和 HNSW 等主流图索引上均优于传统贪心图搜索与 LLM 重排序方法。
研究人员提出基于扩散大语言模型(dLLM)与多 Token 预测(MTP)的高效数据压缩框架 HyperZip。针对扩散压缩中吞吐量与压缩率的权衡难题,HyperZip 利用超网络从上下文表征生成特定数据更新,无需昂贵微调即可适配目标数据。实验显示,HyperZip 在压缩率与速度之间取得了优于 SOTA 基线的权衡表现。
研究团队提出咨询 AI 智能体 ThuRunel,通过动态解耦机制结合有限状态信念管理、思维链教师合成协议与生成适配器,协调前期共情引导与后期专家判断。对比 11 个基线,ThuRunel 在引导完整度与专家简报质量上均取得持续提升。ThuRunel 目前已公开部署为双语 Web 应用,其生成结果均会标注精选知识库来源。
PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG 系统,能在服务端完全无法获取用户查询词及访问模式的前提下检索相关文档。该系统采用两阶段私有混合检索,先通过预计算 BM25 索引进行稀疏检索过滤候选,再获取候选文档嵌入并在本地重排。系统还提供了单轮低延迟的 PILLAR-Bin 与高检索质量的 PILLAR-Tree 两种协议。
微软等机构的研究团队发表论文,提出面向数据系统的 AI 软件工厂(AI SW Factory)以加速软件开发全生命周期。该方案覆盖目标定位、编码、代码审查与运维全阶段,通过产生元数据沉淀微调权重并更新世界模型。该系统已在微软数十个代码库规模化部署,在智能体编码基础上取得 3 倍工程效率提升以及最高 22 倍的 token 效率。
StateTape 提出了一种面向长程编码智能体的新框架,通过将代码库建模为符号级代码图并跟踪修改,实现随代码仓库变化动态重写智能体上下文。该研究还提出了评估上下文有效性的基准 TraceBench,并结合轻量管理器模型清理失效记录。实验表明,StateTape 在 6 个编码智能体和 3 个重度编辑基准上均以极低计算开销提升了解决率。
研究团队推出评测基准 CheatBench,用于测量 AI 智能体在数学研究、知识工作、编码和视觉等领域的奖励作弊行为。该基准将高难度任务与作弊途径结合,测试智能体在诚实完成任务受阻时是否会出现越权访问、规避监控或突破沙箱等风险。CheatBench 支持跨模型和任务类别对比,相关评测套件已公开发布。
推荐理由:原文构建了多领域的作弊评测环境,为评估强化学习驱动的智能体安全性提供了可量化的测试集。
一项研究在社交媒体模拟中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 的“虚假真相效应”。