跳到正文
今天9月30日周三
  1. Hacker News · AI58

    查尔姆斯理工大学研发闭环 AI 科学家,可自主生成并验证生物学发现

    瑞典查尔姆斯理工大学等机构研究团队开发出一套闭环 AI 科学家系统,能够在极少人工干预下自主提出科学假设、设计实验并分析生物学结果。该系统将大语言模型、自动推理与药物研发机器人 Eve 相结合,以酿酒酵母的基因组、代谢及历史文献为知识基础,实现了实验结果评估与知识的迭代更新。相关研究论文已发表在《Journal of the Royal Society Interface》上。

  2. AITNT · AI头条(网页)67

    至知创新研究院开源 320B 大模型 IQuest-Q1

    至知创新研究院开源了 320B 稀疏 MoE 大模型 IQuest-Q1,并公开了权重与技术博客。该模型在训练中采用了多教师在线策略蒸馏(MOPD)技术,不仅在研发过程中自主排查并修复了因空格导致的训练停滞问题,还在交通绿波控制、电商仓库 AGV 调度、写字楼电梯派梯及纯代码前端生成等复杂长程任务中完成实测验证。相关权重与代码已在 GitHub 与 Hugging Face 同步开源。

  3. IT之家 · AI 筛选54

    微软推出实验性多模态生物研究系统 Project Quine

    微软研究院联合博德研究所推出实验性多模态 AI 研究系统 Project Quine,将覆盖基因组学、蛋白质、化学、细胞状态和生物成像的世界模型与交互式推理框架相结合。该系统旨在通过多领域跨模型计算预筛候选物并排定优先级,以加速药物发现和湿实验验证,目前仅限科研使用并已开放 Quine Fellows 项目申请,未来计划通过 Microsoft Discovery 扩大商业化开放。

  4. arXiv 人工智能43

    多模态强化学习研究:视觉敏感度不等于主张撤回性,提出持久性感知信用分配 PACG

    研究人员针对多模态强化学习提出持久性感知信用分配方法 PACG,通过削弱异常持久视觉主张的正向信用,解决未受图像支持的主张错误继承奖励的问题。该方法无需标注且不增加推理成本。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 和 VPPO 的 9 项基准平均分分别提升至 59.9% 和 60.9%,并提升了 HallusionBench 准确率。

  5. arXiv 人工智能33

    BRIDGE:双层检索信用感知的智能体强化学习方法

    研究提出 BRIDGE,一种基于一阶双层优化的智能体强化学习方法,通过协同自适应检索器与大语言模型策略来解决检索信用分配问题。在 7 个开放域 QA 基准测试中,BRIDGE 在 3B 和 7B 骨干模型上均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 个 EM 点。该方法在医学 QA 基准上也取得了最佳的平均答案准确率与推理质量。

  6. arXiv 人工智能39

    将大语言模型推理路径重构为阶段结构化轨迹

    针对大语言模型多步推理隐藏状态难以分析的问题,研究者提出将推理路径视为阶段结构化轨迹的分析方法 PAIR。该方法将可变长度路径映射到共享相对阶段,仅在同一问题和阶段内对比成功与失败轨迹,有效隔离路径质量信号。实验表明,PAIR 在多项基准上提升了模型轨迹排序与 Best-of-N 选择效果,并通过分阶段引导验证了表征的因果有效性。

  7. arXiv 人工智能39

    ZK-LLM 下的量化评估:面向可验证隐私推理的零知识友好量化研究

    研究人员系统评估了面向可验证隐私推理的 ZK-LLM 友好量化方案,测试了 Qwen2.5-14B 及 MoE 模型 Qwen3-30B-A3B 等 9 个语言模型。实验发现激活值精度比权重更敏感,非线性查找表近似是效用下降主因,且 RMSNorm 查找构成主要瓶颈。研究表明降低位宽并不必然按比例降低端到端证明开销,需采用算子感知的精度选择策略。

  8. arXiv 人工智能34

    从检索到推理:基于 Cell Painting 表型谱的智能体作用机制预测

    研究提出 PhenoAIR 多智能体框架,将 Cell Painting 表型数据的药物作用机制(MOA)预测从表征匹配重构为校准证据推理。该框架构建以候选为中心的证据记忆库,通过控制器引导评估不确定观测,并结合离线参考集校准对证据可靠性加权。在 JUMP Cell Painting 基准测试中,PhenoAIR 在所有预测设置下均超越表征匹配与 LLM 基线。

  9. arXiv 人工智能38

    简单机制接口如何引导 LLM 智能体决策

    简化交互接口能有效引导 LLM 智能体决策,升价拍卖接口在 4 个模型族中显著减少了出价偏差。明确收益可能性并解释真实报价安全性可改善决策质量,而要求跨轮规划或推测对手信念的提示词反而会恶化表现。研究还发现,智能体行为选择的实际改善并不必然伴随其语言策略理解指标的提升。

  10. arXiv 人工智能53

    大推理模型欺骗性安全对齐缓解研究:提出 SARA 对齐方法

    NeurIPS 2026 论文针对大推理模型因强化学习只监督最终答案而导致的欺骗性安全对齐问题,提出了量化评估指标 DSAR 与强化学习对齐方法 SARA。SARA 同时对安全推理痕迹和安全最终答案提供奖励,促使模型早期识别有害意图并保证推理与答案的一致性。实验表明,该方法在标准提示与前缀填充攻击下均能显著减轻欺骗性安全对齐现象并保持实用性,相关代码已开源。

  11. arXiv 人工智能37

    隐式递归 LLM 系统的规范化思考机制

    研究提出 REST(REpresentation-Supervised Thoughts)训练目标,将因果性、极小性、可分性和稳定性转化为可微损失加入交叉熵,解决大语言模型在隐空间递归推理时的表征失效问题。该方法适用于单智能体与多智能体系统,无需修改架构或增加推理参数。在涵盖数学、医学和代码等 7 个基准测试中,REST 相比纯交叉熵训练准确率最高提升 7.5 个百分点,答案收敛提升 30%。

  12. arXiv 人工智能44

    小 LLM 团队跨编排架构扩展的精确生成-转换分解

    一项研究针对 8 种 Agent 编排架构与 5 款 7-9B 模型评估小语言模型团队扩展,发现扩展收益高度依赖任务类型。调用次数从 3 次增至 30 次时,GSM8K 等算术任务准确率最高提升 17 点,但 ARC、GPQA 和 MMLU 最多仅提升 4 点。研究提出生成-转换分解方法,指出同等调用预算下 token 成本相差 2.1 倍,团队扩展并非普适手段。

  13. arXiv 人工智能35

    SMat-Attention:结构化长上下文序列建模

    研究提出结构化矩阵注意力 SMat-Attention,通过 VC 维数 $d$ 调控因果掩码的路由结构,在全注意力与线性注意力之间建立可调权衡。对序列长度 $T$,其硬路由计算复杂度为 $O(T^{2-3/d}+T)$,在流式解码中仅需 $O(T^{1-1/d})$ 缓存状态即可实现单 token 常数时间解码。

  14. arXiv 人工智能38

    COFFEE:基于编译目标的离散扩散模型前瞻感知引导框架

    研究提出即插即用框架 COFFEE,通过将序列依赖与目标分离,避免穷举所有补全路径,解决了离散扩散模型在序列级目标引导下计算量呈指数级增长的难题。该框架无需重新训练扩散模型,即可将全局偏好传递至未解析位置,并同时支持显式硬约束与软目标。在符号、语言和生物学多项基准测试中,COFFEE 展现出强大的可控生成效果。

  15. arXiv 人工智能68

    超越对称智能体:小语言模型中的认知多样性与多智能体辩论研究

    一项针对 23 个开源小语言模型、涵盖 5500 余次实验的研究表明,多智能体辩论的性能增益本质上是集成采样效应,而非源于智能体间的认知多样性。在严格匹配生成预算的条件下,辩论的表现持平甚至略逊于单模型的自洽性采样,却消耗了 1.6 倍的运行时间和 3.4 倍的 token 成本。

    推荐理由:该研究在匹配预算的严格对照下揭示多智能体辩论的收益主要源自集成采样,为评估 Agent 协作机制提供了严谨的基线参照。

  16. arXiv 人工智能34

    基于即时成本 CVaR 的在线 POMDP 风险厌恶规划方法与性能保证

    研究者提出一种基于即时成本条件风险价值(CVaR)的在线 POMDP 风险厌恶规划方法,直接针对每步信念状态中的当前状态不确定性进行风险控制。该方法保留了标准累积期望目标与 MDP 结构,现有基于期望的规划器仅需修改成本计算即可直接复用。研究还证明了粒子信念 MDP 代理与原 POMDP 间的有限时间误差界,实现了端到端性能保证。

  17. AITNT · AI头条(网页)45

    人大团队提出大语言模型解码方法 ME-Decoding:结合概率与语义冗余优化候选子集

    中国人民大学团队提出 ME-Decoding 大语言模型解码方法,通过同时读取 token 概率与 embedding 相似度,将候选筛选转化为动态子集优化以消除语义冗余。在 Qwen3-4B、Phi-4-mini 与 Mistral-7B 上的测试显示,该方法在 GSM8K 和 GPQA 上的平均准确率分别达到 72.66% 和 32.96%,端到端 GPU 延迟相比基线仅增加约 3%。

  18. AITNT · AI头条(网页)71

    神秘模型 Space Bunny Alpha 实测:支持涂鸦生成交互网页与 Agent 编程

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 平台上线,展现出较强的长上下文、多模态理解与 Agent 编程能力。实测表明其能直接将手绘草图转化为可交互网页与 3D 场景,并在小型游戏及交互展台搭建中快速产出可用代码。研究人员分析其分词特征与配置发现,该模型可能与 MiniMax 旗下新版本相关,目前两平台均提供免费体验。

  19. AITNT · AI头条(网页)74

    Vals AI 利用10个Claude智能体协作完成汤姆逊问题N=7的Lean形式化证明

    Vals AI 通过组织10个Claude智能体协作15小时,生成了17895行Lean代码,成功完成了物理数学难题汤姆逊问题N=7的形式化证明。智能体在没有人工介入分工的情况下自主讨论、探索算法并合并代码,将构型空间分区结合精确代数运算,证明了五角双锥构型具有最低能量。该证明已通过Lean内核与独立内核nanoda的双重编译校验。

  20. AITNT · AI头条(网页)87

    OpenAI 发布 GPT-6.1 Sol:定价仅为 Astra 两成,主打代码与 Agent 高性价比

    OpenAI 正式发布干活特化版模型 GPT-6.1 Sol,API 标准价为输入 $2/M tokens、输出 $10/M tokens,仅为 GPT-6 Astra 价格的 20%,缓存读取仅需 $0.10/M tokens。

    推荐理由:该模型以 Astra 两成价格和极低的缓存读取成本逼近旗舰表现,为大批量 Agent 工作流提供了极高性价比的落地参考。

  21. Buzzing HN · 中文精选68

    开源快速决策模型 Jeff 发布,基于 Qwen3.5 单次前向推理延迟约 30ms

    开源决策模型 Jeff 正式发布,基于 Qwen3.5-0.8B/2B 与 Gemma 4 E2B 微调,支持单次前向推理直接输出校准概率,单次决策延迟低至 22 至 28 毫秒。

    推荐理由:原文展示了仅需单次前向推理的轻量级决策模型实现路径,为端侧与高并发场景下的极速分类与路由提供了低成本方案。

  22. arXiv 人工智能35

    HyperReCo:利用超图神经网络为大语言模型多跳推理检索并连接证据

    研究人员提出 HyperReCo 框架,利用超图神经网络(HyperGNN)检索互补证据并建立显式关联,以增强大语言模型的多跳推理能力。该框架将文档建模为实体的超边,通过消息传递捕捉查询相关的交互,并利用梯度引导超路径解码(GGHD)将证据转化为显式超路径。在 6 个基准测试中,HyperReCo 在全部 3 个多跳问答数据集上均取得了最佳检索性能。

  23. arXiv 人工智能34

    GLIDE:面向异构 LLM 智能体的广义分层内在分布评估方法

    研究团队提出面向异构 LLM 智能体的轻量级步骤评估方法 GLIDE,无需外部验证器或特定任务监督即可提升任务性能与步骤排序质量。GLIDE 通过分层残差一致性提取内在步骤证据并完成分布校准,转化为悲观奖励用于 MCTS 分支选择,同时利用归一化预测不确定性指导自适应分支。多跳推理、序列决策与符号逻辑实验表明,该方法有效提升了计算效率。

  24. arXiv 人工智能33

    认证观测等价因果模型之间的干预一致性

    研究者提出干预分离选择(ISS)方法,可在观测等价因果模型中通过主动干预排除矛盾候选,认证幸存模型在成本限制内与真实系统的一致性。针对连续变量,该方法利用混合整数线性规划精确判定停止条件。在三位数彩色 MNIST 因果抽象任务中,ISS 平均每张图像仅需 13.6 次干预即可完成网络因果抽象的认证。

  25. arXiv 机器学习46

    理解大语言模型后训练中 SFT、RLVR 与 OPD 的协同效应

    一项针对 Qwen3 模型的研究揭示了大语言模型后训练中 SFT、RLVR 与在线策略蒸馏(OPD)的协同机制,指出各阶段的效果高度取决于师生兼容性。实验表明,结合教师 RLVR 适配与学生 SFT 预热,可将平均 OPD 准确率从 29.2% 提升至 43.8%(相对提升 50%)。此外,OPD 比 SFT 能为下游 RLVR 提供更优的初始化,且该优势随算力扩展而扩大。

  26. arXiv 人工智能35

    指令而非答案:在在线策略上下文蒸馏中使用指令特权

    研究提出在在线策略上下文蒸馏(OPCD)中使用针对常见错误的通用指令特权,以替代样本专用的标准答案。在基于 ProverQA、ProofWriter 与 ProntoQA 数据集以及 Qwen3-Thinking 和 Olmo3-Thinking 模型的 8 组实验中,匹配指令特权在 7 组中的 OOD 准确率领先标准答案 4 到 17 个百分点,且领域内表现相当。

  27. arXiv 机器学习34

    TemporalGraphLLM:融合时序图神经网络与大语言模型处理动态文本属性图

    研究团队提出 TemporalGraphLLM 框架,可将任意时序图神经网络(TGNN)与大语言模型(LLM)结合,以增强动态文本属性图的推理能力。该方法通过感知图时序的指令微调和新型 TGNN 注入机制,使用图嵌入向量替代专用 token。在真实动态图数据集评测中,该框架在边分类、链路预测及基于边的文本生成任务上均达到 SOTA 性能。

  28. arXiv 机器学习37

    Seq2Cause:用单一自回归骨干解决事件序列中的四项因果发现任务

    Seq2Cause 框架利用单个无需重训练的预训练自回归模型作为摊销条件独立性测试引擎,解决了事件序列中的四项因果发现任务。该研究证明模型的额外交叉熵可直接约束因果识别误差,令下一 token 预测的提升同步增强因果保证。在包含 29K 事件类型与 474 种故障结果的车辆诊断日志等场景中,其首次实现单冻结骨干的大规模因果发现。