跳到正文
今天9月30日周三
  1. Hacker News · AI61

    数学界发布 AI 生成数学成果的负责任发布倡议

    针对前沿实验室利用未公开模型生成数学成果的现状,研究团队基于 600 多份数学界反馈提出了 AI 生成数学成果的发布规范倡议。倡议要求 AI 实验室在公布成果时严格核查文献引用,公开模型名、提示词、思维链与算力成本,并尽可能输出形式化证明 artifacts。此外,倡议要求实验室提供资金支持学术界开展研讨会与消化理解工作,并呼吁向全球数学界提供公平的模型访问权限。

    推荐理由:针对 AI 实验室用闭源模型跑数学成果的现状,该倡议系统提出了文献引用、形式化证明与算力成本透明化的发布规范。

  2. Buzzing HN · 中文精选25

    月球明暗界线悖论

    月球明暗界线悖论指日落后太阳位于地平线下方、月球亮面却看似朝上指的视错觉,其成因是观测者从下方仰视月球导致的视角几何变化,且月相越接近满月该现象越显著。作者在编写模拟程序探索该现象时测试了 Claude 与 Gemini,发现两款 AI 工具均完全无法理解其原理并陷入无限循环论证,暴露出实际推理能力的不足。

  3. Buzzing HN · 中文精选68

    开源快速决策模型 Jeff 发布,基于 Qwen3.5 单次前向推理延迟约 30ms

    开源决策模型 Jeff 正式发布,基于 Qwen3.5-0.8B/2B 与 Gemma 4 E2B 微调,支持单次前向推理直接输出校准概率,单次决策延迟低至 22 至 28 毫秒。

    推荐理由:原文展示了仅需单次前向推理的轻量级决策模型实现路径,为端侧与高并发场景下的极速分类与路由提供了低成本方案。

  4. arXiv 人工智能35

    HyperReCo:利用超图神经网络为大语言模型多跳推理检索并连接证据

    研究人员提出 HyperReCo 框架,利用超图神经网络(HyperGNN)检索互补证据并建立显式关联,以增强大语言模型的多跳推理能力。该框架将文档建模为实体的超边,通过消息传递捕捉查询相关的交互,并利用梯度引导超路径解码(GGHD)将证据转化为显式超路径。在 6 个基准测试中,HyperReCo 在全部 3 个多跳问答数据集上均取得了最佳检索性能。

  5. arXiv 人工智能34

    GLIDE:面向异构 LLM 智能体的广义分层内在分布评估方法

    研究团队提出面向异构 LLM 智能体的轻量级步骤评估方法 GLIDE,无需外部验证器或特定任务监督即可提升任务性能与步骤排序质量。GLIDE 通过分层残差一致性提取内在步骤证据并完成分布校准,转化为悲观奖励用于 MCTS 分支选择,同时利用归一化预测不确定性指导自适应分支。多跳推理、序列决策与符号逻辑实验表明,该方法有效提升了计算效率。

  6. arXiv 人工智能33

    认证观测等价因果模型之间的干预一致性

    研究者提出干预分离选择(ISS)方法,可在观测等价因果模型中通过主动干预排除矛盾候选,认证幸存模型在成本限制内与真实系统的一致性。针对连续变量,该方法利用混合整数线性规划精确判定停止条件。在三位数彩色 MNIST 因果抽象任务中,ISS 平均每张图像仅需 13.6 次干预即可完成网络因果抽象的认证。

  7. arXiv 机器学习46

    理解大语言模型后训练中 SFT、RLVR 与 OPD 的协同效应

    一项针对 Qwen3 模型的研究揭示了大语言模型后训练中 SFT、RLVR 与在线策略蒸馏(OPD)的协同机制,指出各阶段的效果高度取决于师生兼容性。实验表明,结合教师 RLVR 适配与学生 SFT 预热,可将平均 OPD 准确率从 29.2% 提升至 43.8%(相对提升 50%)。此外,OPD 比 SFT 能为下游 RLVR 提供更优的初始化,且该优势随算力扩展而扩大。

  8. arXiv 人工智能35

    指令而非答案:在在线策略上下文蒸馏中使用指令特权

    研究提出在在线策略上下文蒸馏(OPCD)中使用针对常见错误的通用指令特权,以替代样本专用的标准答案。在基于 ProverQA、ProofWriter 与 ProntoQA 数据集以及 Qwen3-Thinking 和 Olmo3-Thinking 模型的 8 组实验中,匹配指令特权在 7 组中的 OOD 准确率领先标准答案 4 到 17 个百分点,且领域内表现相当。

  9. arXiv 机器学习34

    TemporalGraphLLM:融合时序图神经网络与大语言模型处理动态文本属性图

    研究团队提出 TemporalGraphLLM 框架,可将任意时序图神经网络(TGNN)与大语言模型(LLM)结合,以增强动态文本属性图的推理能力。该方法通过感知图时序的指令微调和新型 TGNN 注入机制,使用图嵌入向量替代专用 token。在真实动态图数据集评测中,该框架在边分类、链路预测及基于边的文本生成任务上均达到 SOTA 性能。

  10. arXiv 机器学习37

    Seq2Cause:用单一自回归骨干解决事件序列中的四项因果发现任务

    Seq2Cause 框架利用单个无需重训练的预训练自回归模型作为摊销条件独立性测试引擎,解决了事件序列中的四项因果发现任务。该研究证明模型的额外交叉熵可直接约束因果识别误差,令下一 token 预测的提升同步增强因果保证。在包含 29K 事件类型与 474 种故障结果的车辆诊断日志等场景中,其首次实现单冻结骨干的大规模因果发现。

  11. arXiv 人工智能44

    基于接收端条件化的潜空间通信实现 94% CacheBack

    研究提出无需训练的多智能体潜空间通信方法 CacheBack,通过接收端提供的信息需求描述来过滤并压缩发送端的 KV cache。在 FanOutQA 基准上,基于 Qwen 3 的 CacheBack 削减了 75% 的传输状态,相比文本通信将准确率提升 14.7 个百分点,任务完成延迟中位数降低 3.2x。该方案在稠密 Transformer、Mamba 混合架构等多种模型族上均实现类似优化。

  12. arXiv 人工智能63

    研究显示模型推理会集中错误且自洽性机制无法察觉

    最新论文在固定模型权重仅切换推理模式的实验中发现,推理过程会加剧模型错误答案的聚集效应,两次独立采样给出相同错误答案的概率在全部 10 组对比中均显著上升。在无界答案空间中,推理模式生成的不同答案数降至非推理模式的 0.43 至 0.65 倍,且在 8 个模型和 5 个基准的 280 种组合测试中,置信度加权投票均未能超越常规多数投票。

  13. arXiv 机器学习37

    ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体

    研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。

  14. arXiv 机器学习36

    MaD-RL:通过强化学习匹配分布以校准大语言模型

    研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。

  15. arXiv 人工智能37

    利用嵌入式代码提升大语言模型的医学计算能力

    研究团队提出 MedCode 框架,通过训练大语言模型生成嵌入式可执行代码并由解释器运算,以提升临床医学计算的准确性。该框架基于 MedCalc 及 ICU 场景数据集构建,并引入加权直接偏好优化(wDPO)算法。在 LLaMA3-8B、Qwen2.5-7B 和 Mistral-7B 上的实验表明,该方法使模型计算准确率绝对提升了 20–30 个百分点。

  16. arXiv 人工智能44

    Choir:用于分布式多智能体自动形式化的开放协议

    研究人员推出开源协议 Choir,用于实现分布式多智能体定理自动形式化。Choir 将形式化项目分解为独立任务,支持各贡献者运行自带 LLM 订阅的 AI 智能体并通过 GitHub 协作,所有提交均由确定性门控检查后合并。该协议采用模块化设计且支持扩展,目前已兼容 Lean 4、Isabelle 和 Rocq。

  17. arXiv 自然语言处理40

    CoT-Pass@k 是否真正检验了思维链?一项多语言数学审计研究

    研究对评估模型推理的指标 CoT-Pass@k 进行了首个多语言数学基准审计,发现作为裁判的 LLM 均无法可靠检测出受损的推理链。评测显示 V4-Flash 和 Qwen3.6 等裁判主要依赖最终答案及链与答案的一致性做判定,接受损坏推理链的概率与正常链几乎相同。这导致 Pass@k 与 CoT-Pass@k 的平均差距在当前代求解模型上仅剩 4.1 分,且高度受 token 预算影响。

  18. arXiv 自然语言处理33

    局部合理却全局不足:多跳推理中的局部-全局差距

    多跳推理中普遍存在“局部-全局差距”(LGG),即单步推理合理却整体回答失败,在全局不足回复中占比近半且常规验证器极易漏检。为此提出的训练监督方法 E-Closure 强化了推理依赖关系,在测试中取得 92.8% 的最高平均准确率与 89.0% 的推理链可靠性,并将 LGG 率降至 6.2%。

  19. arXiv 自然语言处理29

    用词汇蕴涵解释文本蕴涵:利用 LLM 为形式化证明提供词汇关系

    研究人员评估了利用 LLM 提取结构化词汇蕴涵关系并辅助自然逻辑定理证明器 LangPro 进行推理证明的效果。实验结果显示,该任务即使对闭源专有 LLM 仍具挑战,对定理证明的贡献较为有限。LLM 生成的词汇关系往往仅具备部分可靠性,且多针对特定 NLI 问题生成,难以构成通用的有效词汇知识。

  20. arXiv 自然语言处理34

    面向任务自适应自我精炼流程的精简化反思演化

    研究提出 Workflow-Designing Agents(WDA)框架,通过反思演化自动构建任务自适应的自我精炼流程,并借助 SPLIT 机制将单提示词中的冗余指令重新分配至专用阶段。在涵盖知识与推理等 5 个基准评测中,WDA 在 Qwen3.5-9B 上取得 51.24% 的平均分(提升 8.63 个百分点),在 GPT-4.1-mini 上达到 49.00%(提升 5.62 个百分点)。

  21. arXiv 自然语言处理34

    DualGuard:面向保持逻辑数据增强的双模式质量控制框架

    研究团队提出保持逻辑的数据增强质量控制框架 DualGuard,通过单样本诊断与跨样本历史对比来决策候选数据的保留、过滤与修复。该框架结合语义验证与 Z3 符号验证,支持回溯性异常检查与定向回滚。在 Two-Stage Transfer 的 7 个下游任务评测中,DualGuard 在 5 个任务上取得最高 Accuracy,且全部优于无增强的 BERT 基线。

  22. arXiv 自然语言处理35

    回答之前:基于等大小记忆构建的证据充分性评估

    新研究指出通过删除段落构建记忆不足样本会泄露标签,并提出消除该捷径的等大小记忆构建方法与 MemSafe 评估器。MemSafe 在 MuSiQue 和 HotpotQA 数据集上分别取得 0.968 和 0.983 的 AUROC。将其作为 7B 阅读器的门控时,在 5% 覆盖率下将回答错误率从 0.850 降至 0.631。

  23. arXiv 自然语言处理47

    LANTERN:挖掘语言模型中隐藏的数学知识

    研究人员提出 LANTERN 流水线,通过预训练模型激活值分类器对候选关系排序,并结合分阶段过滤、假设生成与可执行验证挖掘隐藏数学知识。在 OEIS 的 1 万个高频数列(5000 万对组合)测试中,该方法产出 62 个验证关联,包含 9 个具洞察力的关联及 4 个此前未见的新发现。包含训练与验证在内的端到端流程耗时不到 8 小时。

  24. AITNT · AI头条(网页)87

    OpenAI 推出 7x24 小时常驻智能体 dots 与 GPT-6.1 Sol,上线 ChatGPT Space 及 Pro 500 订阅

    OpenAI 在 DevDay 上发布全天候常驻 Agent dots,配备独立云端电脑和浏览器并支持接入超 4000 种工具,可在后台全天候自动化执行建站与代码重构等任务。

    推荐理由:原文汇总了常驻智能体与协作空间的架构变化及定价,读者可以据此评估全天候自动化工作流对团队协作模式的影响。

  25. AITNT · AI头条(网页)76

    北大团队完成庞加莱猜想Lean 4完整形式化验证

    北京大学AI for Math团队宣布独立完成庞加莱猜想在Lean 4中的完整形式化,将500多页专著转化为约320万行代码。该工作由开发者与学生借助商用大模型及智能体工作流协作完成,历时半个月、总花费不到3万美元,平均每行代码成本不足1美分。成果包含27203个Lean文件且无一处sorry标记,已同时通过Lean build与Comparator双重检验。

    推荐理由:该项目展示了多智能体协作完成复杂数学命题形式化的工程框架,为大模型落地严谨科学验证提供了成本与路径参考。

  26. 爱范儿 · AI 筛选84

    OpenAI 开发者大会发布智能体 Dot、ChatGPT Space 与高性价比模型 GPT-6.1 Sol 等全系新品

    OpenAI 在开发者大会上公布了全天候自主智能体 Dot、人机协作空间 ChatGPT Space 以及主力模型 GPT-6.1 Sol 等一系列新品。

    推荐理由:原文系统梳理了 OpenAI 构建智能体协作平台的多款新品细节与定价对比,有助于读者评估其对现有开发及企业工作流的综合影响。