Anthropic AI 生物实验室在病毒中发现类 CRISPR DNA 结构
据《自然》杂志相关报道,Anthropic 旗下的人工智能生物实验室在病毒中发现了类似 CRISPR 的 DNA 序列与结构,引发了生命科学与 AI 领域的广泛关注。这一发现展示了 AI 工具在基因组学与微生物学研究中的前沿挖掘潜力。由于目前仅有标题与链接信息,关于该类 CRISPR 系统的具体功能机制及 Anthropic 的后续研究规划等技术细节仍有待进一步披露。
据《自然》杂志相关报道,Anthropic 旗下的人工智能生物实验室在病毒中发现了类似 CRISPR 的 DNA 序列与结构,引发了生命科学与 AI 领域的广泛关注。这一发现展示了 AI 工具在基因组学与微生物学研究中的前沿挖掘潜力。由于目前仅有标题与链接信息,关于该类 CRISPR 系统的具体功能机制及 Anthropic 的后续研究规划等技术细节仍有待进一步披露。
一项发布于arXiv的研究对比了AI辅导与人类真人辅导在GRE备考中的教学效果。实验结果表明,接受AI辅导的学生与接受人类辅导的学生在GRE学习收益(提分表现)上达到了相当的水平,证实了AI在标准化考试个性化辅导场景中的实用潜力。由于输入素材仅包含标题与链接,更多具体实验方法与样本细节有待查看完整论文。
Anthropic发表题为《Yes, Claude can do Nine Loops》的研究文章,展示旗下大语言模型Claude在解决“九连环”相关复杂逻辑与递归推理难题上的表现。由于原始素材仅提供标题与链接,未披露具体的实验方法、评测基准和技术细节,详细的研究结论需进一步参考Anthropic官方发布的完整报告。
最新动态显示,以Astra和Claude Opus为代表的前沿大语言模型成功参与并完成了阿兰·图灵在二战期间留下的密码破译工作。这项突破被视为AI模型通过了图灵在经典智能测试之外的“另一项测试”,展现了前沿AI在处理复杂历史密码学难题、逻辑推导以及大规模符号推理方面的强劲能力。具体技术细节及完整破解过程有待进一步披露。
据英国《金融时报》报道,市场上出现了一款极具成本优势的新型人工智能模型,正直接对标并挑战OpenAI与Anthropic等头部AI机构的市场地位。该趋势反映出行业正加速追求更高性价比的模型方案,试图通过大幅降低训练或推理成本来重塑大模型商业格局。由于原始素材信息有限,关于该模型的具体名称、技术架构与性能基准等细节仍有待进一步补充。
研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。
该研究聚焦于大语言模型在说服性对话中作为辩论智能体的表现,重点评估其在面对人身攻击(诉诸人身论证)时的应对能力。在政治等说服性对话场景中,人格可信度与命题内容同样关键。研究通过分析自然语言政治对话语料库,探究现代大模型能否复现人类在策略性运用和防御人身攻击方面的辩论水准,旨在系统评估模型在复杂对话情境中的辩论与说服能力。
针对社交媒体仇恨言论检测多局限于二分类、单数据集评估且缺乏决策可解释性的问题,该研究提出了一种多层级且具备可解释性的仇恨言论检测框架。该框架融合了DistilBERT、双向长短期记忆网络(BiLSTM)与注意力机制,旨在同时支持二分类与多类别分类任务,并增强模型预测推理过程的透明度与实际应用价值,助力内容审查系统的部署。
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
为解决语音大模型在面对大规模偏置列表时难以高效识别罕见词的问题,研究人员提出了基于音素级时间竞争的两阶段框架PTC-Bias。在预填充阶段,PTC检索通过帧同步音素解码及候选发音间的时间竞争,生成紧凑的偏置词候选短名单及对应的语音区间;在语音大模型解码后,PTC纠错模块在检索出的候选词与不匹配的转录文本片段之间展开二次局部竞争,从而提升识别准确率。
该研究探讨了强化学习在多模态大语言模型(MLLM)中抑制幻觉效果不稳定的问题,并归因于从奖励到参数更新纠错链中的两个弱点:在采样层面,高语义熵的困难查询易产生全错样本组,使最易产生幻觉区域的相对优势坍缩为零;在优化层面,高置信度的错误token存在梯度消失现象。为此,论文提出了双熵增强策略优化方法DEEPO,以改进参数更新机制并有效缓解多模态幻觉。
该研究针对知识追踪(KT)模型黑盒预测导致难以有效指导教学实践的问题,提出了一套综合验证协议。该协议系统评估了模型的预测竞争力、解释稳定性以及基于重新训练的忠实度。研究基于ASSISTments 2009和2012数据集,围绕五个教学主题构建了13个行为特征,并修正重建了原始数据集中存在技能构建重复记录的问题,为教育AI模型的可解释性评估提供了更可靠的基准。
语言模型对答案的置信度通常被视为其掌握事实程度的代理指标。该技术手册介绍了一个专门用于直接检验该假设的开源工具包。研究团队通过在包含81个个位数加法虚假答案的伪造语料库上微调小型因果语言模型,并在微调前后使用统一的测量流程,定量对比模型对虚假答案与真实答案的置信度演变。手册详细阐述并论证了该评估流水线的各个构建阶段。
针对药物研发中毒性预测面临的样本严重失衡、骨架泛化差以及缺乏临床可解释性等难题,研究人员提出了多模态网络架构 SMILESGNN。该模型通过交叉注意力机制,融合了 SMILES Transformer 编码器与 GATv2 图编码器,弥补了单一序列模型无法提供图归因解释的缺陷。此外,研究还推出了预训练变体 SMILESGNN-PT,有效提升了分子表征的泛化性能与临床解释能力。
该研究提出了对话记忆评测基准套件 TWIST,旨在评估记忆系统在用户信念发生改变时是否能正确执行干预操作。针对现有长对话基准主要测试召回率和被动知识更新的局限,TWIST 设立了四大评估维度:主动张力检测、依据历史记录审查输出草案、在回答当前信念的同时保留历史变更记录,以及对敏感召回的治理控制。该套件基于 LoCo 进行了扩展,并引入了经人工验证的草案对齐机制。
该研究利用逻辑回归探测和Logit-lens两种可解释性分析方法,探究大语言模型在各层中如何分布与处理书写系统(文字类型)知识。探测实验显示出明显的非对称性:输入文字系统与指令指定的输出文字系统在网络的极早层已被编码,但对实际输出文字系统的最终确定直到末尾深层才显现,中间大部分层级的表征仍默认倾向拉丁字母。这一两阶段机制为深入理解大模型的内部表征演进提供了重要证据。
针对压气机叶栅开式叶尖间隙流中CFD预测与实验存在偏差且高分辨率实验真值缺失的问题,该研究提出一种基于变分自编码器(VAE)与潜在空间自适应的非侵入式修正方法。研究首先使用166个参数化采样的CFD总压损失场数据集训练VAE以获取流场的低维统计表征,随后冻结该VAE,并利用少量数据训练低秩潜在空间适配器进行流场修正(注:原摘要末尾不完整)。
针对印度语言机器翻译受限于缺乏高质量本土语料与基准的问题,研究人员推出了以印度语言为中心的平行语料库 COILD。该资源包含超过116万对经人工翻译和验证的句对,覆盖印欧、达罗毗荼及藏缅等语系的20种印度语言对。与传统依赖英语轴心的语料库不同,COILD 更好地保留了印度语言的多样性、文化特性与领域特征,为低资源语言翻译提供了重要的数据与评估支持。
客体永久性和固体性是人类认知的核心先验。针对视频生成模型作为代表性世界模型是否已涌现客体永久性认知这一问题,研究团队推出了WROP数据基础设施。该基准受核心认知科学启发,包含手工设计的150个任务,细分为六大认知类别,旨在探究并训练视频生成模型的物理推理能力,从而推动构建具备类人物理智能的世界模型。
该研究针对扩散模型中表征正则化方法常忽视内置条件(如标签或文本)影响的问题,揭示了条件信号对特征分布的作用机制,并提出了 CARE(条件感知表征正则化)框架。CARE 是一种轻量级且即插即用的正则化方案,能够根据条件相似性动态调整特征分布,从而进一步优化扩散模型的样本生成质量并提升训练效率。
该论文评估了大语言模型在社交语用学层面是否与人类的礼貌判断相符。研究人员采用包含连续评分和三分类标注的两个英语数据集,对七个主流模型进行了测试。结果显示,模型之间的一致性显著高于模型与人类之间的一致性。策略层面的分析表明,模型与人类判断的对齐主要依赖于显式的语言线索,而在涉及建立融洽关系等隐式语用策略上仍存在理解偏差。
空间转录组学能够描绘组织结构内的基因表达,但高昂的成本限制了其日常应用。利用常见的HE病理图像预测空间基因表达是一种可扩展的替代方案,但传统方法通常将高维基因输出视为独立目标,忽略了基因间的生物学协同作用,且极易受高维噪声影响而发生过拟合。为此,该研究提出了轻量级模型SpaFactor,旨在摆脱对高开销图网络或复杂辅助组件的依赖,实现高效的空间上下文感知基因程序建模。
针对以往计算方法常将情绪视为静态单句标签的局限,研究人员提出了 EMPATH 计算框架,用于在多粒度层面理解心理健康危机干预对话中的情感动态。该框架涵盖单轮标签、状态转移概率和全局对话原型三个维度。将其应用于涉及哀伤议题的危机文本对话分析后,研究揭示了求助者持续的负面情绪特征、向希望的逐步转变趋势,以及求助者与志愿者之间截然不同的情绪角色与异质的心理恢复轨迹。
针对SHAP和LIME等事后解释方法在阿拉伯语、波斯语、乌尔都语和希伯来语等从右至左(RTL)语言中出现的可视化失效问题,该研究进行了系统评估与修正。论文指出,尽管特征归因在数学计算上依然有效,但现有可视化渲染会导致词元顺序错乱、连字符断裂及图表阅读方向错误。研究将此界定为可视化层面的工程缺陷,并提出了针对性的度量基准与渲染校正方案。
该论文复现了Mohd等人在2020年提出的基于分布语义的抽取式文本摘要方法,并将其适配至印地语,在每个语言特定步骤中均替换为适配天城文的组件。研究在XL-Sum印地语部分和FIRE ILSUM 2.0 Hindi两个语料库上进行了评估,采用适配天城文的ROUGE指标进行对比。实验结果显示,在原论文发表的等权重配置下,该复现系统的表现显著劣于简单的基线方法(如选取前三句)。
该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。
针对宏观经济等统计机构常对历史发布数据进行事后修订、导致模型训练容易引入前瞻偏差的问题,研究人员提出了具备数据修订感知能力的时间序列基座模型VINTAGE-TS。该架构明确区分了“观察时间”与“信息可用时间”,避免将单一版本假定为最终真值,而是同时预测下一周期的首次发布值及其发布后固定时间跨度内的修订值,从而更贴合真实场景下的时序预测需求。
该研究针对全连续扩散语言模型(dLM)在复杂推理任务中落后于自回归(AR)模型的难题,提出了ELF-REG架构。研究团队将嵌入语言流(ELF)拓展至GSM8K、MATH-500、HumanEval等数学与代码基准,并引入结合表征对齐与纠缠的机制(REPA+REG),通过冻结的AR教师模型监督中间去噪步骤,有效提升了连续扩散模型并行解码与复杂逻辑推理的扩展能力。
互联网文本中广泛存在承载结构、语义与功能的格式标签,而当前基于大语言模型的翻译系统在处理此类文本时,难以兼顾翻译流畅度与标签保真度。该研究提出应从数据合成、能力构建和多目标对齐三个层面系统化解决这一问题。在数据层面,论文形式化定义了合成数据生成过程中结构标签多样性与翻译自然度之间的权衡关系,为优化带标签文本翻译提供了新视角。
该研究提出了一种在多任务模型中学习跨任务关系的新框架。该框架通过针对性的成对关系来近似任务标签的联合分布,从而在避免对完整联合空间建模的高昂复杂度下,利用迁移学习提升模型性能与信息抽取能力。该方法具备通用性,并在YouTube生产级推荐系统(涵盖通知、主页及“接下来播放”等场景)中完成部署验证,实验表明其显著提升了预测准确率与用户满意度。