Anthropic 发布 Claude Sonnet 5.5:成本降 30% 且性能逼近 Opus 5.5
Anthropic 正式推出 Claude 5.5 系列的第二款模型 Claude Sonnet 5.5。该模型生成速度提升超 30%,单任务成本降低多达 30%,且在知识工作基准测试中表现几乎与 Opus 5.5 相当。在编程基准 Terminal-Bench 上,其得分从 10.3% 大幅跃升至 70.6%。此外,Anthropic 还预告了将在数周内推出 Haiku 5.5 模型。
Anthropic 正式推出 Claude 5.5 系列的第二款模型 Claude Sonnet 5.5。该模型生成速度提升超 30%,单任务成本降低多达 30%,且在知识工作基准测试中表现几乎与 Opus 5.5 相当。在编程基准 Terminal-Bench 上,其得分从 10.3% 大幅跃升至 70.6%。此外,Anthropic 还预告了将在数周内推出 Haiku 5.5 模型。
Anthropic正式推出了其中端主力模型的最新版本Sonnet 5.5。官方将其定位为性价比更高、速度更快的实用工作伙伴。该模型在提升响应速度的同时降低了Token消耗与使用成本,旨在为企业和开发者提供更经济高效的日常模型交互与工程应用支持。
根据《Nature Biotechnology》发表的最新研究,科研团队利用人工智能算法对 mRNA 疫苗进行序列优化,以显著提升其热稳定性。这一突破有望缓解传统 mRNA 疫苗严苛的冷链储存与运输要求,推动疫苗在全球特别是欠发达地区的普及。目前仅有标题及论文链接,具体算法架构与实验验证细节尚待进一步查阅原文。
多名开发者在月之暗面API平台后台发现“kimi-k3-1”模型标识已可通过接口探测。平台信息显示,Kimi K3.1预计支持最高100万Token上下文窗口,并提供Low、High、Max三档可调推理强度选项,推测将对应不同算力配置。此外,新模型或引入Agent智能体模式、Swarm多智能体协作及批处理等功能,API定价暂与K3持平(可能为占位符)。
Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。
一项针对DeepSeek-V4-Flash模型中mHC(多流残差)结构的机制分析显示,原本设计的四条残差流在实际读写权重中主要集中于其中约两条流。此外,在第22至42层等深层网络中,残差混合矩阵已退化并接近单位矩阵。该观察表明,模型在充分训练后对动态多流混合机制的实际依赖程度较为有限,部分残差通道可能存在冗余或功能退化。
中国科学院大学研究团队在《数据科学年鉴》发表论文,提出了“智能体能力周期表”。该研究将智能体抽象为控制、生成、记忆、输入、输出五大核心能力,每种能力细分为三个层级,构建出包含243种构型的系统化分类体系。研究指出,人类与细菌同处122号构型,当前最强的大模型智能体仅在控制维度上低一个层级(位列41号),并基于该体系对经典物理、相对论与量子力学中的观察者角色差异进行了全新阐释。
当前大模型在评审他人代码时,即使缺乏证据也会给出看似自信的虚假判断。多智能体验证机制通过将评审拆解为可检验声明来缓解该问题。该论文指出,有效的多智能体证据需满足两个关键条件:独立于被审查答案,且能在对比候选代码间体现差异。研究提出了两套无标注评估指标,并设计了一种在缺乏充分证据时主动拒绝盲猜的代码评审机制,以提升大模型代码评估的可靠性与扎实度。
评估可解释人工智能(XAI)方法一直面临缺乏可靠评估程序及真实解释基准(ground truth)的挑战。现有评估通常仅测量解释与黑盒模型预测之间的忠实度(fidelity),但这仅量化了解释复现模型输出的程度,无法确保其真实反映底层的决策过程。为此,该研究提出了一个合成真实基准框架,旨在解决不同解释方法难以进行客观真实度评测的难题。
本研究提出了一种基于图神经网络(SchNet)预测跨膜蛋白拓扑结构的新方法。与传统仅依赖蛋白序列或α-碳骨架特征的方法不同,该模型直接利用全原子级嵌入特征进行拓扑推断。在与DeepTMHMM相同的基准数据集上进行5折交叉验证,研究表明在不使用任何预训练权重的情况下,GNN在该任务上表现出良好潜力,展示了3D结构信息在蛋白拓扑预测中的应用价值。
针对离散扩散模型在奖励最大化对齐中主要依赖单向引导逆过程、缺乏回溯修正机制的问题,研究人员提出了 Spectral Feedback(谱反馈)算法。该方法在反馈循环中自适应选择编辑位置,利用离散扩散模型的掩码结构进行重新掩码和重采样,使模型能够在推理阶段迭代修正自身生成结果,有效提升了蛋白质设计等任务中的对齐表现。
大语言模型在离线翻译中表现出色,但在同传语音到语音翻译(Simul-S2ST)中,因缺乏高质量且因果对齐的跨语言说话人保真训练数据,且现有方案依赖固定策略或置信度启发式方法,导致翻译质量欠佳且延迟较高。研究团队提出了一种因果感知Simul-S2ST框架,通过新型数据流水线生成高保真、因果对齐的语音片段,以改善同传中的声音迁移和实时翻译效果。
大语言模型虽然表现出强大的语言能力,但究竟是真正理解上下文还是仅做超大规模的模式匹配仍存争议。上下文理解要求模型能够从给定语境中准确提取信息、构建一致的内部表征并进行事实推理。传统以BLEU和困惑度为主的评估方法往往局限于表面特征,该研究提出了一种基于知识图谱的新型评测框架,旨在更深入、结构化地量化大模型对上下文的真实理解能力。
该研究针对多说话人场景提出了目标说话人遗忘自动语音识别(TSU-ASR)任务,以满足特定用户不希望自身语音被转录的隐私需求。系统需转录未退出的说话人内容,同时仅标记退出者的发音区间而不转录其文本。研究团队设计了一种轻量级的注册条件门控(ECG)模块,可直接附加到冻结的双流语音大模型上,在推理阶段动态实现对新增退出说话人的选择性遗忘与转录过滤。
来自全球22个研究团队联合推出了BioEVAL基准,旨在评估大语言模型和多模态模型在生物工程领域的实验推理能力。该基准覆盖11个主要生物工程子领域,重点突破以往评测偏重事实召回的局限,提供达到博士水平的复杂实验与前沿任务推理评估。
本文提出了Benchy,一个用于AI程序基准评测的语义规范语言与执行引擎。Benchy将基准测试形式化定义为由程序、评分函数和数据集构成的三元组B=(P,S,D),实现评测套件与被测AI系统的解耦。基准采用规范YAML编写,基于共享的任务/领域本体,可确定性编译为规范JSON中间表示并由引擎执行,为任务型AI评测提供了标准化、可复现的通用基础设施。
在大模型高风险临床应用中,基于检索的事实核查已成为检测模型幻觉的主流范式。然而现有系统多依赖F1等汇总指标,遮蔽了核查失败的具体环节与原因,且传统RAG诊断往往依赖昂贵的标准答案或人工标注证据。针对长文本医疗问答的事实核查场景,该研究通过自动归纳构建了双重错误分类体系,能够细粒度剖析检索增强评估系统的具体失效模式,为提升医疗AI可解释性与评测可靠性提供了新工具。
针对微型机器学习(TinyML)神经架构搜索计算开销巨大的难题,论文提出低保真度评估框架TGL-NSGA-II。该方法基于进化搜索仅需可靠比较候选模型优劣而非精确适应度值的洞察,利用预训练教师模型根据样本难度与类别进行分层抽样,再通过短周期的轻量知识蒸馏(KD-Lite)在压缩数据集上快速训练候选网络并排序评估,大幅降低了端侧资源受限环境下的搜索成本。
一篇arXiv预印本论文探讨了LLM智能体在模拟个体社交媒体反应时的保真度问题。研究通过问卷调查、深度访谈和书面自述对8名塞尔维亚受试者进行画像构建,记录了他们对68条社交媒体帖子的真实反应,并测试了4个语言模型预测这些反应的能力。研究指出,相比过度复杂的推理,“少思考”的直觉式提示(Intuitive Prompting)反而有助于智能体更好地契合设定画像并模拟个体社交反应。
针对大语言模型在开放式任务中输出趋同、易陷入“群体思维”的问题,该研究将角色多样化形式化为集合级条件生成任务。研究探讨了“角色选择与生成”及“空间填充与边界探索多样性”两个核心设计维度,提出了覆盖子集选择、均匀覆盖采样及进化角色生成等四种方法。实验表明,结构化的多样化角色设定能有效打破模型生成的单一性,显著提升发散式思考与创意任务中的输出多样性与质量。
针对现有基准测试难以反映企业实际部署复杂度的问题,研究人员提出了 HARDEN 方法。该方法利用约束进化搜索技术,在保持预期输出答案不变的前提下,沿特定领域复杂度维度对评估输入进行改造,同时严格遵循任务语义、真实性与执行有效性约束。在 FinQA、PubMedQA、ContractNLI 基准及不同规模 Qwen3.5 模型上的实验表明,该方法能有效提升评测难度并暴露模型在复杂场景下的局限性。
一项最新学术研究探讨了语码转换(在单句中混合多种语言)对小型语言模型跨语言对齐的影响。研究人员在包含英文、荷兰文和中文的1亿词多语言语料库(基于BabyBabelLM数据集)上预训练小型Decoder-only Transformer模型,并通过大模型生成词级和句级语码转换数据。实验发现,在语码转换数据上训练能够显著对齐平行文本的特征表征,尤其是在不同文字系统之间效果明显。
随着大语言模型架构在序列推荐中的广泛应用,原本用于文本处理的旋转位置编码(RoPE)也被引入。然而,NLP 中的 RoPE 仅基于 token 索引编码相对次序,无法反映推荐交互中实际流逝的时间、多尺度行为周期及日历相位。为此,研究人员提出 T-RoPE(时间感知 RoPE),将传统基于索引的相对位置替换为显式的时间维度建模,以增强生成式推荐模型捕捉用户随时间变化兴趣演进的能力。
该论文研究了音频大语言模型(Audio LLMs)在输入语音严重失真时,能否识别出自身转录结果不可靠。实验发现,如果直接通过提示词让模型评估自身转录的可靠性,模型的判断表现很差,在绝大多数情况下都会盲目自信地预测转录是可靠的,这揭示了语音交互大模型在面对低质量输入时存在自我认知盲区的问题。
该研究探讨了大模型推理能力的递归自我提升方法。针对传统的策略内蒸馏(OPD)依赖外部教师模型提供密集的token级监督,研究提出了策略内自蒸馏(OPSD)机制。该机制通过复制一份冻结的学生模型,并在其上下文中提供真实标签作为特权教师模型,引导仅接收问题的学生模型进行模仿学习,从而在无需更强外部教师的情况下实现模型的自主迭代强化。
大模型在推理阶段的“测试时思考”虽能提升决策逻辑,但其激增的算力成本能否转化为实际经济效益仍存疑。最新arXiv论文从经济学投入产出视角,对DeepSeek、GPT和Gemini系列模型展开了为期一年的受控交易实验。在固定信息、提示词和投资组合策略的前提下,研究通过调节推理算力预算,量化评估了扣除交易成本与推理开销后,长思考链能否真正带来更优的投资回报。
针对流式视频理解评估中忽视证据生效时机、视觉历史维护机制及响应触发条件等问题,研究人员提出了条件感知基准与评测框架 TRACE。该框架结合了带有时序审计的视觉任务,将证据时机与指令依赖条件显式化,从而精准区分模型在不同工作负载和运行机制下的真实表现与失败模式,为流式多模态模型提供了更严格、细致的动态评估标准。
针对“系统一”单次前向决策模型(如 Laya)在面对信息缺失时倾向于盲目猜测的问题,研究人员提出了 LAVOIR(带信息价值路由的 Laya)。该方法将候选缺失信息槽位直接置于输入端与选项并列,使得模型在单次前向传播中不仅能输出决策分布,还能同时计算每个槽位对正确决策概率的预期增益,从而教会模型在何时以及主动询问何种关键信息。
现有如 SnapKV 和 PyramidKV 等 KV Cache 驱逐方法通常仅根据观察窗口内的平均注意力权重对 Token 进行排序。该研究提出了一种统一评分机制,引入了窗口查询中的注意力离散度以及相对于已选 Token 的冗余度惩罚,在无需额外前向传播的情况下平衡相关性与多样性。同时,研究还探索了随网络深度变化的分层评分系数配置,以优化大模型长上下文推理时的缓存保留效果。
针对东南亚语言多样性强但多模态数据与算力资源匮乏的问题,研究人员推出了专为该地区设计的紧凑型多模态图文嵌入模型SEA-CLIP-Tiny。该模型参数量不足5000万,采用类似CLIP-KD的知识蒸馏框架,结合区域数据整理与多语言教师模型指导,在7种东南亚语言的跨语言图文检索实验中展现出高效的嵌入表现。