OpenAI 搁置 GPT-6.1 Astra,Sonnet 5.5 进入免费层,Codex Pro 用量减半回归,Thariq 支持 AGENTS.md
OpenAI 因未达到范围授权与防欺骗等安全标准,搁置了原计划 10 月上线的 GPT-6.1 Astra。与此同时,Anthropic 发布 Claude Sonnet 5.5,推理速度较 Sonnet 5 提升超 30%,每百万 token 定价为输入 $2、输出 $10。
OpenAI 因未达到范围授权与防欺骗等安全标准,搁置了原计划 10 月上线的 GPT-6.1 Astra。与此同时,Anthropic 发布 Claude Sonnet 5.5,推理速度较 Sonnet 5 提升超 30%,每百万 token 定价为输入 $2、输出 $10。
一目科技通过“光触觉”路线与超薄仿生触觉传感器 SENTRA T0,为具身智能机器人补齐精巧操作所需的触觉感知。SENTRA T0 厚度在 3 毫米以下,在指尖大小面积布置了 24 万个感知点,测力精度达约 5mN 并支持侧向摩擦力感知。该方案通过光探测柔性材质形变反算受力,破解了灵巧手“装不下”及物理触觉数据匮乏的难题。
一项试点研究评估了结合情境化反馈与示范演讲的 AI 演讲指导系统,结果显示其能有效提升演讲表现,使参与者焦虑水平下降 15.3% 至 34.4%。该系统将演讲情境纳入评估标准以提供定制反馈,并生成文本与音频格式的改进示范演讲。在 7 名本科生历时 1 至 3 周且至少练习 3 次的测试中,所有受试者表现均获改善且填充词使用减少。
CHESTPHENOT 是一款 0.5-3B 参数的语言模型,可从放射学报告联合提取发现标签、三分类状态及逐字支持证据片段。其 3B 版本经混合监督、SFT 与轻量 GRPO 训练,跨机构检测 F1 优于 CheXbert 2.0 分,超 99% 证据可在原文定位。
研究者提出无需提示词和训练的白盒有向溯源方法 Witness Overlap,通过引入同家族第三个检查点作为见证者比较局部几何特征,用于判定开源权重模型检查点之间的衍生先后顺序。在 16 个家族的 176 个 LLM 检查点评测中,该测试利用 Frobenius 余弦正确判定了 95.3% 的父子关系方向。该方法还可泛化至 VLM 与扩散模型家族,且对权重噪声和稀疏剪枝表现出鲁棒性。
研究人员提出了一种基于文献引导与描述符的成分搜索空间过滤框架,利用科学文献训练的词嵌入模型选择描述符并构建 Pareto 过滤器。在多项性能指标评测中,该框架平均过滤掉了 74.27% 的候选成分,相对实验测量的平均最佳值误差仅为 1.93%。相比专家选择与随机描述符,该方法能更可控地平衡保留比例与误差,有效保留高性能成分。
该研究提出了一套人机协作实用设计框架,旨在为人与组织构建以人为本且负责任的协同模式。该框架综合考量人类、AI 系统、任务、组织及社会环境等要素,阐明了有效协作所需条件与设计决策。文中还结合协作机器人(cobot)装配系统用例,展示了如何将设计需求转化为具体协作功能并进行评估。
研究提出基于大语言模型的 AI 智能体 CP-Agent,能够根据自然语言任务自主执行完整的晶体塑性(CP)建模工作流。CP-Agent 基于 ReAct 范式运行,通过类型化工具定义、调度分发器与安全迭代循环自主规划工具链,并将数值搜索委托给既有优化器。在 316L 不锈钢参数校准、铜基准验证及镁合金多道次轧制等 4 个案例中,该智能体均能稳定推断执行序列并交付具备物理可解释性的结果。
SMARtCARE 提出了一种包含稳定、元认知、辅助和监管四状态的临床决策支持架构,利用患者既往轨迹的有损六通道指纹检测早期生命体征异常。当监测漂移匹配指纹时,系统会触发元认知升级提醒,仅在医生介入的辅助状态下才完整检索病历。在 MIMIC-III 与 MIMIC-IV 演示数据评估中,所有记录决策均实现完全可追溯与正确归属。
研究人员提出开放集联邦主动学习框架 FIDAL,结合全局-局部证据不确定性、支持集多样性加权与自适应 OOD 拒绝机制,无需手动调参即可排除无关离群样本。在三个多中心医学影像基准测试中,FIDAL 平衡准确率最高提升约 12 个百分点,相同预算下对 OOD 样本标注消耗减少至少 1.3 倍,在乳腺摄影任务中节省 7-29 小时专家阅片时间。
该研究提出对称商平坦度理论,建立了从商线性稳定性、商平坦度、输入平滑度到泛化的理论链路。针对传统平坦度缺乏对称不变性的缺陷,论文将商平坦度定义为正则商流形上经验损失 Hessian 的迹,证明线性化 SGD 的商线性稳定性可由 batch size 和学习率显式约束,并在局部覆盖假设下推导出总体泛化界。
研究人员推出急诊轨迹模拟器闭环评测基准 EDSim-Bench,基于 425,028 条 MIMIC-IV-ED 记录及 MC-MED 外部验证,并开源了评估协议与评分代码。
研究人员提出分层规划框架 Metro-WM,通过从先验经验中检索真实状态而非生成未落地的隐向量来设定子目标,解决了 JEPA 长程规划中子目标物理不可实现的问题。实验显示,Metro-WM 的长程成功率比次优分层方法高出最多 37.33 个百分点,速度提升最高达 10.9 倍,离线计算量减少 13-56 倍。该方法支持偏航即时重规划,并在极稀疏数据下保持稳健。
一项针对大语言模型方言越狱机制的消融研究表明,方言表层形式并非高攻击成功率的关键,策略库表现力才是主要驱动因素。测试中未优化的普通话与方言翻译攻击成功率均低于 8%,而采用优化器控制策略库后攻击成功率达到 98%-100%。文化中立的通用策略库同样能达到该上限,方言选择则主要影响查询效率与响应严重程度。
针对 IMU 数字笔在成人与儿童间因书写习惯差异导致的泛化难题,研究团队提出了一种基于时间卷积网络(TCN)与多预测头的跨领域笔迹重建架构。该方法通过共享特征与领域特定头捕捉不同年龄段的运动特征,无需用户个性化适配即可直接部署在笔端。该设计改善了传感器轨迹重建表现,并实现了两类人群数据的跨域互益。
标注重叠稀疏度是导致大语言模型裁判(LLM-as-a-judge)部署决策错误的首要因素:在成对重叠率仅为 5% 时,错误决策率达 25%,从 10 个候选者中选错最佳裁判的概率达 65%。研究推导公式证明 $\rho \geq 0.25$ 即可满足非边界裁判验证,其零成本分层分配方案较随机抽样将错误拒绝率减半,并在 10 个 LLM 裁判上完成验证。
一项针对印度政府监管文件 RAG 的析因研究评估了 3 种解析器、3 种分块策略、5 种稠密嵌入及 BM25 共 54 种检索配置(涵盖 800 个问答)。结果显示没有单一检索器能全面占优,解析器与分块交互显著,且 MPNet-base 在表格问题上严重失效。语料证据保留率超 98% 表明差异主因是排序质量而非摄取损失;评测框架与基准已开源。
研究人员提出一种在静默自由度中回放的机制,通过隔离规则将更新限制在当前输入未激活的隐藏突触中,实现无离线阶段的持续学习。在类增量 split-MNIST 评测中,系统在无离线阶段下达 91.6±0.3% 准确率,单次遍历以 91.8% 超过 DER++(90.1%)。该机制引入不应期旋转规则扩大巩固集合,亦适用于带 k-WTA 隐藏层的反向传播网络。
研究人员提出基于叠加原理的深度神经算子 SDNO,将基于 Transformer 的 Calculate Net 与 Super Net 结合,用于预测涡轮端壁气膜冷却温度场。该方法利用有符号距离函数 SDF 编码孔位,仅用 1-5 个气膜孔样本训练,即可准确预测未见过的 10-20 个孔布局效果,精度优于全监督基线。
麻省理工学院教授 Sherry Turkle 出版新书《Artificial Intimacy: Who We Become When We Talk to Machines》,指出过度依赖 AI 聊天机器人正在损害人类的心理发展与真实社交能力。
该研究提出一种结合 7B 至 32B 参数本地开源大语言模型与可复用提示词策略的本体学习流程,用于从非结构化文本中抽取实体与关系、生成 RDF 三元组并构建 OWL 本体知识图谱。在 80 份电网事故私有报告上的实验表明,Schema 引导提示词显著提升了抽取质量,量化模型有效平衡了性能与计算成本。
研究人员提出分层评测基准 DriveHierarchy,将基于 VLM 的自动驾驶能力划分为感知定位、上下文记忆、思维推理与闭环执行四级架构。该基准整合开源数据集构建出包含 84,279 帧和 76,798 个问答对的开环评测,并基于真实路网开发出包含 100 个交互场景的闭环仿真平台。在 15 个 VLM 上的实验表明,该基准能有效关联开环理解与闭环驾驶表现,为模型诊断与优化提供依据。
EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。
研究人员提出一种确定性多数据集谓词框架,可从几何、运动学与地图等数据推导驾驶场景语义,并在 nuPlan 与 nuScenes 数据集上构建通用谓词知识图谱(Predicate KG)。
研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。
研究人员提出免训练的 MoE 大语言模型压缩框架 OMP-MoE,通过正交匹配追踪算法将专家剪枝转化为稀疏信号重构任务。该方法在 Qwen、DeepSeek-V2、GPT-OSS 和 Mixtral MoE 的 25-50% 剪枝率测试中均优于现有方案。针对 Qwen3-30B-A3B 进行 50% 压缩时可保留 93.3% 性能,并实现 33x 搜索加速与 1.55x 推理加速。
该研究提出了一种用于消费者投诉评估的统一框架,使用 Transformer 分类器将负面情感量化为有界连续变量,并基于 Beta 分布建模其整体分布特征。研究结合涉案金额与公司响应结果,通过 Kullback-Leibler 散度和平方 Hellinger 距离构建异常诊断机制。
MIT 研究人员指出,“算法单一文化”的影响取决于应用领域与算法准确度本身,此前针对其会造成“系统性排除”等主要反对意见并不具有决定性。研究通过数学证明单一文化易产生信息回音室并阻碍探索,但将多种招聘算法打包为单一集成(ensemble)模型可克服该缺陷,其表现甚至可媲美或超越多元算法。
ColorOS 17 统一了第一方应用的凝光视效设计语言,引入细粒度受力反馈流体动效,并优化了后台留存与续航表现。小布 AI 升级了呼出动画,搭载 PersonaX 记忆共生引擎以实现系统级偏好学习,提供小布空间主动提醒、多模态对话与 AI 自动执行能力。但在暗色模式质感、基础应用开启曲线等细节上仍存在待优化空间。
NVIDIA 推出开源智能体安全平台 Open Agent Safety Platform,包含开源运行时 OpenShell 0.1.0 及基于 BlueField-4 DPU 的硬件级安全扩展 NVIDIA Sentry。
推荐理由:原文给出了开源沙箱与DPU硬件协同防御的具体机制,读者可据此了解防范智能体越权调用的工程架构。
AMD 宣布签署协议,将以 82 亿美元全股票收购李飞飞创办的空间智能公司 World Labs,交易预计 2026 年底前完成。交易交割后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报,联合创始人 Justin Johnson 和 Ben Mildenhall 则带领团队并入 AMD 组建前沿 AI 研究组织。
推荐理由:芯片巨头通过并购前沿空间模型团队切入物理世界模拟与具身智能负载,反映出底层硬件与三维生成架构深度绑定的趋势。
9 月 28 日,荣耀发布 Magic9 系列手机与 MagicPad 4 等新品,鸿蒙智行推出新能源 SUV 智界 RX 并开启享界 V8 预购。AI 领域方面,Anthropic 上线 Claude Sonnet 5.5,AMD 宣布拟以约 82 亿美元全股票收购 World Labs,Manus 亦推出搭载 Cascade 框架的 Manus 2.0。
OpenAI 推出名为 dots 的主动式助手,可在复杂项目与日常任务中持续推进工作。它旨在帮助用户在任务不断向前推进的同时始终保持掌控。
研究提出往返评测协议,揭示大语言模型将树状结构表达式序列化为自然语言时存在显著的信息损耗与不对称性。在 16 个模型的成对评测中,调换生成与抽取角色导致准确率波动高达 60.4 个百分点,且至少 73.6% 的失败源于生成端。该通信能力可通过微调改善,约 3600 个训练样本即可使开源模型表现超越未经训练的 Gemini-3.1-Pro。
《麻省理工科技评论》针对美国南部边境虚拟监控系统展开圆桌讨论,指出耗资数十亿美元建设的监控塔(包含新型 AI 自动识别监控塔)未能履行搜救与安全承诺。调查记录了超过 1000 人在监控塔覆盖区域内穿行且未被及时施救而最终死亡,揭示了边境 AI 监控技术的系统性失效与严重人道危机。
xAI 的 Grok 4.7 模型现已正式上线 Amazon Bedrock,提供 500K token 上下文窗口并支持 low、medium、high、xhigh 四档可调推理力度。该模型支持文本与图像输入,通过跨区域推理配置文件提供服务,同时兼容 OpenAI SDK 与 AWS Converse API,并集成了提示词缓存、Guardrails 和结构化输出等功能。
推荐理由:原文详细说明了 Grok 4.7 在 Bedrock 上的推理配置与 API 调用方式,读者可以据此评估长链路智能体与代码任务的接入成本。
Anthropic 推出新模型 Claude Sonnet 5.5,运行速度提升超 30% 且多数任务成本降低最多达 30%,目前已作为 claude.ai 免费层的默认模型。作者实测显示其在部分编码任务上表现接近 Opus 5.5,但在最高思考强度下仍存在耗尽 128,000 tokens 的异常;此外官方宣布 Haiku 5.5 将在数周内推出。
推荐理由:原文展示了该模型下放至免费版后的实际性能与成本差异,有助于读者对比不同梯队前沿模型的编码能力。
AI 高密度动态负载正促使数据中心从单纯扩充容量转向系统级能效设计,强调供电、冷却、算力与运营的跨系统协同。行业平均 PUE 从 2007 年的 2.50 降至 2026 年的 1.52,新设施已常规达 1.3 或更低,评估体系正向涵盖 WUE、CUE、ERE、CPE 及电网感知运营(GAE)的多维框架演进。从设计初期兼顾全系统协同有助于降低运营成本并提升基础设施韧性。
微软亚洲研究院(新加坡)在成立一周年之际,展示了其连接前沿 AI 研究与新加坡创新生态的最新进展。该实验室聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及人才培养四大支柱。目前正与当地高校、政府机构及医疗、金融等行业伙伴合作,加速多模态医疗 AI 与自进化诊断智能体等技术的实际场景落地。
佛罗里达州总检察长正在寻求针对 OpenAI 的禁令,认为该公司缺乏妥善监管自身技术的能力。作者对此举表示支持并呼吁各州与国家跟进,以防范潜在的重大基础设施风险。此外,黄仁勋宣布推出 AI Agent Safety 平台,但其在解决联网通用智能体安全问题上的实际效果仍有待观察。