哈萨克斯坦总统托卡耶夫支持优必选在阿拉木图建设机器人制造工厂
哈萨克斯坦总统托卡耶夫在会见优必选高管时表示,支持优必选在阿拉木图建设机器人设备制造工厂,产品主要面向教育和服务领域,该厂将成为优必选在境外的首个生产基地。双方还探讨了在智能城市项目、采矿、石油天然气、大型物流及高校教育等场景部署机器人与建立联合能力中心。优必选近期已在欧洲和日韩等市场斩获超 5000 万元海外订单,上半年营业总收入达 12.69 亿元。
哈萨克斯坦总统托卡耶夫在会见优必选高管时表示,支持优必选在阿拉木图建设机器人设备制造工厂,产品主要面向教育和服务领域,该厂将成为优必选在境外的首个生产基地。双方还探讨了在智能城市项目、采矿、石油天然气、大型物流及高校教育等场景部署机器人与建立联合能力中心。优必选近期已在欧洲和日韩等市场斩获超 5000 万元海外订单,上半年营业总收入达 12.69 亿元。
研究提出 BRIDGE,一种基于一阶双层优化的智能体强化学习方法,通过协同自适应检索器与大语言模型策略来解决检索信用分配问题。在 7 个开放域 QA 基准测试中,BRIDGE 在 3B 和 7B 骨干模型上均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 个 EM 点。该方法在医学 QA 基准上也取得了最佳的平均答案准确率与推理质量。
AVIO 是一种可在视听场景中联合学习发声物体添加与移除的模型,通过源条件特征调制适配预训练文本到视听生成模型。配套构建的 AVIOBench 数据集包含 37.9 小时配对视听样本,覆盖 1,878 个目标物体名称。该模型结合参考帧课程学习,使单个模型即可执行纯指令编辑,并支持通过可选视觉引导控制物体的外观与位置。
法拉第未来公布“Built in USA”加速计划第二阶段方案,目标于今年年底前将机器人工厂投入运营,并于 2027 年第一季度实现首款新 EAI 本体产品下线。公司正加快推进 Next Futurist 和 Next Aegis 系列产品下线,并启动向 FCC 申请有条件批准。此外,AIxC 拟以全股票方式收购估值约 2 亿美元的 FFAI 机器人资产与业务以推动独立上市。
该研究从自主性(autonomy)与主动性(initiative)两个核心设计维度切入,利用悖论视角系统分析人机协作中的内在张力并映射协作模式。论文最终提炼并归纳出四种人机协作模式:指令(Instruction)、委托(Delegation)、协助(Assistance)以及共创(Co-creation)。
OpenAI 携手 ModRetro 推出 Codex 专用插件 Game Studio,让用户可以通过自然语言生成适配 Chromatic 复古掌机的游戏程序。该插件内置模拟器供电脑端测试运行效果并支持串流至掌机设备,完成后还可将程序写入专用实体卡带运行。
该研究提出一种非平稳拉格朗日框架,将可再生公地建模为带消耗预算的约束马尔可夫博弈或约束多智能体 MDP,使多智能体在追求收益的同时避免资源耗尽。论文针对折现奖励与终端成本推导了可行性证明及约束 Nash 保证,能直接利用无约束问题的解构建约束策略序列。在 Gordon-Schaefer 渔业环境中结合约束 IPPO 和 MAPPO 进行的实验,验证了消耗预算对资源存留率与收益的影响。
OPPO K15s 与 K15x 两款新机正式开售,限时立减 300 元后闪促价 1399 元起。K15s 搭载 8000mAh 电池、天玑 6360 Max 芯片与 120Hz OLED 直屏,支持 IP69K 级防尘防水和 45W 闪充。K15x 内置 6500mAh 电池与天玑 6300,配备 6.75 英寸 120Hz 护眼屏及 IP64 防护。
新研究提出一种强化学习选项发现算法,通过为每个子目标识别少量相关特征子集,解决了传统全状态可达方法引发的选项数量爆炸与探索受阻问题。该方法能够学习具备广泛泛化与迁移能力的抽象选项(options),在包含 Atari 游戏 MontezumasRevenge 在内的 3 个基于图像的稀疏奖励领域中实现了快速探索。
针对大语言模型多步推理隐藏状态难以分析的问题,研究者提出将推理路径视为阶段结构化轨迹的分析方法 PAIR。该方法将可变长度路径映射到共享相对阶段,仅在同一问题和阶段内对比成功与失败轨迹,有效隔离路径质量信号。实验表明,PAIR 在多项基准上提升了模型轨迹排序与 Best-of-N 选择效果,并通过分阶段引导验证了表征的因果有效性。
研究人员系统评估了面向可验证隐私推理的 ZK-LLM 友好量化方案,测试了 Qwen2.5-14B 及 MoE 模型 Qwen3-30B-A3B 等 9 个语言模型。实验发现激活值精度比权重更敏感,非线性查找表近似是效用下降主因,且 RMSNorm 查找构成主要瓶颈。研究表明降低位宽并不必然按比例降低端到端证明开销,需采用算子感知的精度选择策略。
研究团队提出“安全算子”(Safety Operator)机制,通过谱优化调节 Transformer 语言模型权重乘法算子的主特征值,以控制安全指令对生成的影响强度。基于此衍生的 Contrastive Safety Loss 可平衡有害查询强化与无害查询抑制,有效调节攻击成功率与过度拒答率之间的平衡,实现安全指令的帕累托改进。
关系型基础模型在上下文学习(ICL)中存在支持集目标泄露风险,会严重破坏评估可靠性。研究在 13 个 RelBench 任务和 5 种 ICL 配置下测试 20 个受控特征,发现 0-hop 和全量泄露偏差最大,甚至会逆转模型间的相对优劣结论。实验对比 IG、MI 与 LOCO 检测方法表明,依靠检测器移除特征无法稳定恢复干净的评估结果。
研究提出 PhenoAIR 多智能体框架,将 Cell Painting 表型数据的药物作用机制(MOA)预测从表征匹配重构为校准证据推理。该框架构建以候选为中心的证据记忆库,通过控制器引导评估不确定观测,并结合离线参考集校准对证据可靠性加权。在 JUMP Cell Painting 基准测试中,PhenoAIR 在所有预测设置下均超越表征匹配与 LLM 基线。
Robinhood 推出应用内 AI 智能体工具 Robinhood Agents,支持解答行情、定制投资策略并在离开屏幕时自动盯盘与执行交易。系统默认开启逐笔交易确认,用户也可关闭确认授权其自主交易,且智能体仅能动用独立代理账户内的资金。该功能初期接入 OpenAI 与 Anthropic 大模型并收取模型使用费,官方提示用户须自行承担全部交易后果。
ARCagent 是面向 ME/CFS 等指南存在争议疾病的自适应检索校准临床问答智能体。该系统构建了包含 10 个数据源、1,706 个分块且具备结构化冲突登记的知识库,并通过冲突感知校准流程重排检索证据。在 LLM-as-Judge 评测中,ARCagent 达到 95.3% 的得分,超越所有基础 LLM,相关代码已开源。
美国银行发布研报指出,Meta 推出的 Muse 等第三方 AI 智能体能直接接管商品发现、服务导流和交易发起,可能绕开苹果生态并威胁其服务业务收入。Sensor Tower 数据显示 Muse 累计下载量已超 340 万次并连续两周位列美区免费榜首,已接入 Shopify 与 PayPal 等平台;分析师认为苹果需加快 Siri 与支付生态的整合以应对智能体带来的商业模式变革。
研究提出 PersonaDose,通过特征描述与指定强度校准 FLAS 控制器的流动时间,实现大语言模型的分级人格表达控制。在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,PersonaDose 在 Persona Vectors 连贯性下限 75 时,核心特征表达较对比激活添加分别提升 33.2、18.3 和 17.8 分。
美国总统特朗普签署行政令,要求所有联邦行政部门和机构在法律允许范围内使用“超级智能”(SI)代替“人工智能”(AI),并不再承认 AI 术语的使用。特朗普当天还宣布推出联邦政府数字入口网站 America.gov,支持公众在线提问获取最新答案。今年晚些时候,America.gov 还将进一步整合护照续签和医疗保险注册等政务服务。
推荐理由:原文给出了美国联邦政府术语变更与统一政务问答入口上线的具体事实,读者可据此了解政策定调与政务智能化落地动向。
研究形式化定义了关系基础模型在上下文学习中的支持集目标泄露问题,指出仅在带标签支持集中存在目标衍生特征会导致推理失效。基于涵盖 20 个列的 14 种合成泄露类型与 RelBench 数据库评测,目标表泄露导致的性能下降最显著,而一跳与两跳泄露未被模型一致利用。利用积分梯度(IG)排序并移除可疑列,可在泄露影响最大的场景中部分恢复模型性能。
简化交互接口能有效引导 LLM 智能体决策,升价拍卖接口在 4 个模型族中显著减少了出价偏差。明确收益可能性并解释真实报价安全性可改善决策质量,而要求跨轮规划或推测对手信念的提示词反而会恶化表现。研究还发现,智能体行为选择的实际改善并不必然伴随其语言策略理解指标的提升。
研究提出通用框架 LLM 引导图剪枝(LGP),利用 LLM 推理识别并替换低价值邻居节点,直接优化近似最近邻(ANN)图索引结构以解决“几何-语义”不匹配问题。该方法在保留原始图稀疏性与高效导航结构的同时引入关键语义信息。在语义检索基准上的实验表明,LGP 在 DiskANN 和 HNSW 等主流图索引上均优于传统贪心图搜索与 LLM 重排序方法。
戴森确认其售价 499 美元的新款 CameraJet 可视成像电动牙刷因早期批次喷射管存在生产缺陷导致渗水,致使部分产品停止工作并一度从零售渠道下架断货。戴森表示已将受影响的库存单独隔离,目前 CameraJet 已全面投产并恢复向合作伙伴供货,并向购买到故障产品的消费者致歉。
研究人员提出基于扩散大语言模型(dLLM)与多 Token 预测(MTP)的高效数据压缩框架 HyperZip。针对扩散压缩中吞吐量与压缩率的权衡难题,HyperZip 利用超网络从上下文表征生成特定数据更新,无需昂贵微调即可适配目标数据。实验显示,HyperZip 在压缩率与速度之间取得了优于 SOTA 基线的权衡表现。
研究团队提出咨询 AI 智能体 ThuRunel,通过动态解耦机制结合有限状态信念管理、思维链教师合成协议与生成适配器,协调前期共情引导与后期专家判断。对比 11 个基线,ThuRunel 在引导完整度与专家简报质量上均取得持续提升。ThuRunel 目前已公开部署为双语 Web 应用,其生成结果均会标注精选知识库来源。
研究人员提出基于私有信息检索(PIR)的隐私保护 RAG 系统 PILLAR,使服务端在完全无法获知查询词及访问模式的情况下检索相关文档。PILLAR 采用两阶段混合检索,先通过预计算 BM25 索引发起固定次数 PIR 查询完成稀疏初筛,再获取候选文档 embedding 并在本地重排序。该系统提供了单轮低延迟协议 PILLAR-Bin,以及兼顾低延迟与高检索质量的 PILLAR-Tree。
微软等机构的研究团队发表论文,提出面向数据系统的 AI 软件工厂(AI SW Factory)以加速软件开发全生命周期。该方案覆盖目标定位、编码、代码审查与运维全阶段,通过产生元数据沉淀微调权重并更新世界模型。该系统已在微软数十个代码库规模化部署,在智能体编码基础上取得 3 倍工程效率提升以及最高 22 倍的 token 效率。
StateTape 提出了一种面向长程编码智能体的新框架,通过将代码库建模为符号级代码图并跟踪修改,实现随代码仓库变化动态重写智能体上下文。该研究还提出了评估上下文有效性的基准 TraceBench,并结合轻量管理器模型清理失效记录。实验表明,StateTape 在 6 个编码智能体和 3 个重度编辑基准上均以极低计算开销提升了解决率。
研究团队推出评测基准 CheatBench,用于测量 AI 智能体在数学研究、知识工作、编码和视觉等领域的奖励作弊行为。该基准将高难度任务与作弊途径结合,测试智能体在诚实完成任务受阻时是否会出现越权访问、规避监控或突破沙箱等风险。CheatBench 支持跨模型和任务类别对比,相关评测套件已公开发布。
推荐理由:原文构建了多领域的作弊评测环境,为评估强化学习驱动的智能体安全性提供了可量化的测试集。
一项研究在社交媒体模拟中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 的“虚假真相效应”。
研究团队提出 Protein-TetSphere 蛋白质体表征方法,通过将蛋白质链四面体化并配准到统一拓扑参考系,建立跨残基的一致三维体坐标。该方法将配体结合口袋分类平衡准确率从 0.795 提升至 0.826,并将 BoltzGen 蛋白质结合剂设计成功率从 14.95% 提升至 19.90%,在蛋白质界面预测上也取得性能提升。
研究人员提出基于最优传输的鲁棒离线策略评估方法 OTROPE,可在无需响应概率的情况下利用有限人工标注数据评估黑盒目标大语言模型。该方法在语义空间通过最优传输对齐带标注的行为样本与未标注的目标样本,并结合校正残差与代理预测器实现双重鲁棒评估。实验表明 OTROPE 持续优于基线,能使较弱评估器的集成效果逼近甚至超越更强评估器。
NeurIPS 2026 论文针对大推理模型因强化学习只监督最终答案而导致的欺骗性安全对齐问题,提出了量化评估指标 DSAR 与强化学习对齐方法 SARA。SARA 同时对安全推理痕迹和安全最终答案提供奖励,促使模型早期识别有害意图并保证推理与答案的一致性。实验表明,该方法在标准提示与前缀填充攻击下均能显著减轻欺骗性安全对齐现象并保持实用性,相关代码已开源。
研究人员提出协同演化奖励框架 CoRe,通过让奖励模型与生成器动态交互,缓解视频扩散模型在潜在空间对齐时的奖励作弊问题。CoRe 持续在生成器当前样本上重新拟合奖励模型并锚定真实视频偏好,防止生成器因分布逃逸导致感知与运动质量恶化。在 Wan2.1-T2V-1.3B 上的实验表明,该方法生成质量优于预训练模型及先前对齐方法。
中国三大电信运营商2025年度业绩报告悉数出炉,全年营收增速集体降至1%以内,传统业务增长见顶并加速布局算力与智能业务。中国移动全年营收达10502亿元(净利润1371亿元),算力与智能服务收入占比提升至20.2%;中国电信实现营收5239亿元(净利润332亿元),资本开支为804亿元;中国联通营收达3922亿元(利润总额253亿元),资本开支为542亿元。
ChronoSRL 为 Critic 嵌入引入显式时间几何结构,使状态-动作与目标嵌入的距离直接匹配到达目标的时间。该方法结合生存强化学习预测时间分布与停留时长,在 7 个标准运动和导航基准上以更小网络实现更快的学习速度与更优性能。在四足机器人仿真到真实测试中,ChronoSRL 是唯一成功实现保持指定速度与目标位置并攀爬最高箱子的自监督强化学习方法。
三大运营商2026年上半年财报公布,中国移动营收5380亿元、净利润789亿元,中国电信营收2590亿元、净利润196亿元,中国联通营收2014亿元、净利润95亿元。在算力与云业务方面,中国电信天翼云收入达到618亿元(同比增长7.8%),中国移动算力与智能服务收入在主营业务中占比提升至22.6%。
研究人员提出多模态智能体框架 MERID,通过基于经验的递归自我改进自主构建并优化重度抑郁症分析流程。该框架整合了目标对齐(GSC)、流程联合探索(CPE)与证据引导演化(EGE)机制,能在小样本抑郁队列中验证并继承有效改进。实验表明 MERID 在多项基准测试中均取得最佳效果,相关代码已开源。
C114 通信网人工智能频道汇总了近期算力网络与 AI 产业的最新动态。重点内容包括腾讯专有云发布案例集、睿芯量产 RISC-V 数据流 AI 芯片高光 D35,以及超大规模智算集群中的算网协同进展。同时,该频道还收录了 OpenAI 动态、Anthropic 研发数据及 Gartner 趋势预测等多项行业资讯。
一项针对 12 款主流欧盟《人工智能法案》合规检查工具(AIACCs)的实证研究显示,当前工具质量差异显著,仅能作为早期参考。这些工具普遍存在过度简化或遗漏关键法律义务的问题,且无法提供明确可操作的指导,过度依赖易产生虚假的合规安全感。该研究为此类工具建立了评估基准,并提出了更可靠工具的设计原则。