跳到正文
9月29日周二
  1. OpenAI 官方动态79

    OpenAI 推出 GPT-6.1 Sol 模型

    OpenAI 推出 GPT-6.1 Sol 模型,在编程、计算机使用(computer use)与专业工作任务中提供接近 Astra 的智能水平。该模型的标准 API 输入和输出 token 价格为 Astra 的五分之一。

    推荐理由:原文对比了该模型在编程与计算机操作中接近 Astra 的表现及五分之一的 API 价格。

  2. Apple Machine Learning Research44

    大语言模型树结构表达式序列化的往返研究:通信瓶颈

    研究提出往返评测协议,揭示大语言模型将树状结构表达式序列化为自然语言时存在显著的信息损耗与不对称性。在 16 个模型的成对评测中,调换生成与抽取角色导致准确率波动高达 60.4 个百分点,且至少 73.6% 的失败源于生成端。该通信能力可通过微调改善,约 3600 个训练样本即可使开源模型表现超越未经训练的 Gemini-3.1-Pro。

  3. AWS 机器学习66

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 的 Grok 4.7 模型现已正式上线 Amazon Bedrock,提供 500K token 上下文窗口并支持 low、medium、high、xhigh 四档可调推理力度。该模型支持文本与图像输入,通过跨区域推理配置文件提供服务,同时兼容 OpenAI SDK 与 AWS Converse API,并集成了提示词缓存、Guardrails 和结构化输出等功能。

    推荐理由:原文详细说明了 Grok 4.7 在 Bedrock 上的推理配置与 API 调用方式,读者可以据此评估长链路智能体与代码任务的接入成本。

  4. Microsoft Research32

    微软亚洲研究院(新加坡)成立一周年:如何推进前沿研究、合作与人才发展

    微软亚洲研究院(新加坡)在成立一周年之际,展示了其连接前沿 AI 研究与新加坡创新生态的最新进展。该实验室聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及人才培养四大支柱。目前正与当地高校、政府机构及医疗、金融等行业伙伴合作,加速多模态医疗 AI 与自进化诊断智能体等技术的实际场景落地。

  5. GitHub Blog · AI 与安全74

    GitHub 团队分享如何用开源 AI 安全智能体挖掘 24 个 Android 漏洞

    GitHub Security Lab 介绍了利用开源 Taskflow Agent 审计 Android 应用并挖掘出 24 个漏洞的实践方法与案例。研究人员通过拆分识别入口点与定向排查漏洞两类 YAML 提示词工作流,成功发现了 OsmAnd 隐私追踪和维基百科应用账户接管等高危漏洞。

    推荐理由:文章分享了利用分步任务流引导大模型挖掘移动端漏洞的实操流程,并客观指出了模型评估漏洞严重性时的局限。

  6. Claude Code 更新67

    Claude Code v2.1.284 发布

    Claude Code 正式发布 v2.1.284 版本,新增对 Claude Sonnet 5.5(1M 上下文,输入与输出价格为 $2/$10 每百万 token,缓存读取为 $0.20 每百万 token)的支持。

    推荐理由:该版本为 Claude Code 引入了 Claude Sonnet 5.5 支持与默认自动权限模式,便于开发者了解其最新交互逻辑和配置变更。

9月28日周一
  1. CNCF Blog71

    Stacklok 开源云原生 Agent 框架 Mecatl

    Stacklok 宣布开源云原生 AI 智能体框架 Mecatl,将核心 Agent 循环与客户端、执行环境、工具系统及会话存储解耦,支持在 Kubernetes 等分布式环境中弹性部署与滚动更新。

    推荐理由:文章阐述了将智能体运行循环与执行环境和会话存储解耦的云原生架构设计,为大规模多租户部署提供了工程参考。

  2. Hugging Face74

    H 公司发布通用计算机操作智能体模型系列 Holo4 与 Holotron4 Nano

    H 公司正式发布 Holo4 系列通用计算机操作智能体模型,推出 27B 稠密与 35B-A3B MoE 两个版本,并同步开源适配 Nemotron 3 Nano Omni 的 Holotron4 Nano。

    推荐理由:该系列模型统一了图形界面、代码与API等多接口交互方式,展示了小参数模型在复杂桌面控制工作流中的落地路径。

  3. NVIDIA Developer Blog54

    NVIDIA DSX MaxLPS 如何提升 AI 工厂吞吐量与能效

    NVIDIA DSX MaxLPS 采用受策略管控的功率共享机制,在参与资源间动态分配电力以最大化 AI 工厂的吞吐量与能效。传统 AI 工厂通常按照所有 GPU 达到峰值功耗的极端场景进行供电配置,导致正常运行期间存在大量未充分利用的保护性冗余;该方案旨在释放闲置电量并支持部署更多算力资源。

  4. Apple Machine Learning Research34

    联邦变分不等式的更快收敛速率

    针对联邦随机变分不等式优化中收敛速率的差距,研究建立了更紧致的收敛保证并提出新算法 LIPPAX。研究证明经典 Local Extra SGD 算法在精细分析下具备更紧致的保证,同时指出了其易引发过度客户端漂移的缺陷。新提出的 LIPPAX 算法有效缓解了客户端漂移,并在有界 Hessian、有界算子及低方差等场景下取得了更优的理论保证。

  5. Cloudflare Blog · 网络基础设施69

    Cloudflare 2026 年度创始人公开信:自动化流量已超人类流量,AI 智能体正重塑网络生态

    Cloudflare 联合创始人 Matthew Prince 发布 2026 年度公开信,指出在 AI 智能体与爬虫推动下,自动化网络流量已在 2026 年 5 月超越人类流量,并预计未来 5 年内达到人类流量的 1000 倍。

    推荐理由:原文基于平台数据揭示了自动化流量已超人类流量的转折点,读者可据此理解智能体普及对网络生态与流量成本的影响。

9月26日周六
  1. GitHub Blog · AI 与安全70

    GitHub Copilot 教程:如何使用画布构建自定义工作流

    GitHub Copilot 现支持通过 /create-canvas 技能利用自然语言描述直接生成双向交互画布,用于搭建看板、Issue 分流板或发布清单等工作流界面。用户与 AI 智能体可以实时共享并修改画布状态,无需手动编写布局代码即可同步更新数据。生成的画布支持保存为扩展在团队内复用,社区也已在 Awesome Copilot 中提供了一系列开箱即用的预设模板。

    推荐理由:文章介绍了用自然语言生成双向交互界面的方法,开发者可据此将单向命令交互改造为可实时协同的看板工作流。

  2. AWS 机器学习59

    AWS 解析 NarrateAI 生产级大模型质量保证架构

    AWS 介绍了基于 Amazon Bedrock 构建的商业智能 Agent NarrateAI 的五层质量保证架构。系统通过自适应路由分流单次与并行调用、跨账号多模型故障转移化解 API 限流,并采用段落级流式并行评估使首内容延迟降低 86.8%。在两阶段级联数据校验的配合下,系统在约 13 秒内启动流式响应的同时实现了 99.3% 的数字准确率。

9月25日周五
  1. Ollama 更新69

    Ollama v0.40.0 发布:Apple Silicon 设备默认采用 MLX 运行时

    Ollama 发布 v0.40.0 预发布版本,在 Apple Silicon 设备上默认通过 MLX 运行时加载并运行受支持的模型架构。团队在预发布期间将持续测试并启用更多模型架构,支持通过标准命令拉取和运行 Qwen3.8 等模型。

    推荐理由:Ollama 在苹果芯片上默认启用 MLX 后端,读者可据此了解本地模型在 Mac 上的推理路径变化与适配规划。

  2. GitHub Blog · AI 与安全33

    GitHub 如何通过交付更多 CSS 提升网站性能

    GitHub Primer 设计系统将全部组件从 CSS-in-JS 迁移至 CSS Modules,通过移除客户端与服务端运行时开销显著提升页面性能。截至 2024 年 12 月完成全量迁移后,页面服务端渲染耗时减少了 55%,组件初始化时间缩短了 25%。团队采用特性标志(feature flag)进行渐进式灰度发布,并通过过渡封装库兼容存量 sx 属性以降低迁移风险。

  3. GitHub Blog · AI 与安全65

    GitHub 探讨 AI 交互界面:为什么对话框往往不是最佳选择

    GitHub 官方博客探讨了纯对话框作为大语言模型主要交互界面的局限性,并介绍了 GitHub Copilot app 中的 canvas 功能。Canvas 是运行在 Copilot 内部的全栈应用界面,支持与 Copilot agent 进行双向通信并在本地执行代码。作者指出,让智能体构建可视化工具而不是在聊天框中处理所有琐碎指令,能有效避免 token 浪费并更好地自动化开发流程。

    推荐理由:文章探讨了纯聊天框在智能体交互中的局限,展示了用自定义全栈界面替代重复对话来降低 token 消耗的方法。

  4. Google Research64

    Google 提出 AI 视频联合导演框架,推进长时长连贯视频生成

    Google Research 推出一套面向长时长叙事视频的多智能体框架体系,涵盖 Co-Director、CANVAS、A²RD 和 VQQA 四项核心研究,旨在解决视频扩散模型在多镜头场景中的语义漂移和级联错误。

    推荐理由:Google 将长视频生成解构为多智能体编排与世界状态追踪,提供了解决多镜头叙事中角色与场景漂移的成套系统方案。