跳到正文
9月21日周一
  1. Hugging Face72

    Hugging Face 发布 tokenizers v1 候选版,编码吞吐提速 3 至 30 倍

    Hugging Face 推出分词库 tokenizers v1 发布候选版,在保持输出 token ID、词表与 API 完全兼容的前提下,单线程编码速度相比 v0.23 提升 3 至 30 倍。

    推荐理由:材料详细拆解了用 SIMD 位流替代正则、内存零分配合并与词缓存等工程设计,为大并发分词系统的性能调优提供了可迁移方案。

9月20日周日
  1. 腾讯混元 公众号49

    腾讯混元等提出 WebCraftBench:面向 AI 网页生成的实测评测基准

    腾讯混元团队联合清华大学、北京大学提出 AI 网页生成评测基准 WebCraftBench,引入代码覆盖率引导智能体实际操作网页,并从美观度、易用性和需求符合度三个维度打分。该基准包含 369 条真实需求与 5,088 条验收标准,在 17 个前沿模型实测中 Claude-Opus-5 综合排名第一,且在 197 组对比中与人类偏好的判断一致率达 85.3%。

  2. 阶跃 StepFun 公众号75

    阶跃发布旗舰模型 Step 5 Preview

    阶跃星辰发布面向 Agentic 任务的旗舰模型 Step 5 Preview,即日起全量开放 API 与在线体验,并定于 10 月 15 日正式释放模型权重。

    推荐理由:原文给出了稀疏架构与长程任务的具体指标,读者可以据此评估其在复杂工程与专业研究中的能效表现。

9月19日周六
  1. Claude Code 更新35

    Claude Code v2.1.277 发布

    Claude Code 发布 v2.1.277 版本,新增对 AGENTS.md 的支持,当项目中缺少 CLAUDE.md 时将自动读取该文件作为指令。新版本为 Claude apps 网关新增代理出口边界配置与自定义静态 headers 支持。此外,更新还修复了 Agent SDK 内部错误挂起、空文本块导致请求失败及多项界面崩溃问题。

9月18日周五
  1. GitHub Blog · AI 与安全52

    GitHub 播客拆解 AI 编程争议:从代码审查、Skills 与 MCP 到 RAG 的实际定位

    GitHub 官方播客发文针对五个 AI 热门争议给出务实分析:开发者仍需审查 AI 代码直至能对其负责,面试核心在于展示人机协作的判断力;Skills 与 MCP 并非竞争替代而是互补组合,前者提供流程与上下文,后者提供标准化接口工具调用,同时 RAG 依然是补充外部信息的关键支柱。文章强调,难以被 AI 理解的代码往往本身存在可维护性问题,开发者应结合实际工程需求灵活选用工具而非盲目跟风争论。

  2. Google AI36

    多位顶尖学者加入 Google“AI 与经济”研究团队

    Google 宣布扩建其“AI 与经济”研究项目,诺贝尔经济学奖得主 Philippe Aghion、学者 Ajay Agrawal 以及新任项目总监 Anu Madgavkar 和 Daniel Rock 等专家正式加入。该团队将重点研究工作未来、企业生产力、全球 AI 扩散及科学发现等领域,直接支持 AI & Economy ATLAS 的后续数据更新与实证分析。

  3. Google AI34

    与 Google 共同开创时尚未来

    Google 旗下 Envisioning Studio 在 AI 创意工作室 Google Flow 中与设计师合作定制了两款工具,用于纽约时装周的创作流程。Styling Suite 帮助设计师在数字模型上完成虚拟试衣与造型搭配;Runway Visualization 则实现了秀场布景、灯光与走秀动线的低成本模拟。用户无需编程经验即可通过自然语言在 Google Flow 中构建专属工具。

  4. 智谱 公众号68

    智谱上线 GLM-5.3-FlashX 模型

    智谱正式上线 GLM-5.3-FlashX 模型,生成速度最高可达 200 tokens/s。该模型基于 10 万张国产芯片提供的推理算力进行了底层 Infra 与推理优化,主打智能、价格与速度竞争力,目前 API 与体验中心已同步开放调用。

    推荐理由:原文给出了基于国产算力优化后的生成速率指标,读者可以据此评估高吞吐场景下的调用时延与可用性。

  5. Claude Code 更新22

    Claude Code v2.1.276 发布

    Claude Code 发布 v2.1.276 版本,修复了 2.1.275 版本引入的请求回归问题。该问题曾导致当 ANTHROPIC_BASE_URL 指向代理或网关时,输入标签 'advisor_20260301' 会使所有请求均失败并报 400 错误,新版本对此进行了修复。

  6. Apple Machine Learning Research39

    动态缩放激活引导(DSAS)框架

    研究人员提出动态缩放激活引导(DSAS)框架,将“何时干预”与“如何干预”解耦,在生成过程中根据上下文自适应调节各层与输入的引导强度。DSAS 可与现有引导方法端到端联合优化,在显著改善大语言模型毒性消除与效用保留权衡的同时,仅引入极小计算开销。该方法还成功应用于文生图扩散模型的概念调节,相关代码将在 GitHub 开源。

  7. AWS News · 云基础设施64

    Amazon EC2 T8i 突发性能实例正式上线

    AWS 宣布 Amazon EC2 T8i 突发性能实例正式可用,搭载定制第六代 Intel Xeon 可扩展处理器(Granite Rapids),相比上一代 T3 实例性价比最高提升 30%。

    推荐理由:原文给出了 T8i 实例的详细规格与性能对比,开发者可以据此评估低负载工作流向新一代突发实例迁移的性价比。

  8. Google Research54

    Google 发布基于生成式 UI 的互动教学研究,支持教师动态定制 STEM 模拟课件

    Google Research 宣布推出利用生成式 UI(GenUI)动态构建教育互动模拟课件的最新研究,并发布了包含 30 多个中学 STEM 课件的样本库。该方案根据教师设定的课程目标自动拆解渐进关卡,内置基于 Agent 的自校正验证机制来确保可用性与教学准确度,目前正通过 Google for Education 试点项目面向学校开放测试。

  9. Anthropic News(RSS)70

    Anthropic 与埃森哲达成前沿 AI 嵌入式评估合作

    Anthropic 宣布与埃森哲(Accenture)达成合作,由埃森哲旗下 AI 业务 Faculty 主导开展前沿 AI 模型的独立“嵌入式评估”,双方预计未来 5 年内各自投入至少 10 亿美元。评估人员将获得类似内部员工的访问权限,直接观察模型训练过程、开展红队测试、执行对齐评估并检验安全防护措施。该合作具备非排他性,Anthropic 计划后续与更多第三方评估组织展开同类合作。

    推荐理由:该合作探索让外部评估机构以类似员工的内部权限跟踪训练与决策,为前沿模型的第三方安全审计提供了实践范本。

9月17日周四
  1. AWS Architecture37

    DHI Group 如何通过黑客松加速生成式 AI 工作负载从创意落地生产

    DHI Group 与 AWS 合作采用黑客松加速包(HAP),推动生成式 AI 工作负载快速从原型走向生产级落地。为期 3 天的黑客松产出了实时雇主分析仪表板、智能候选人匹配以及基于 Amazon Bedrock AgentCore 和 MCP 的统一招聘系统集成 3 个用例原型。DHI 领导层已确认将全部 3 个用例推进至生产环境。

  2. 月之暗面 Kimi 公众号70

    Kimi 发布金融行业解决方案

    月之暗面正式推出 Kimi 金融行业解决方案,整合了 10 余个权威数据源、9 项专属金融技能和 5 项合规安全措施。该方案通过 MCP 接入 Wind 万得、东方财富与标普全球等数据源,提供财务建模、研报生成和交互式图表等端到端交付能力,并支持通过 Computer Use 联动本地软件。此外,方案联合中信建投证券共建风险评估网关,通过数据分类分级、授权拦截和责任审计实现合规业务落地。

    推荐理由:方案通过 MCP 接入数据源并封装出九项金融技能,为智能体在强合规与高密度投研场景的落地提供了具体工作流范式。

  3. Google Infrastructure60

    Google 携手 Stegra 推进绿氢近零排放钢铁厂建设以降低数据中心基建碳排

    Google 宣布与 Stegra 达成合作,助力位于瑞典博登的全球首个大规模绿氢近零排放钢铁厂投产。根据协议,Google 将在 Stegra 投产第一年获取至多 91,000 公吨钢铁的环境属性证书(EACs),预计可将数据中心基础设施的隐含碳排放减少高达 40%。Stegra 采用可再生电力制氢炼铁,较传统高炉工艺可减少最高 95% 的碳排放。

    推荐理由:Google 通过采购绿氢钢铁环境属性证书降低数据中心隐含碳,为算力基础设施的绿色建材供应链提供了具体落地范例。

  4. OpenAI 官方动态49

    OpenAI 推出 Astra for Law

    OpenAI 推出面向法律领域的 Astra for Law,为法律业务提供前沿智能支持。该方案支持定制律所专属工作流并连接法律数据源,同时具备面向机密客户工作的法律级管控能力。

  5. Apple Machine Learning Research39

    REVERSAL-BENCH:用于度量无重置强化学习断崖的可逆性轴与重置预言机

    研究人员推出强化学习基准 REVERSAL-BENCH,通过连续参数 ρ∈ [0, 1] 控制环境可逆性,并提供验证状态可恢复性的重置预言机。评测显示无重置智能体存在显著的可逆性断崖,会永久陷入不可恢复状态导致学习终止,证实该崩溃因果性地由不可逆性驱动。该基准套件涵盖 5 个物理引擎中的 8 种操作设置并开放数据集。

  6. NVIDIA Developer Blog40

    TensorRT Edge-LLM 在 Jetson AGX Thor 上运行 MLPerf 边缘智能体基准测试提速 6.4 倍

    TensorRT Edge-LLM 在 NVIDIA Jetson AGX Thor 上将 MLPerf Edge 智能体基准测试的完成速度提升了 6.4 倍。随着 AI 智能体从云端数据中心走向汽车、机器人等边缘设备,其需要执行工具选择与长对话推理等多步工作流,对边缘推理的速度和 token 生成能力提出了更高要求。

  7. AWS News · 云基础设施77

    AWS 重塑开发者起步体验:支持第三方登录并适配编码智能体

    AWS 推出面向 AI 开发者的全新简化入门体验,支持使用 Google、GitHub 或 Apple 账号免信用卡直接注册,并提供 100 美元免费额度。系统以项目方式自动隔离权限与成员协作,开发者可直接将配置提示词接入编码智能体,由其自动部署资源并管理底层权限,当业务扩展时可无缝激活完整 AWS 高级功能。

    推荐理由:AWS通过免信用卡登录、自动分配权限以及与编码智能体对接,大幅降低了云端部署基础设施的起步门槛。

  8. Azure Blog · 云基础设施30

    微软入选 2026 年 Gartner 分布式混合基础设施魔力象限领导者

    微软在 2026 年 Gartner 分布式混合基础设施魔力象限中连续第四年获评领导者,并在执行能力维度排名最高。依托 Azure Arc 与 Azure Local,企业可跨数据中心、边缘、多云及主权环境实现统一治理与断网运行支持。此外,Foundry Local 可将 AI 推理延伸至本地环境,支持以 Kubernetes 原生方式运行模型。

  9. Anthropic News(RSS)70

    Anthropic 推出生命科学验证计划 LSVP

    Anthropic 推出生命科学验证计划(LSVP),向通过资质与安全审核的机构开放 Mythos 5.1、Opus 5 和 Sonnet 5 等前沿模型,放宽生物医药领域的安全拦截。

    推荐理由:原文详述了资质审核与离线监控机制,展现了大模型厂商在防范生物滥用风险的同时向合规科研放宽限制的落地路径。