Anthropic 发布 Claude Sonnet 5.5
Anthropic 正式推出 Claude Sonnet 5.5 混合推理模型,具备 1M 上下文窗口,运行速度相比 Sonnet 5 提升 30% 且典型工作流成本降低最高达 30%。
推荐理由:官方公布了新模型的定价与多场景实测数据,开发者可以据此评估高频编码与 Agent 任务的替换成本。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
Anthropic 正式推出 Claude Sonnet 5.5 混合推理模型,具备 1M 上下文窗口,运行速度相比 Sonnet 5 提升 30% 且典型工作流成本降低最高达 30%。
推荐理由:官方公布了新模型的定价与多场景实测数据,开发者可以据此评估高频编码与 Agent 任务的替换成本。
Anthropic 正式推出混合推理模型 Claude Opus 5.5,具备 1M 上下文窗口,在典型工作负载下的运行成本较 Opus 5 降低约 40%。
推荐理由:该模型在保持前沿智能的同时大幅压缩了长程智能体与复杂代码任务的步数与运行成本。
Anthropic 正式发布 Claude Fable 5.1 大语言模型,主打长周期、异步及跨应用的复杂编码与深度知识工作。模型 API 定价为输入每百万 token 10 美元、输出每百万 token 50 美元,缓存读取费用降至每百万 token 0.25 美元,已面向订阅用户及主要云平台开放。
推荐理由:原文详细说明了新模型的定价变化、降本幅度与安全路由机制,有助于评估复杂长周期任务的迁移成本。
Transluce 发布了针对大模型心理健康危机应对能力的独立评测,模拟了 157 类危机用户与来自 OpenAI、Anthropic、Google DeepMind、Meta、DeepSeek 等机构的 77 款模型之间的 5 万多场多轮对话。
推荐理由:评测结合脱敏真实数据与临床专家标准,对比了前沿模型在心理危机对话中的表现并开源了测试集。
Anthropic 推出新一代 Mythos 级别模型 Claude Mythos 5.1,在网络安全和生物学研究能力上取得提升,目前仅通过受信任准入计划向审核通过的机构开放。
推荐理由:Anthropic 推出专精网络安全与生物研究的高能力模型并配套安全受控版本,展示了前沿高危 AI 能力在受限准入下的分级部署路径。
Claude for Microsoft 365 正式发布,其中 Claude for Excel、PowerPoint 和 Word 已面向所有付费订阅用户全面开放,Claude for Outlook 同步开启测试。
推荐理由:Anthropic 将 Claude 直接集成至微软办公套件并实现跨应用上下文流转,为办公自动化提供了跨工具协同方案。
Anthropic 推出 Claude in Chrome 浏览器扩展,面向所有付费订阅用户开放,支持直接读取已登录网页并自主执行点击、打字、填表和跨标签页操作。
推荐理由:原文给出了浏览器智能体的多工作流联动与权限防御机制,读者可以据此评估网页自动化在实际业务中的落地方式与安全边界。
Claude 正式推出 Skills 功能,允许用户与企业将专业知识、业务规范及最佳实践封装为结构化资源,在 Claude.ai、Claude Code 与 API 间跨平台通用。开发者只需构建包含 SKILL.md 指引、参考资料及脚本的文件夹,或通过内置的 skill-creator 自动生成,Claude 即可在复杂任务中自动组合并调用对应技能。
推荐理由:原文明确了用文件夹和元数据打包组织流程的标准格式,读者可以据此将团队制度沉淀为跨客户端与接口通用的智能体能力。
Claude 推出插件市场(Claude Marketplace),聚合了 340 款整合工具、技能与集成的插件并支持一键安装。市场覆盖了 GitHub、Microsoft Playwright、Vercel、Supabase、Figma 等官方 MCP 服务与开发套件,支持在 Claude Code 中完成代码审查、浏览器自动化测试、云端部署与设计稿转代码等任务。
推荐理由:原文给出了插件市场的具体分类与集成工具清单,读者可以据此评估将外部开发工具接入工作流的可行性。
Claude Marketplace 汇集了 867 个连接器与插件,支持将外部工具直接接入 Claude 对话。平台支持前端代码生成、子智能体开发与代码审查、Upstash Context7 实时文档检索、微软 Playwright 浏览器自动化端到端测试以及 monday.com 项目管理等功能。
推荐理由:原文给出了连接器生态与典型 MCP 服务能力,读者可以据此了解工具集成支持的开发和自动化场景。
Anthropic 在 Claude 平台及 Claude Code 中正式推出 Claude Design 功能,支持用户通过自然语言描述并结合自有设计系统直接生成符合品牌规范的视觉设计、单页企划与可交互流程原型。
推荐理由:Anthropic 官方介绍了该功能如何接入企业设计系统与代码库,读者可以据此评估它对前端原型与营销设计协作流程的改变。
Claude 宣布在付费计划中上线 Claude Design、Claude Slides 和 Claude Docs 测试版,支持在对话旁直接生成可交互的视觉设计、演示文稿和动态文档。
推荐理由:官方全面介绍了 Design、Slides 和 Docs 三类新组件的功能细节与权限机制,有助于评估其对现有办公协作流程的改造潜力。
Anthropic 推出面向科研人员的 AI 工作台应用 Claude Science 并开启公测,支持在本地、集群或 GPU 上运行数据分析与作业调度。该应用可原生查看蛋白质与分子结构,直连 60 余个科学数据库及 NVIDIA BioNeMo 工具链,并支持通过 MCP 连接外部工具。每次分析生成的图表与结论都会绑定完整代码、运行环境与对话记录,以便后续复现与核验。
推荐理由:原文详细展示了面向生命科学的数据分析、算力编排与可追溯工作流,读者可据此评估其对科研实验及生信管线的适配度。
Claude Security 现面向 Claude Enterprise 客户开启公测,基于 Claude Mythos 5.1 扫描代码库并提供经对抗性验证的漏洞补丁建议。
推荐理由:原文展示了结合大模型跨文件推理与对抗性验证的代码漏洞挖掘流程,为企业自动化代码审查提供了参考。
Anthropic 推出 Slack 端智能体 @Claude 测试版,面向 Claude Enterprise 和 Team 客户开放,并计划支持 Microsoft Teams。
推荐理由:原文展示了智能体以独立身份融入团队协同工作流的形态,读者可以借此了解企业内协作型智能体的落地方式。
Anthropic 推出代码智能体工具 Claude Code,支持在终端、IDE、Slack 或网页端协同工作,能够自主处理 Bug 修复、跨文件重构与长期代码迁移等研发任务。
推荐理由:官方全面介绍了这款代码智能体的终端定位与长流程处理能力,方便开发者评估其接入现有开发栈的实际价值。
Anthropic 升级 Claude 产品定位与功能体系,将其从对话问答扩展为可接管长任务与多应用工作流的协作智能体,并将 Claude Cowork 与 Chat 整合为统一体验。
推荐理由:官方整合了对话与工作流执行能力,展示了从单轮问答向多工具协同和长任务接管的具体落地形态。
Anthropic 正式推出 Claude Sonnet 5.5,在 Terminal-Bench 4.0 代码测试中取得 70.6% 的成绩,表现逼近旗舰 Opus 5.5。
推荐理由:材料汇总了新模型在代码评测、工程验证以及单任务实际调用成本上的具体测试数据,便于评估中端模型的替代可行性。
路透社披露Anthropic招股材料细节,公司2025年营收接近46亿美元,同比增长约12倍,同期净亏损约420亿美元,其中约340亿美元为融资重估账面费用。公司2025年算力与基建支出达73.3亿美元,占运营开支近六成,并已签署未来数年总计5180亿美元的长期算力与基建支出承诺,涵盖与亚马逊、谷歌、博通及SpaceX的算力合作。
推荐理由:招股材料披露了头部大模型厂商在高速营收增长背后的实际算力基建开支与长期采购承诺规模。
开源基准项目 Livenerf 正式上线,旨在通过长期连续测试量化监测 Claude Opus 5.5 发布后是否出现能力削弱或暗中降级。该工具基于英国人工智能安全研究所的 Inspect 框架,通过固定版本的 Claude Code 命令行接口与冻结提示词,每日在筛选出的 78 道边界题目上运行测试并统计准确率与输出 token 变化。
推荐理由:该项目通过固定题目与预注册统计协议,为大模型发布后是否暗中削弱的争议提供了可复现的长期量化基准。