DeepSeek 联合华为开源昇腾芯片编程工具 TileLang
DeepSeek 联合华为针对昇腾 AI 芯片推出开源编程工具集,核心包含由北京大学研究团队原研的开源编程语言 TileLang,旨在提供比 CUDA 更简便的高性能编程模型。
推荐理由:原文披露了国产芯片软硬件协同的底层架构细节,有助于评估国内 AI 基础设施摆脱 CUDA 生态依赖的可行路径。
DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。
DeepSeek 联合华为针对昇腾 AI 芯片推出开源编程工具集,核心包含由北京大学研究团队原研的开源编程语言 TileLang,旨在提供比 CUDA 更简便的高性能编程模型。
推荐理由:原文披露了国产芯片软硬件协同的底层架构细节,有助于评估国内 AI 基础设施摆脱 CUDA 生态依赖的可行路径。
DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 语言编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 与 DeepSelect 等计算与通信库。所有组件与此前面向英伟达平台的开源组件一一对应,并结合昇腾 Ascend C 底层指令提供高性能算子实现;双方还合作推进了基于昇腾 950 的 128 卡超节点方案。
推荐理由:DeepSeek 将此前验证过的核心算子与通信组件移植至昇腾,为开发者在国产芯片上构建高性能训练环境提供了可直接复用的基础设施。
DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具以及 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect 等计算与通信库。
推荐理由:DeepSeek 将此前在英伟达平台验证的算子与通信工具适配至昇腾平台,为国产算力开发者提供了源于大模型实战的底层优化实现。
DeepSeek 联合清华大学发布技术报告,首次系统阐释了支撑 DeepSeek-V4 全部训练、评测与数据预处理的沙盒基础设施 DeepSeek 弹性计算(DSec)。
推荐理由:原文系统阐述了大规模智能体训练沙盒的按需加载、高密度超卖与训练解耦架构,提供了极具参考价值的基础设施工程实践。
DeepSeek 正式开源面向华为昇腾算力平台的基础设施加速组件,涵盖 TileLang 编译工具、DeepGEMM 与 FlashMLA 等高性能算子库以及 DeepEP 分布式通信库。
推荐理由:原文披露了面向昇腾平台的算子库与通信库细节,为在国产算力集群上部署与训练大模型提供了落地参考。
DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库及分布式通信库,与英伟达平台开源组件一一对应。
推荐理由:原文给出了底层编译与通信组件从英伟达向华为昇腾的对应适配细节,有助于评估国产算力在训练和算子开发上的可用性。
Transluce 发布了针对大模型心理健康危机应对能力的独立评测,模拟了 157 类危机用户与来自 OpenAI、Anthropic、Google DeepMind、Meta、DeepSeek 等机构的 77 款模型之间的 5 万多场多轮对话。
推荐理由:评测结合脱敏真实数据与临床专家标准,对比了前沿模型在心理危机对话中的表现并开源了测试集。
vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。
推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。
DeepSeek Harness 桌面端正式上线,支持 Windows 与 Mac 平台,提供开箱即用的办公与开发智能体环境。软件自带 Python 与 Node 运行时及文档处理库,基于 Cordis 插件内核支持图形化插件管理、自动化任务与多 Agent 协同。此外 DeepSeek 同步公开了用于模型训练的沙盒基础设施 DSec,相关技术报告已发布于 arXiv。
推荐理由:文章实测了 Harness 桌面端的预置环境与插件内核机制,读者可借此了解其如何降低本地智能体配置门槛。
DeepSeek 正式推出 DeepSeek Harness 桌面端并提供 macOS 与 Windows 安装包,将核心定位从纯编程扩展至日常办公场景。实测显示桌面端可直接在工作区内批量读取、处理并预览 Office 与 PDF 文档,同时新增了独立运行的周期性自动化任务、图形化插件管理以及基于 SenseVoiceSmall 的本地语音输入。
推荐理由:原文实测了桌面版在文档处理与定时自动化等场景的表现,展示了它从终端工具向日常办公助理的转变。
深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。
推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。
DeepSeek 实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台,支持图文混合输入与各类 Agent 框架集成。
推荐理由:原文给出了纯文本与多模态基准对比以及按 token 计费规则,开发者可以据此评估多模态智能体任务的接入成本。
深度求索发布 DeepSeek V4 Pro 正式版,已同步在 APP、网页端与 API 上线。新模型重点提升了 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex,思考模式新增 low、high、max 三档强度控制。此外 API 推出峰谷定价机制,闲时价格为高峰时段的一半,新计费规则将于北京时间 2026 年 8 月 17 日 0 时生效。
推荐理由:原文介绍了模型在智能体能力上的增强以及分档思考强度与峰谷定价,有助于开发者评估接口迁移与调用成本。
Sebastian Raschka 撰文详解大语言模型中推理努力程度(Reasoning Effort)与思考开关的训练与推理机制。模型通常通过系统提示词结合特定长度惩罚的 RLVR、混合思考样本的 SFT 或不同预算专家蒸馏来实现多档推理控制。
推荐理由:文章横向拆解了前沿模型控制推理预算的后训练方案与推理开关,为开发者理解和设计灵活的推理计算机制提供了清晰参考。
Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。
推荐理由:原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。
DeepSeek 正式上线并开源全新系列模型 DeepSeek-V4 预览版,全系标配 1M 上下文,提供 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本。
推荐理由:原文给出了两个版本的性能定位、架构优化细节与接口迁移时间表,读者可以据此评估长上下文模型在编码与 Agent 场景下的接入成本。
Sebastian Raschka 发布 2025 年大模型年度盘点与预测,指出大模型演进的核心驱动力已转向以 RLVR 与 GRPO 为代表的后训练推理以及推理时扩展。
推荐理由:系统梳理了推理模型、后训练强化学习与混合架构的演进,为读者研判大模型技术路线与工程落地提供了多维度参考。
Sebastian Raschka 深入剖析了 DeepSeek 从 V3 到 V3.2 的技术演进,涵盖模型架构、稀疏注意力机制与强化学习优化。DeepSeek V3.2 引入了由 Lightning Indexer 驱动的 DeepSeek 稀疏注意力机制(DSA),将注意力计算复杂度从二次方降低至线性 O(Lk)。
推荐理由:梳理了稀疏注意力 DSA 与 GRPO 算法调优的技术演进脉络,有助于理解开源大模型在长上下文效率与强化学习稳定性上的工程实现细节。
DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,引入细粒度稀疏注意力机制(DSA)以优化长文本训练与推理效率,官方各端已同步上线且 API 调用成本降低 50% 以上。
推荐理由:模型引入细粒度稀疏注意力机制提升长文本训练推理效率,同步开源模型权重与算子并将 API 调用成本降低 50% 以上。