最新精选 第 181–185 条 · 共 185 条 18:52 DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
18:07 DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,引入细粒度稀疏注意力机制(DSA)以优化长文本训练与推理效率,官方各端已同步上线且 API 调用成本降低 50% 以上。
推荐理由:模型引入细粒度稀疏注意力机制提升长文本训练推理效率,同步开源模型权重与算子并将 API 调用成本降低 50% 以上。
21:15 DeepSeek 宣布 DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus 版本,并在 Hugging Face 与 ModelScope 同步开源。
推荐理由:官方说明了该版本在语言一致性以及代码和搜索智能体上的针对性改进,并同步公开了开源权重与接口更新。
19:10 Sebastian Raschka 精选AI 评分 69 69 Sebastian Raschka 发布教程讲解如何使用纯 PyTorch 从零实现千问(Qwen3)的 Dense 与 MoE 架构,拆解底层核心构建模块。文中梳理了 Qwen3 采用 Apache 2.0 开源协议、提供从 0.6B 到 480B MoE 等多尺寸规格的优势,其 235B-Instruct 版本在 LMArena 排行榜上排在第 8 位并追平 Claude Opus 4。
推荐理由:提供了用纯 PyTorch 从零实现 Qwen3 架构的完整代码与模块拆解,便于开发者理解现代开源大语言模型的底层设计。
19:23 Sebastian Raschka 精选AI 评分 87 87 Sebastian Raschka 深入解析了 OpenAI 开放权重的 gpt-oss-20b 与 gpt-oss-120b 架构,并对比了 GPT-2 与 Qwen3 的技术演进。
推荐理由:文章拆解了开源模型在网络结构与量化工程上的取舍,有助于开发者理解现代大模型的单卡运行原理与架构演进脉络。
上一页 1 … 8 9 10