跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精选

第 21–22 条 · 共 22 条
2月25日周三
  1. Sebastian Raschka73

    2026 年初开源大模型架构横向对比:从注意力混合机制到长上下文推理优化

    Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。

    推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。

9月6日周六
  1. Sebastian Raschka69

    从零理解与用 PyTorch 实现千问(Qwen3)架构

    Sebastian Raschka 发布教程讲解如何使用纯 PyTorch 从零实现千问(Qwen3)的 Dense 与 MoE 架构,拆解底层核心构建模块。文中梳理了 Qwen3 采用 Apache 2.0 开源协议、提供从 0.6B 到 480B MoE 等多尺寸规格的优势,其 235B-Instruct 版本在 LMArena 排行榜上排在第 8 位并追平 Claude Opus 4。

    推荐理由:提供了用纯 PyTorch 从零实现 Qwen3 架构的完整代码与模块拆解,便于开发者理解现代开源大语言模型的底层设计。