最新精选 第 121–131 条 · 共 131 条 19:55 Sebastian Raschka 精选AI 评分 67 67 Sebastian Raschka 系统梳理了现代主流开源大模型中应用的注意力机制变体与设计权衡。文章重点解析了标准多头注意力(MHA)、分组查询注意力(GQA)、多头潜在注意力(MLA)、滑动窗口注意力(SWA)以及 DeepSeek 稀疏注意力(DSA),展示了各机制在模型表现与 KV Cache 占用上的对比。
推荐理由:梳理了主流开源大模型中各类注意力变体的机制差异与权衡,便于读者系统理解长上下文下的 KV Cache 优化与混合架构演进。
00:58 Google Research 精选AI 评分 66 66 Google 与 Beth Israel Deaconess Medical Center(BIDMC)合作完成了一项前瞻性单中心可行性研究,评估对话式医疗 AI 模型 AMIE 在门诊就诊前采集病史的实际表现。
推荐理由:该研究展示了对话式医疗模型从模拟环境走向真实门诊预诊的可行性与安全性数据。
21:26 Sebastian Raschka 精选AI 评分 73 73 Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。
推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。
19:23 Sebastian Raschka 精选AI 评分 69 69 Sebastian Raschka 发布关于推理阶段扩展(Inference-Time Scaling)的技术综述,系统梳理了无需修改模型权重的推理期算力扩展方法。
推荐理由:作者梳理了主流免训练推理扩展方法的技术分类与实测路径,为提升模型推理能力提供了系统化的方案选择参考。
20:22 Sebastian Raschka 精选AI 评分 67 67 Sebastian Raschka 发布 2025 年大模型年度盘点与预测,指出大模型演进的核心驱动力已转向以 RLVR 与 GRPO 为代表的后训练推理以及推理时扩展。
推荐理由:系统梳理了推理模型、后训练强化学习与混合架构的演进,为读者研判大模型技术路线与工程落地提供了多维度参考。
20:03 Sebastian Raschka 精选AI 评分 75 75 Sebastian Raschka 深入剖析了 DeepSeek 从 V3 到 V3.2 的技术演进,涵盖模型架构、稀疏注意力机制与强化学习优化。DeepSeek V3.2 引入了由 Lightning Indexer 驱动的 DeepSeek 稀疏注意力机制(DSA),将注意力计算复杂度从二次方降低至线性 O(Lk)。
推荐理由:梳理了稀疏注意力 DSA 与 GRPO 算法调优的技术演进脉络,有助于理解开源大模型在长上下文效率与强化学习稳定性上的工程实现细节。
18:52 DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
21:06 Sebastian Raschka 精选AI 评分 67 67 文章盘点了超越传统自回归 Transformer 的四类新兴模型架构及其实践权衡。线性注意力混合架构(如 Qwen3-Next 与 Kimi Linear 的 Gated DeltaNet)通过结合全局注意力与线性层大幅缩减 KV cache 并支持超长上下文。
推荐理由:系统梳理了线性注意力混合、文本扩散及代码世界模型等非传统架构,为评估长文本效率与并行生成提供了清晰的权衡参照。
19:12 Sebastian Raschka 精选AI 评分 66 66 Sebastian Raschka 撰文详解并用代码实操了大模型评测的 4 大主流方法,将其归纳为基准测试与裁判评估两大类。内容涵盖 MMLU 多选题准确率评测、面向数学和代码领域的确定性验证器(Verifier)、LM Arena 风格的 Elo 偏好排行榜,以及通过 Ollama 调用大模型充当裁判(LLM-as-a-judge)的具体实现与优缺点权衡。
推荐理由:原文从零代码拆解了多选题、验证器、排行榜和 LLM 裁判四类评测机制,有助于读者厘清基准测试的局限与组合评估策略。
03:57 SemiAnalysis · 算力产业 精选AI 评分 85 85 NVIDIA 推出专为大模型推理 Prefill 阶段设计的 Rubin CPX 加速器及配套机柜架构,通过强化算力并降低显存带宽成本重塑解耦推理服务。
推荐理由:文章深入剖析了面向 Prefill 阶段的专用硬件架构与机柜设计,为评估大模型解耦推理与算力 TCO 提供了清晰的参考视角。
19:23 Sebastian Raschka 精选AI 评分 87 87 Sebastian Raschka 深入解析了 OpenAI 开放权重的 gpt-oss-20b 与 gpt-oss-120b 架构,并对比了 GPT-2 与 Qwen3 的技术演进。
推荐理由:文章拆解了开源模型在网络结构与量化工程上的取舍,有助于开发者理解现代大模型的单卡运行原理与架构演进脉络。
上一页 1 … 5 6 7