月之暗面发布 Kimi K3 模型权重与技术报告并开源三项训练 Infra 技术
月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。
推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
月之暗面正式发布 Kimi K3 模型权重及技术报告,并同步开源支撑其训练的关键基础设施 MoonEP、FlashKDA 和 AgentEnv。Kimi K3 为拥有 2.8 万亿参数的 MoE 模型,支持原生视觉理解与 100 万 token 上下文窗口,每 token 从 896 个专家中激活 16 个。
推荐理由:月之暗面不仅开放了长上下文与原生视觉模型权重,还配套开源了专家并行通信库与算子等训练基建。
月之暗面在 Kimi K3 开放日正式发布 Kimi K3 模型权重、技术报告,并开源支撑模型训练的关键 Infra 技术。Kimi K3 是拥有 2.8 万亿参数的 MoE 模型,具备原生视觉理解能力与 100 万 token 上下文窗口,支持自由下载部署。本次配套开源了专家并行通信库 MoonEP、高性能算子 FlashKDA 以及用于分布式强化学习的 AgentEnv 沙箱系统。
推荐理由:月之暗面同步开放了万亿参数混合专家模型权重、技术报告及训练基础设施,有助于开发者了解其超长上下文与细粒度通信优化方案。
Hugging Face Diffusers 正式集成基于 SVDQuant 的 Nunchaku 4-bit(W4A4/AWQ)量化推理,支持直接通过 from_pretrained() 加载量化模型。
推荐理由:原文给出了 W4A4 量化在 Diffusers 框架下的显存与延迟实测数据,读者可以据此评估扩散模型在消费级显卡上的量化部署收益。
Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。
推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。
Thinking Machines Lab 推出原生全模态开源模型 Inkling 及轻量版 Inkling-Small,现已上线 Hugging Face 并提供首日生态支持。
推荐理由:该模型采用 MoE 与原生多模态统一输入架构,为大参数量跨模态推理与量化部署提供了完整的开源落地参考。
Hugging Face 升级了 vLLM 的 transformers 建模后端,使其在多类大语言模型架构上的推理吞吐量追平甚至超越 vLLM 手写原生实现。
推荐理由:关注大模型推理部署的开发者可以了解该后端如何免去为推理框架单独手写优化实现的繁琐流程。
Hugging Face 与微软合作在 Microsoft Foundry 中推出 Hugging Face Collection,支持在托管 GPU 平台 Foundry Managed Compute 上一键部署开源权重模型。
推荐理由:原文给出了预置权重、多引擎托管与统一安全治理的落地架构,读者可以据此评估企业私有化部署开源模型与智能体集成的工程链路。
Hugging Face 发布开源机器人学习库 LeRobot v0.6.0,引入世界模型策略、统一奖励模型 API 与人机回环部署 CLI,全面构建机器人学习闭环。
推荐理由:新版本通过集成世界模型、奖励模型评估与人机协同干预工具链,为具身智能策略的闭环训练与快速部署提供了可复用的标准化工程流程。
SkyPilot 与 Hugging Face 联合支持将 Hugging Face Storage 作为一级存储后端,允许通过统一的 hf:// 路径将 Hub 仓库或 Buckets 挂载至跨 20 多个云厂商、Kubernetes 及本地集群的计算任务中。
推荐理由:原文解析了跨云调度 AI 任务时消除出站流量成本的集成方案,读者可据此优化多云算力下的模型挂载与数据同步链路。
Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。
推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。
Hugging Face 与 EvalEval 联盟的 Every Eval Ever(EEE)达成互通,支持将标准化的 AI 评测记录直接同步至 Hugging Face 模型页面与对应的数据集排行榜。
推荐理由:打通标准化评测数据与模型展示页面,有助于降低跨平台维护评测记录的成本,并让基准得分直接溯源至完整运行配置。
Sebastian Raschka 撰文介绍了利用 Ollama 与开源权重模型搭建全本地 Coding Agent 的完整方案。
推荐理由:文章拆解了本地大模型与编码 Agent 框架的搭配方案,提供了可复用的安全审计提示词与基准评测脚本。
Kubernetes 社区发布针对 AI 辅助贡献的治理规范,要求贡献者必须透明披露 AI 使用情况并承担全部代码责任,严禁将 AI 列为共同作者,若无法亲自解释 AI 生成的代码将被直接关闭 PR。
推荐理由:Kubernetes 针对 AI 辅助贡献明确了透明披露与人类问责机制,为大型开源社区应对 AI 代码冲击提供了可参考的治理范式。
Kubernetes 官方博客专访设备管理工作组三位联合主席,详解动态资源分配(DRA)毕业至 GA 后的架构演进与 AI 硬件调度实践。DRA 通过 ResourceSlice 与 ResourceClaim 声明式 API 替代了传统设备插件的粗粒度整数分配,支持 GPU 拓扑感知、MIG 切分及平台介导的动态容量共享。
推荐理由:工作组核心成员深入剖析了 DRA 如何替代传统设备插件,为 AI 负载提供细粒度拓扑感知与动态共享调度能力。
通义实验室正式开源原生语言世界模型 Qwen-AgentWorld 及其评测基准 AgentWorldBench。该模型基于超 1000 万条真实交互轨迹,经由继续预训练、监督微调和强化学习三阶段训练,覆盖 MCP、Search、Terminal、SWE 等文本类及 Web、OS、Android 等 GUI 类共七大领域。
推荐理由:模型通过对环境交互显式建模来降低沙箱试错成本,为智能体强化学习和跨任务泛化提供了可控模拟路径。
通义实验室联合中国人民大学高瓴人工智能学院开源统一科学大模型 LOGOS,将蛋白质、小分子和材料等异构科学对象编码为统一离散序列。模型基于 7 类模态共 44.87B tokens 语料预训练,无需显式 3D 坐标即可建模空间互作规律,并在配体生成、逆合成预测等六大任务上匹敌或超越领域专用方法。
推荐理由:该模型通过离散化序列将多领域科学对象统一纳入自回归框架,展示了摆脱显式三维几何网络并复用成熟语言模型工程栈的可行路径。
智谱宣布 GLM-5.2 全量开放,该模型支持 1M 上下文并主打长程任务与代码能力。GLM-5.2 将面向 GLM Coding Plan 全量用户(Lite / Pro / Max / 团队版)开放,其 API 将于下周上线,模型也将于下周遵循 MIT 协议正式开源。
推荐理由:原文给出了上线节奏、版本开放范围和开源协议,开发者可以据此了解模型获取途径与商用支持。
Google DeepMind 推出开源实验模型 DiffusionGemma,采用 Apache 2.0 协议发布,通过扩散机制替代传统的自回归逐 token 生成,在专用 GPU 上实现最高 4 倍的文本生成速度。
推荐理由:原文对比了扩散文本生成与传统自回归模型在硬件瓶颈与吞吐上的差异,为开发者评估本地实时交互工作流提供了参考。
Sebastian Raschka 发布了 2026 年 1 月至 5 月的精选大语言模型研究论文清单,重点关注混合架构、推理与强化学习等领域。文章指出今年架构设计不再局限于扩大 Transformer 规模,而是转向注意力层与 Mamba-2 或 Gated DeltaNet 交替的混合架构以提升长上下文效率。
推荐理由:作者整理了前五个月核心论文与架构趋势,读者可快速掌握混合架构与长上下文演进方向。
Google Research 在 GitHub 上以 Apache 2.0 协议开源了水文学建模框架,提供支持 Google Flood Hub 实时洪水预报的完整模型架构与训练流水线。
推荐理由:Google 将其实时洪水预测的水文模型框架在 GitHub 开源,使各地气象与水文机构能够结合本地数据低成本训练专属预报模型。