至知创新研究院发布 IQuest-Q1 模型:320B 稀疏 MoE 架构主打复杂代码与工程排错
至知创新研究院(IQuest Research)发布 IQuest-Q1 模型,采用 Decoder-only 稀疏 MoE 架构,总参数约 320B、激活参数约 15B。
推荐理由:原文介绍了 320B 总参数但仅激活 15B 的稀疏 MoE 模型,展示了其在复杂代码长程排错与交互生成任务中的实际表现。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
至知创新研究院(IQuest Research)发布 IQuest-Q1 模型,采用 Decoder-only 稀疏 MoE 架构,总参数约 320B、激活参数约 15B。
推荐理由:原文介绍了 320B 总参数但仅激活 15B 的稀疏 MoE 模型,展示了其在复杂代码长程排错与交互生成任务中的实际表现。
Anthropic 推出新模型 Claude Sonnet 5.5,运行速度提升超 30% 且多数任务成本降低最多达 30%,目前已作为 claude.ai 免费层的默认模型。作者实测显示其在部分编码任务上表现接近 Opus 5.5,但在最高思考强度下仍存在耗尽 128,000 tokens 的异常;此外官方宣布 Haiku 5.5 将在数周内推出。
推荐理由:原文展示了该模型下放至免费版后的实际性能与成本差异,有助于读者对比不同梯队前沿模型的编码能力。
H 公司正式发布 Holo4 系列通用计算机操作智能体模型,推出 27B 稠密与 35B-A3B MoE 两个版本,并同步开源适配 Nemotron 3 Nano Omni 的 Holotron4 Nano。
推荐理由:该系列模型统一了图形界面、代码与API等多接口交互方式,展示了小参数模型在复杂桌面控制工作流中的落地路径。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。
推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。
Anthropic 正式推出 Claude Opus 5.5,约一小时后 OpenAI 也发布了 GPT-6 Sol 与 Luna,两家头部厂商同日打响价格战。
推荐理由:文章汇总了两大主流模型同日发布的定价对比与实测基准,有助于读者评估编码与智能体场景的实际落地成本。
OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款新模型,将前沿智能引入日常工作。两款模型在能力与成本之间提供了不同的平衡选择。
推荐理由:OpenAI 推出两款新模型分别在能力与成本间提供不同平衡,方便用户根据日常工作需求进行选型。
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。
微软研究院在《Nature》发表并开源了逆合成预测模型 RetroChimera 的代码与权重,用于自动生成高质量的小分子化学合成路径。该框架结合了基于 Transformer 的生成模型 R-SMILES 2 与基于图神经网络的模板模型 NeuralLoc,并通过学习重排序机制聚合两者的互补优势。
推荐理由:该模型融合了端到端生成与模板图神经网络的互补优势,为小分子与新药研发中的化学逆合成路线设计提供了可落地的开源方案。
阶跃星辰发布面向 Agentic 任务的旗舰模型 Step 5 Preview,即日起全量开放 API 与在线体验,并定于 10 月 15 日正式释放模型权重。
推荐理由:原文给出了稀疏架构与长程任务的具体指标,读者可以据此评估其在复杂工程与专业研究中的能效表现。
智谱正式上线 GLM-5.3-FlashX 模型,生成速度最高可达 200 tokens/s。该模型基于 10 万张国产芯片提供的推理算力进行了底层 Infra 与推理优化,主打智能、价格与速度竞争力,目前 API 与体验中心已同步开放调用。
推荐理由:原文给出了基于国产算力优化后的生成速率指标,读者可以据此评估高吞吐场景下的调用时延与可用性。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。
推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。
阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。
推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。
深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。
推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。
OpenAI 正式在 API 中推出 GPT-Live-1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:该模型将全双工语音对话接入API并提供电话支持,方便开发者直接构建实时语音交互应用。
OpenAI 推出面向企业工作场景的模型 GPT-6 Astra。该模型具备高级推理与计算机操作能力,并在写作表达与设计判断方面进行了提升。
推荐理由:原文介绍了面向工作场景的核心能力升级,读者可据此了解其在推理和计算机操作上的新定位。
OpenAI 推出 ChatGPT Images 2.5。该功能可将用户的想法、草图以及参考照片转化为更具个性化且更精细的图像,以更好地体现用户的创意。
OpenAI 最新前沿模型 GPT-6 Astra 正式在 Microsoft Foundry 全面可用(GA),主打面向复杂企业任务的多步规划、跨应用工具调用以及计算机使用(computer use)能力。
推荐理由:原文明确了前沿智能体模型在企业云端的部署形态与调用定价,有助于评估复杂跨应用自动化任务的落地成本与安全架构。
Google DeepMind 与 Google Research 联合发布全球天气预报 AI 模型 WeatherNext 3,支持逐小时刷新并将关键地表变量分辨率提升至 5 公里。
推荐理由:该模型直接结合实时卫星与地面观测数据实现逐小时高分辨率预报,展现了全球气象大模型在极端天气与清洁能源调度场景下的落地路径。
NeoMME 推出 260M 与 800M 原生多语言多模态编码器,采用单塔双向 Transformer 从头预训练,无需独立视觉塔或自回归解码器。微调版 NeoMME-Retriever 在单次前向传播中同时输出稠密与后期交互嵌入,在 ViDoRe v3 达到帕累托最优,并可在单张 NVIDIA L40S 上以每秒 51 页的速度编码 2048×2048 图像。
推荐理由:原文开源了单塔架构的多模态原生编码器与检索微调权重,读者可参考其在视觉文档检索与索引压缩上的落地实践。
Google DeepMind 推出 Gemini 3.8 Flash 与专用于网络安全的 Gemini 3.8 Flash Cyber 两款新模型,主打长程编程、智能体工作流与漏洞自动修复能力,保持与 3.7 Flash 相同的定价(输入 $0.75 / M tokens,输出 $3.75 / M tokens)。
推荐理由:原文给出了两款模型的基准数据与定价细节,开发者可以据此评估其在长程编码与安全防御场景中的落地可行性。