混元图像 3.5 预览版发布,腾讯推出高性价比专业级生图模型
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。
Hugging Face 团队基于 Gradio Workflow 画布推出 Workflow1111,通过 73 个节点和 11 条管线重构了 AUTOMATIC1111 的核心功能。
推荐理由:展示了如何用可视化节点图复构复杂生图系统,且每个输出节点均可自动转为 REST 接口与 MCP 工具供智能体调用。
OpenAI 推出 ChatGPT Images 2.5。该功能可将用户的想法、草图以及参考照片转化为更具个性化且更精细的图像,以更好地体现用户的创意。
Google 推出基于 Nano Banana 模型的图像创作与编辑工具 Google Pics,面向 Google AI Pro、Ultra 订阅用户及多数 Workspace 商业客户开放。该工具支持独立使用并直接整合至 Docs、Slides 和 Drive,具备物体分割局部修改、图内文字编辑与翻译、单提示词多图生成以及多人协作能力。用户可通过 pics.new 体验相关功能。
推荐理由:该工具直接嵌入文档与演示文稿工作流,为办公场景下的局部图像微调与图内文案修改提供了开箱即用的协作方案。
MIT CSAIL 研究团队在《Nature Communications》发表论文,发现生成式模型存在“归因衰减”现象,在大规模数据训练下生成的图像往往无法溯源至任何单一训练样本。
推荐理由:原文通过反事实消融实验揭示了归因衰减现象,为探讨大规模训练数据与生成内容侵权判定提供了可验证的技术依据。
Hugging Face Diffusers 正式集成基于 SVDQuant 的 Nunchaku 4-bit(W4A4/AWQ)量化推理,支持直接通过 from_pretrained() 加载量化模型。
推荐理由:原文给出了 W4A4 量化在 Diffusers 框架下的显存与延迟实测数据,读者可以据此评估扩散模型在消费级显卡上的量化部署收益。
Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。
推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。
Google DeepMind 宣布面向开发者推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash。
推荐理由:文章给出了两款模型的具体定价与核心延迟指标,方便开发者评估多模态生成管线的吞吐与成本。
Google 宣布在 Google Photos 的 Auto frame 中上线基于 3D 场景理解与生成式 AI 的照片重构功能,支持在拍摄后自动调整人像照片的相机机位和焦距。
推荐理由:原文展示了解耦 3D 场景估计与扩散模型以重构相机视角的方案,有助于了解生成式 AI 在后期构图与人像畸变修复中的落地细节。