RunningHub 发布生成式视频超分模型 RH Upscale
海马云旗下 RunningHub 正式发布自研生成式视频超分模型 RH Upscale,主打在放大与纹理恢复的同时保持人物、构图及运动一致性,在 13 组横评中 Ultra 档位以 0.539 综合得分位列第一。
海马云旗下 RunningHub 正式发布自研生成式视频超分模型 RH Upscale,主打在放大与纹理恢复的同时保持人物、构图及运动一致性,在 13 组横评中 Ultra 档位以 0.539 综合得分位列第一。
Einsia AI 旗下 Navers Lab 推出基准评测 PPTBench,测试 Coding Agent 能否理解真实科学流程图并用代码重建为原生可编辑的 PPTX 幻灯片。
MiniMax Code 上线 M3.1-Flash-Preview,支持 1M 上下文、图文与视频输入以及五档思考强度调节,主打快速编程场景。实测显示其能调用 30 个子 Agent 协同完成数千张图片的筛选建站,并能准确提取 77 秒机器人视频动作时间轴并生成交互回放单页。
微软研究院联合博德研究所推出实验性多模态 AI 研究系统 Project Quine,将覆盖基因组学、蛋白质、化学、细胞状态和生物成像的世界模型与交互式推理框架相结合。该系统旨在通过多领域跨模型计算预筛候选物并排定优先级,以加速药物发现和湿实验验证,目前仅限科研使用并已开放 Quine Fellows 项目申请,未来计划通过 Microsoft Discovery 扩大商业化开放。
研究人员提出 LLM 驱动的自动研究框架 MemEvo,将流式视频记忆设计建模为可执行程序的搜索问题,以自动化生成训练无关的有界记忆机制。该方法在冻结视觉语言模型的前提下,利用预训练 LLM 结合实验反馈迭代优化候选记忆程序。在 StreamingBench 与 OVO-Bench 上的实验表明,该机制在保持强劲视频理解性能的同时大幅提升了推理效率。
研究人员针对多模态强化学习提出持久性感知信用分配方法 PACG,通过削弱异常持久视觉主张的正向信用,解决未受图像支持的主张错误继承奖励的问题。该方法无需标注且不增加推理成本。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 和 VPPO 的 9 项基准平均分分别提升至 59.9% 和 60.9%,并提升了 HallusionBench 准确率。
AVIO 是一种可在视听场景中联合学习发声物体添加与移除的模型,通过源条件特征调制适配预训练文本到视听生成模型。配套构建的 AVIOBench 数据集包含 37.9 小时配对视听样本,覆盖 1,878 个目标物体名称。该模型结合参考帧课程学习,使单个模型即可执行纯指令编辑,并支持通过可选视觉引导控制物体的外观与位置。
研究人员提出协同演化奖励框架 CoRe,通过让奖励模型与生成器动态交互,缓解视频扩散模型在潜在空间对齐时的奖励作弊问题。CoRe 持续在生成器当前样本上重新拟合奖励模型并锚定真实视频偏好,防止生成器因分布逃逸导致感知与运动质量恶化。在 Wan2.1-T2V-1.3B 上的实验表明,该方法生成质量优于预训练模型及先前对齐方法。
研究人员提出多模态智能体框架 MERID,通过基于经验的递归自我改进自主构建并优化重度抑郁症分析流程。该框架整合了目标对齐(GSC)、流程联合探索(CPE)与证据引导演化(EGE)机制,能在小样本抑郁队列中验证并继承有效改进。实验表明 MERID 在多项基准测试中均取得最佳效果,相关代码已开源。
研究人员推出 FigAct 框架与 FigAct-8B 模型,可直接对静态科学图表中的图形元素进行操作,将其转化为问答驱动的动态视觉演示以引导读者注意力。该框架采用分层搜索策略实现高效的元素定位,将 token 消耗降低约 40x,并基于定位精度、搜索效率与渲染质量三项奖励进行训练。团队还构建了人工验证的评测基准。
一项针对视觉-语言-动作(VLA)策略隐式接口的研究表明,在 LIBERO 和 CALVIN 基准下,54 种多层融合配置中有 47 种表现弱于最佳单层策略。研究提出以 InfoNCE 作为层质量代理指标,无需闭环评估即可将平均选择遗憾值从最深层的 17.89 个百分点降至 3.71 个百分点,同时减少 9-33 倍 GPU 算力消耗。
研究人员推出 GeoOutageBench,用于评测大语言模型在多模态电力停电与韧性分析中的地理时空知识图谱问答(KGQA)能力。该基准整合停电记录、遥感与气象等多模态数据,评估大语言模型在歧义条件下的自然语言转 SPARQL 解析、本体效用及多模态检索准确率。目前相关基准、代码与数据已公开提供。
匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 平台上线,展现出较强的长上下文、多模态理解与 Agent 编程能力。实测表明其能直接将手绘草图转化为可交互网页与 3D 场景,并在小型游戏及交互展台搭建中快速产出可用代码。研究人员分析其分词特征与配置发现,该模型可能与 MiniMax 旗下新版本相关,目前两平台均提供免费体验。
前TikTok全球运营负责人周秉俊与胡禹丞创立Lollapalooza,推出AI应用Furever,通过上传照片为离世宠物生成持续更新的图文视频并模拟互动。该产品陆续上线了Memory Wall、Voice Capsules和Companion Mode等功能,构建包含时间与天气变化的虚拟世界。团队还推出了支持长期记忆与桌面提醒的个人助手Furever Dock。
研究人员提出 RLHarness 框架,将技能(Skills)、协议与示例整合为版本化 Harness,通过与强化学习策略交替演化解决长链条多模态推理难题。该方法结合 SFT、DAPO I、Post-RL 重构与 DAPO II,使 MetroMap/TravelMap 准确率从 16.25%/27.50% 提升至 62.00%/50.00%。
RAO-Nav 提出了一种利用全模态语言模型(OLM)实现零样本语义视听导航(SAVN)的部署流程。该方案引入测试时潜在导航推理(LNR)模块,在无需任何训练数据的情况下,在公开 SAVN 基准测试中超越了现有的 SOTA 基线。研究还提出了全局导航指令设定以进一步评估具身智能体能力,并已开源代码。
研究人员构建了一款双语 AI 听力师,在无需微调底层大语言模型的前提下,结合量规引导剧本归纳、多模态听力图解读与 RAG 技术。在包含 58 个模拟病例的双盲对比中,该 AI 在全部 58 个病例及 21 项评估维度的 20 项上均超越 17 位执业听力师,5 分制综合评分平均提升 +1.35 分。
研究团队提出住宅能源管理多模态基准 EVLA,将电池调度建模为结合 RGB 能量场、数值状态与自然语言目标的 16 步动作预测任务。该基准涵盖 3 种隐藏工况与 5 种语言目标,共包含 6,588,045 个多模态样本。MobileNet 测试显示,移除语言使轨迹 MSE 从 0.3856 增至 0.8628,而移除视觉后为 0.3843,表明预测质量高度依赖语言模态。
AITNT 平台发布多项人工智能商业对接与融资需求,涵盖智能制造、具身智能及数字化服务等领域。其中,具身智能服务机器人研发与智塑未来 5 轴增材制造平台分别寻求 2000 万元融资,多模态运动分析系统拟融资 1000 万元。此外,平台还发布了纺织智能监测、室内设计大模型应用及包装装备升级等技术合作需求。
上海人工智能实验室开源多模态决策模型 Intern-Decision,推出 0.8B、2B 与 4B 三款规格并开放权重与代码。在单张 RTX 4090 上,该模型推理速度较 Jev 提升 2-3 倍,4B 模型时延低于 45ms,0.8B 和 2B 版本达到每秒约 30 次推理。模型支持直接读取画面完成游戏与浏览器操作,并可通过温度校准和置信度机制与大模型协同工作。
香港大学等机构研究团队提出 3D 场景生成框架 SceneMosaic,通过将单图结构化为层级场景树并引入 Critic-Actor 智能体局部演化与笛卡尔积组合,高效生成物理合理且多样的仿真房间。
研究团队提出即插即用框架 Omni-IO Skills,通过分层技能、标准化多模态执行接口、依赖感知编排以及持久化资产注册表,让现有 AI 智能体无需修改核心推理逻辑即可实现全模态能力。
中国电信星辰通用人工智能实验室推出并开源约 1.2B 参数的文档解析模型 TeleOCR,相关资源已上线 GitHub 与 Hugging Face。该模型采用形变感知学习与内容-结构解耦设计,通过动态多边形与曲率引导采样算法处理拍摄弯曲与透视,支持复杂表格与 19 种科学图表提取。
可灵 AI 推出 Kling 4.0 视频生成模型及兼顾速度与性价比的 Kling 4.0 Flash,在画面真实感、长镜头叙事与专业控制上实现升级。模型支持 10-bit HDR 及 4K/1080P 输出、单次原生最长 30 秒生成,覆盖 9 种语言口型同步,并支持单次任务组合最多 15 项参考素材与 10 张关键帧。
推荐理由:原文实测了新模型在运镜稳定性、10-bit HDR 输出与多参考控制上的表现,便于创作者评估其接入专业影视流程的实用性。
Cerebras 总结了利用 AI 生成高质量 UI 的 8 种实践方法,以解决通用提示词容易产出千篇一律 SaaS 仪表盘与卡片嵌套的问题。核心方案包括接入 shadcn/ui 的 MCP 服务器以读取真实组件源码、在编码前通过 Design Tokens 与 Tailwind 配置固化视觉规范,以及结合视觉模型截图进行小步精准迭代。
推荐理由:原文总结了 AI 生成 UI 的典型缺陷与 8 种实用改进方法,读者可据此建立更具约束力的高效前端开发工作流。
大语言模型用于 OCR 虽提升了复杂文档的识别流畅度,但由于生成时依赖语言先验,常导致数值静默替换、表格漏行且缺乏字符级置信度,让传统错误捕获机制失效。文章将大模型 OCR 划分为后处理修正、原生视觉模型转录和智能体编排三类架构,指出传统字符错误率难以反映高熵字段的真实准确率。针对这一缺陷,工程落地需通过版面预分割、按元素路由模型、多轮验证闭环以及绑定像素包围盒溯源来构建可证伪的解析流程。
推荐理由:解析了大模型处理文档时出现隐蔽错误的生成机制,并给出了通过系统编排与证据溯源降低静默失效风险的工程方案。
LlamaIndex 提出文档 OCR 与解析不会成为通用大模型的普通内置功能,专用解析引擎在准确率与成本的帕累托前沿上将持续领先。前沿模型主要针对数学、编程和工具调用优化,在空间定位与结构化还原上表现较弱,在 ParseBench 基准中落后专用方案约 20 分。通过难度路由、可验证奖励的强化学习微调、直接提取文件容器元数据以及评测闭环,专用引擎能以远低于通用 VLM 的成本实现更高精度。
推荐理由:原文结合评测基准与工程实践,系统论证了垂直解析引擎在准确率与成本上持续超越通用前沿模型的底层逻辑。
智能 OCR 将传统字符识别与机器学习、版面感知、语义提取及视觉语言模型相结合,直接将企业文档转化为对齐 Schema 的结构化数据。相比传统 OCR 仅输出扁平文本,智能 OCR 能保留表格与键值对等层级关系,并支持字段级置信度评分与规则校验。这推动了文档处理向具备自主推理与验证能力的智能体文档工作流演进。
Cerebras 深入分析了 AI Agent 自主循环机制(Loop)的演进,指出循环的核心在于引入可靠的验证器(Verifiers)而非单纯追求自主性。随着多模态视觉检查能力、MCP 等工具调用协议以及超高速推理的成熟,Agent 能够自主比对输出并低成本迭代修复;同时开发者必须设定明确的完成标准与禁止规则,以避免循环陷入死循环或投机作弊。
推荐理由:原文梳理了自主循环工作流依赖多模态验证器与高速推理的演进逻辑,为构建防失控的 Agent 提供了实践参考。
Cerebras 宣布在其推理平台上推出 Google DeepMind 开源模型 Gemma 4 31B,以超过 1,800 tokens per second(第三方测得 1,851 TPS)的吞吐运行,成为该晶圆级计算平台首个支持图像理解的多模态模型。
推荐理由:原文给出了 1,851 tokens per second 的多模态推理吞吐与首 token 延迟数据,读者可据此评估极速视觉智能体工作流的落地可行性。
Cerebras 宣布在其晶圆级芯片架构上部署 Google 最新开源多模态模型 Gemma 4 31B,推理速度达到约 2,300 tok/s,实现全流程实时交互。
推荐理由:材料通过实测对比与实操经验,展示了高推理吞吐如何将多模态模型从异步批处理转变为实时交互应用。
LlamaIndex 提出了面向 10 至 100 份文档临时数据室场景的即时智能体 OCR(Just-in-Time Agentic OCR)模式,通过两阶段处理降低 VLM 全量解析的高昂成本与延迟。
推荐理由:文章拆解了即时智能体 OCR 的两阶段处理机制,为百篇内临时文档集的低成本精准解析提供了清晰的落地参考。
vLLM 团队发文阐述了 vLLM Semantic Router(VSR)将图像证据转化为可信路由信号的技术实践。排查显示多模态路由决策失准并非编码器能力不足,而是 Rust/Candle 绑定中注意力池化头、图像归一化及预处理插值差异导致;经针对性修复后,图像嵌入与 PyTorch 参考实现的余弦相似度达到 0.999 以上,确保了图像与文本信号在同一策略框架下的可靠协同。
多数智能文档处理(IDP)平台在生产环境中常因文档多样性、模板依赖及非文本内容而失效,演示环境与实际生产的准确率差距往往达 10 到 20 个百分点。传统系统无法有效提取图表、架构图和图像中的关键信息,导致后续业务依赖大量人工复核。新一代智能体(Agentic)IDP 则通过 LLM 编排层,将文本、表格与图表分别动态路由至最适配的模型进行解析。
vLLM-Omni 宣布集成 Intel 的 AutoRound 训练后量化算法,支持在 Intel XPU 和 NVIDIA GPU 上对多模态 Omni、扩散视频及图像生成模型进行 W4A16 量化推理。
推荐理由:原文给出了端到端离线量化与直接部署的工作流及实测数据,读者可以据此评估多模态与扩散模型在低显存环境下的推理部署方案。
LlamaIndex 发文分析了通用视觉语言模型(VLM)在解析表单时的核心局限,指出表单包含复杂的嵌套层级与控件关联,通用模型极易在复选框状态识别、边界框定位及字段归因中出错。团队介绍了 LlamaParse 采用的树形 JSON 数据结构,并结合专用的复选框状态分类器与边界框检测模型来保证审计追溯能力。目前该表单解析增强功能已在 LlamaCloud 的相关服务档位中开放配置调用。
推荐理由:文章详细剖析了通用视觉模型在表单识别中的多类隐蔽失效模式,为复杂文档与数据抽取提供了针对性的结构化处理方案。
现代应付账款自动化正从传统基于模板的 OCR 转向结合视觉语言模型(VLM)与机器学习的智能文档解析。LlamaParse 与 LlamaIndex 将 OCR 整合进统一的解析与索引工作流中,能够精准提取发票行项目及表格结构,完成数据校验后直接对接 ERP 系统。该方案可有效降低人工录入错误、大幅缩短处理周期,并提供可追溯的审计记录。
Agentic OCR 将推理能力、自纠错循环与多模态语言模型引入文档处理流程,解决传统 OCR 和 IDP 因版面变动易失效且无法理解内容的痛点。系统通过视觉定位将抽取数据精准关联回页面像素位置,提供可审计引用并实现免模板自适应解析。由语言模型编排的多个子智能体还可协同校验数值一致性,并将新文档格式的适配耗时缩短至数分钟。
现代图像 OCR 已从基础字符识别演进为涵盖版面保留与表格提取的文档智能,直接影响下游 LLM 与 RAG 工作流的质量。开源引擎如 Tesseract、PaddleOCR、EasyOCR 和 docTR 适合高可控与私有化部署需求,而 Google Cloud、Amazon Textract 与 Azure 等云端 API 则提供开箱即用的文档理解能力。
传统 OCR 流水线因仅优化字符转录而缺乏结构理解,面对版面多变的收据极易导致下游自动化失效。LlamaCloud 采用基于 VLM 的统一智能体 OCR 架构,将视觉识别、版面理解、结构化推理与数值校验循环整合至单一引擎。该方案消除了繁琐的正则规则维护,可直接输出保留字段层级与行项目关系的结构化 JSON、Markdown 或 HTML 数据。