中国各地加速推动AI视频产业化,面临产能过剩与商业落地考验
随着制作成本大幅降低,中国各地政府正积极推动AI视频与电影产业化落地。数据显示AI短剧制作成本已降至每分钟数百元,博纳影业制作的首部获批公映AI院线电影《三星堆未来启示录》也计划年内上映。然而,海量低成本作品集中涌现也引发了产能过剩隐忧,短视频平台上线的20余万部新AI视频中仅极少数能突围获得过亿播放量。
随着制作成本大幅降低,中国各地政府正积极推动AI视频与电影产业化落地。数据显示AI短剧制作成本已降至每分钟数百元,博纳影业制作的首部获批公映AI院线电影《三星堆未来启示录》也计划年内上映。然而,海量低成本作品集中涌现也引发了产能过剩隐忧,短视频平台上线的20余万部新AI视频中仅极少数能突围获得过亿播放量。
根据美国国防部的预算申请,美国政府计划在未来五年内投入3030万美元开发升级版测谎系统。该项目被称为“Polygraph+”或“Polygraph Next”,重点研究利用人工智能和机器学习的评分算法,并结合“远距离传感”(standoff sensing)技术,以提升测谎评估的准确性与非接触式检测能力。
针对药物研发中毒性预测面临的样本严重失衡、骨架泛化差以及缺乏临床可解释性等难题,研究人员提出了多模态网络架构 SMILESGNN。该模型通过交叉注意力机制,融合了 SMILES Transformer 编码器与 GATv2 图编码器,弥补了单一序列模型无法提供图归因解释的缺陷。此外,研究还推出了预训练变体 SMILESGNN-PT,有效提升了分子表征的泛化性能与临床解释能力。
ArGuard 是一项针对阿拉伯语有害内容检测的共享评测任务。该任务分为两个赛道:Track A 聚焦于阿拉伯语多模态梗图的仇恨言论检测,Track B 则针对阿拉伯语大语言模型安全评估中的有害提示词检测。共有35支团队参与最终评估,广泛测试了 AraBERT、Jais 及 Qwen3-VL 等模型。结果显示提示词安全检测表现优异,而细粒度梗图分类最具挑战性。
谷歌宣布为 Gemini 3.8 Live 推出 Live Avatar 功能,为原生实时对话模型提供接近实时的视觉呈现。该功能融合视频生成与语音技术,具备精准唇形同步、自然面部表情,并支持在97种语言间无缝切换。依托高级推理与异步工具调用能力,该虚拟人可在后台执行复杂任务的同时保持对话不中断。目前企业支持自定义形象,且所有生成音视频均嵌入 SynthID 隐形水印以保障安全。
本文介绍了在 Cerebras 高速算力平台上部署 Gemma 4 多模态模型的实践案例,展示了团队构建的三款快速多模态 AI 应用。内容聚焦于图像理解能力、视觉工作流搭建以及面向开发者的极速推理体验,为开发者利用前沿硬件加速多模态模型落地提供了参考。
Cerebras 宣布在其算力平台上支持 Gemma 4 31B 模型,推理生成速度超过每秒 1,800 个 token,将其超高速推理能力拓展至多模态领域。开发者可依托该低延迟算力支持,构建高响应速度的计算机视觉、文档解析、屏幕截图识别以及智能体(Agentic AI)工作流,显著提升端到端交互效率。
针对非心脏大手术后急性肾损伤(AKI)早期术中风险分层难的问题,该研究提出了一种名为 SynerT 的纯波形混合时序骨干网络。该网络结合了因果扩张时间卷积网络(TCN)与分层扩张循环层,用于编码术中早期生理轨迹。此外,研究还构建了引入结构化临床背景的多模态扩展变体 SynerT-MM 进行晚期融合预测。注:输入素材尾部存在文本截断,后续具体融合细节未完全展示。
针对基层医疗中早期卒中风险信号分散于常规指标与非结构化临床文本的难题,研究人员提出了多模态门控架构 MedGate-Fusion。该模型通过 Transformer 提取患者初次就诊叙述的语义嵌入,并与 10 项常规生理风险标志物进行多模态融合。研究基于加拿大基层医疗监测网络(CPCSSN)的电子病历数据,构建了包含超 10 万名患者的初诊队列,旨在实现前瞻性卒中风险分层。
针对网页智能体在实时环境中评估存在状态漂移、难以稳定复现和开展可控训练研究的痛点,研究团队提出了离线评估基准 WebMRE。该基准基于 WebArena 的成功轨迹构建,包含 541 个任务和 5,293 个步骤,配备经过全面审计的测试标签和确定性评估协议,无需运行环境即可确保同一检查点在多次运行中输出一致评分。每个步骤将人类指导语句与具体动作配对,首次实现了对引导与动作相互强化机制的离线研究。
研究人员提出了 ShowTellArena,这是一个用于评估智能体在观看带有口述解说的业务演示后其理解能力的基准测试协议与公开数据集。该基准模拟了人类通过“边演示边讲解”指导新同事的场景。v1.0 版本涵盖财务、招聘、采购、客户决策、库存和物流等领域的 50 个业务工作流任务,包含屏幕录像、截图、旁白解说及 502 道评估试题,旨在系统性测试智能体对复杂商业流程的掌握水平。
针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。
该方案展示了如何在 AWS 上利用智能体架构构建对话式视频智能分析系统。系统通过 Strands Agents SDK 构建单一智能体,在运行时动态编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe 等多项服务,自主决策调用对应模块,使用户能够通过自然语言对视频内容提问,并在数秒内获得精准解答。
本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。
公共部门机构日常需处理大量如执法记录仪视频和扫描文档等非结构化证据。本文介绍了如何将 Amazon Bedrock 数据自动化与模型上下文协议(MCP)相结合,将这些非结构化多模态数据转化为结构化洞察,并通过自然语言在 Salesforce Agentforce 智能体平台中实现无缝查询与交互分析。
开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。
Moonshot AI(月之暗面)开发的 Kimi K3 模型现已在 Amazon Bedrock 上线。该模型为开放权重架构,专为编程与知识工作场景优化。Kimi K3 具备原生视觉理解能力,支持高达 100 万 token 的上下文窗口,并提供显式提示词缓存(Prompt Caching)功能,可有效降低推理延迟与输入成本。
本文介绍了如何结合使用英伟达硬件视频解码库 PyNvVideoCodec 与大模型推理引擎 vLLM,在多 GPU 环境下实现视频字幕生成与视频描述任务的高效扩展。该方案通过硬件级视频解码加速数据预处理流程,有效解决了多模态视频理解任务中的数据吞吐瓶颈,提升了多卡并行推理的整体效率与性能表现。
文章介绍了如何将AI智能体工作流应用于物理AI系统的数字孪生准备与验证中。通过智能体工作流,AI能够自动巡检并解析3D场景,生成和编辑仿真所需的关键数据,从而大幅提升物理仿真环境的搭建效率,为具身智能与机器人等物理AI系统的训练与测试提供高质量的数字孪生支撑。
Google发布了Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款新型语音到语音(speech-to-speech)大模型,对标OpenAI的GPT-Live系列。开发者通过其WebSocket API构建了轻量级Web端体验工具,用户可在浏览器中选择模型、预设声音及系统提示词,体验支持随时打断的低延迟实时双向语音对话。
原生多模态,全新基座模型
原创 王召德、潘逢治 2026-06-11 19:44 浙江 当我们谈论“把大模型跑在手机上”时,速度始终是绕不开的核心问题。模型越大、参数越多,推理时的矩阵乘法运算量就越大。 随着 Arm 第二代可伸缩矩阵扩展 (SME2) 技术的普及,以及 MNN 推理引擎的深度适配,我们找到了一把打开端侧性能天花板的钥匙。只需在编译时开启一个开关,就能让 Qwen3-VL-4B 这样强大的多模态模型,在支持 SME2 的旗舰手机(如 vivo X300 等)上实现实时流畅推理。 本文,我们直接从工程落地的角度,手把手带你完成从引擎编译、模型部署到 APP 构建的完整流程,并用实测数据告诉你: 为什么这套组合拳能让 Qwen 在端侧起飞。 什么是 SME2? SME2 是 Armv9 架构中的一组高级 CPU 指令,它基于 SME 升级,核心突破在于引入了 ZA 矩阵累加器寄存器 和流式模式。传统 Neon 做矩阵乘需要手工将外积拆成向量乘再累加,而 SME2 中的 FMOPA 等指令可以一条指令完成一个矩阵 tile 的外积累加。 通过引入 SME2 指令集,Armv9 架构 CPU 能够在 AI 异构计算框架下,高效支持大语言模型推理、图像处理、自然语言处理、语音生成等实时移动端推理任务。 认识我们的工具箱 在开始实战前,我们先了解一下本次部署的核心组件: MNN : 阿里巴巴开源的端侧推理引擎,具备高性能、轻量级、高通用性的特点。支持 CNN、Transformer、LLM、扩散模型等