谷歌测试“Call for Me”功能:支持Gemini代用户致电商家
谷歌正在测试名为“Call for Me”的新功能。该功能基于旗下大模型Gemini,能够代表用户直接拨打电话联系各类商家,以协助处理咨询或预约等事务。此举展现了谷歌在将AI助手与日常实际任务深度结合、推进自动化语音代理应用方面的最新探索与尝试。
谷歌正在测试名为“Call for Me”的新功能。该功能基于旗下大模型Gemini,能够代表用户直接拨打电话联系各类商家,以协助处理咨询或预约等事务。此举展现了谷歌在将AI助手与日常实际任务深度结合、推进自动化语音代理应用方面的最新探索与尝试。
谷歌宣布为 Gemini 3.8 Live 推出 Live Avatar 功能,为原生实时对话模型提供接近实时的视觉呈现。该功能融合视频生成与语音技术,具备精准唇形同步、自然面部表情,并支持在97种语言间无缝切换。依托高级推理与异步工具调用能力,该虚拟人可在后台执行复杂任务的同时保持对话不中断。目前企业支持自定义形象,且所有生成音视频均嵌入 SynthID 隐形水印以保障安全。
最新报道显示,黑客正在通过操纵OpenAI的ChatGPT和谷歌的Gemini等主流生成式AI平台,将用户引导至诈骗中心及恶意平台。该事件凸显了大语言模型在内容输出审查、防范提示词注入与恶意操纵等安全防护机制上的薄弱环节,为生成式AI的合规与安全治理敲响警钟。目前素材信息有限,黑客具体的操纵手法与受影响用户规模尚未完全披露。
谷歌正在为 Chrome 浏览器推出多项新功能,旨在简化复杂课题的研究与学习流程。其中,跨设备标签页切换功能获得了“记忆”升级,支持用户在切换到新设备时保留此前浏览的具体位置。此外,内置于 Chrome 的 Gemini 模型也迎来能力拓展,能够分析更多类型的媒体内容,并支持自动生成互动式学习测验,为用户提供更高效的网页研究体验。
Gemini 企业 Agent 平台现已开启智能体异常检测(Agent Anomaly Detection)的私有预览。该功能作为带外监管层,通过分析 OpenTelemetry 链路追踪和工具调用来捕捉行为风险,且不增加实时请求延迟。系统结合轻量统计扫描与基于 LLM 的深度推理,基于 OWASP Agentic Top 10 识别逻辑异常和违规行为。开发者可在 Security Command Center 中处理告警,或通过 API 编程阻断超出风险阈值的后续工具调用。
该内容探讨了如何借助 Gemini Enterprise Agent Platform 将 AI Agent 的安全机制从静态构建期控制转向动态运行时治理。平台提供了三大托管防御方案:用于边缘提示词审查的 Model Armor、对照业务规则评估工具调用意图的语义治理策略,以及捕获多轮对话攻击的 Agent 异常检测。通过将安全能力下沉至平台层,管理员无需修改或重新部署代码即可动态执行安全策略并抵御复杂攻击。
ADK 现已提供原生实时评估功能,旨在帮助开发者将实时语音智能体从 Demo 顺利推向生产环境。该功能允许开发者利用由 Gemini TTS 生成真实音频的 LLM 模拟用户,对基于图的智能体工作流进行多轮对话测试。通过定义评估场景和自然语言评分准则,系统可自动对语音回复和工具执行进行打分。测试结果既可在 ADK Web 中审查,也可通过 CLI 无缝集成至 CI/CD 流程中。
谷歌正推出一项早期实验性功能,允许用户将拨打本地商家的电话委托给 Gemini 处理,例如餐厅预约、查询商品库存或改期预约等。据谷歌介绍,用户甚至无需亲自拨号或发起通话,Gemini 即可全流程代为接管并完成沟通,旨在帮用户免去在电话中长时间排队等待的困扰。素材提及该功能正面向相关设备开展测试。
谷歌发布了两款全新文本转语音模型:Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持超过100种语言。其中 Flash TTS 能够根据文本提示词直接从零设计全新声音,两款模型均允许用户为特定台词添加舞台动作指示,并支持通过单一脚本生成逼真的双人对话。此外,模型还配备了声音克隆功能,仅需30秒的音频样本即可快速建立声音特征档案。
YouTube 正在为其创作者工作室集成一系列原生 AI 工具以辅助视频创作。新功能包括可分析脚本和粗剪内容的故事叙述助手,以及基于 Gemini 的对话式 Shorts 视频剪辑助手。此外,平台还推出了智能缩略图工具,并新增实时直播翻译功能,目前支持将英语直播即时翻译为西班牙语。这些功能的加入旨在全面提升创作者从前期策划到后期制作的分发效率。
YouTube 推出全新的自定义信息流功能,允许用户使用自然语言描述自己想要观看的视频内容。该功能借助谷歌 Gemini 大模型的技术支持,根据用户的具体提示词构建高度个性化的视频推荐流。这改变了以往用户只能被动接受平台推荐的模式,使用户能够以对话形式直接定义和掌控算法的内容分发逻辑。