谷歌推出Gemini 3.8 Flash TTS模型:支持通过文本描述生成全新AI声音
谷歌发布了两款全新文本转语音模型:Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持超过100种语言。其中 Flash TTS 能够根据文本提示词直接从零设计全新声音,两款模型均允许用户为特定台词添加舞台动作指示,并支持通过单一脚本生成逼真的双人对话。此外,模型还配备了声音克隆功能,仅需30秒的音频样本即可快速建立声音特征档案。
谷歌发布了两款全新文本转语音模型:Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持超过100种语言。其中 Flash TTS 能够根据文本提示词直接从零设计全新声音,两款模型均允许用户为特定台词添加舞台动作指示,并支持通过单一脚本生成逼真的双人对话。此外,模型还配备了声音克隆功能,仅需30秒的音频样本即可快速建立声音特征档案。
Anthropic发布Claude Opus 5.5,OpenAI随后推出GPT-6 Sol与Luna,两大厂商掀起新一轮价格战。Opus 5.5每百万Token输入/输出定价为4/20美元,缓存读取成本降至0.20美元;OpenAI的Sol与Luna价格则减半至2/10美元与0.10/0.50美元。第三方评测机构Artificial Analysis指出,Opus 5.5因任务Token消耗量增加,高负载下单任务实际成本与前代基本持平。
根据提供的新闻标题,Anthropic 或相关方发布了新一代旗舰大模型 Claude Opus 5.5。由于当前输入素材未提供详细摘要和正文内容,关于该模型的具体架构改进、性能评测基准、上下文窗口以及上线部署情况等细节信息暂不明确。
TypeSafe AI 近期发布了名为 Jev 的新型模型,将其定义为“系统一模型”(System One)或“决策模型”。与传统大模型输出文本不同,Jev 虽接收非结构化文本输入,但直接返回代表分类、是非判断、评级及置信度的浮点数,实现“输入非结构化状态,输出类型化概率决策”。该模型类似前沿智能函数调用,相比传统大语言模型具有更快的响应速度和更低的成本。
开源社区发布了 Bonsai 2 27B 模型及其相关量化版本。该模型通过先进的压缩与量化技术,在保持接近无损性能的前提下将模型体积缩减至原来的九分之一,其 GGUF 格式模型大小仅约 5.95 GB。开发者可以通过定制的 llama.cpp 分支运行时环境在本地设备(如 macOS 等)上部署和体验该高效压缩模型。
Google发布了Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款新型语音到语音(speech-to-speech)大模型,对标OpenAI的GPT-Live系列。开发者通过其WebSocket API构建了轻量级Web端体验工具,用户可在浏览器中选择模型、预设声音及系统提示词,体验支持随时打断的低延迟实时双向语音对话。