AIDC
DC AI 热点

全部 AI 动态

9月24日2026-09-24
The Decoder✦ 精选AI 评分 78/10001:39

谷歌推出Gemini 3.8 Flash TTS模型:支持通过文本描述生成全新AI声音

谷歌发布了两款全新文本转语音模型:Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持超过100种语言。其中 Flash TTS 能够根据文本提示词直接从零设计全新声音,两款模型均允许用户为特定台词添加舞台动作指示,并支持通过单一脚本生成逼真的双人对话。此外,模型还配备了声音克隆功能,仅需30秒的音频样本即可快速建立声音特征档案。

阅读原文 ↗推荐理由:谷歌新模型实现了通过文本提示词自定义音色及脚本化双人对话控制,显著提升了语音合成的可控性与创作自由度。另有 1 家信源报道# Google# Gemini# 语音# 语音生成# 声音克隆
9月23日2026-09-23
AI Roundup · X AI coding圈日报✦ 精选AI 评分 75/10014:00

Anthropic与OpenAI接连发布新模型打响价格战:Opus 5.5与GPT-6 Sol相继亮相

Anthropic发布Claude Opus 5.5,OpenAI随后推出GPT-6 Sol与Luna,两大厂商掀起新一轮价格战。Opus 5.5每百万Token输入/输出定价为4/20美元,缓存读取成本降至0.20美元;OpenAI的Sol与Luna价格则减半至2/10美元与0.10/0.50美元。第三方评测机构Artificial Analysis指出,Opus 5.5因任务Token消耗量增加,高负载下单任务实际成本与前代基本持平。

阅读原文 ↗推荐理由:头部大模型厂商接连推出新模型并大幅降低API调用价格,反映了大模型商业化竞争的最新趋势。另有 1 家信源报道# 大模型# OpenAI# Anthropic# 评测# 推理
9月22日2026-09-22
Anthropic 官方动态(网页)✦ 精选AI 评分 75/10008:00

Anthropic 推出 Claude Opus 5.5 模型

根据提供的新闻标题,Anthropic 或相关方发布了新一代旗舰大模型 Claude Opus 5.5。由于当前输入素材未提供详细摘要和正文内容,关于该模型的具体架构改进、性能评测基准、上下文窗口以及上线部署情况等细节信息暂不明确。

阅读原文 ↗推荐理由:涉及头部大模型系列 Claude Opus 的新版本发布动态,具备较高行业关注度。另有 1 家信源报道# 大模型# Claude# Anthropic# 推理# 自然语言处理
Simon Willison✦ 精选AI 评分 72/10007:09

TypeSafe AI 推出决策模型 Jev:专注概率决策输出的新型大模型形态

TypeSafe AI 近期发布了名为 Jev 的新型模型,将其定义为“系统一模型”(System One)或“决策模型”。与传统大模型输出文本不同,Jev 虽接收非结构化文本输入,但直接返回代表分类、是非判断、评级及置信度的浮点数,实现“输入非结构化状态,输出类型化概率决策”。该模型类似前沿智能函数调用,相比传统大语言模型具有更快的响应速度和更低的成本。

阅读原文 ↗推荐理由:展示了一种跳脱出传统文本生成的全新决策模型范式,为低成本、高速度的结构化推理提供了新方向。# 大模型# 推理# TypeSafe AI
9月18日2026-09-18
Simon Willison✦ 精选AI 评分 75/10006:13

Bonsai 2 27B模型发布:实现近无损压缩且体积缩减至九分之一

开源社区发布了 Bonsai 2 27B 模型及其相关量化版本。该模型通过先进的压缩与量化技术,在保持接近无损性能的前提下将模型体积缩减至原来的九分之一,其 GGUF 格式模型大小仅约 5.95 GB。开发者可以通过定制的 llama.cpp 分支运行时环境在本地设备(如 macOS 等)上部署和体验该高效压缩模型。

阅读原文 ↗推荐理由:展示了大模型极端压缩(近9倍压缩)并在端侧高效推理的最新落地实践。# 模型压缩# 大模型# 开源# 推理# 端侧AI
9月16日2026-09-16
Simon Willison✦ 精选AI 评分 75/10006:47

Google推出Gemini 3.8 Live语音模型,支持实时双向语音交互

Google发布了Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款新型语音到语音(speech-to-speech)大模型,对标OpenAI的GPT-Live系列。开发者通过其WebSocket API构建了轻量级Web端体验工具,用户可在浏览器中选择模型、预设声音及系统提示词,体验支持随时打断的低延迟实时双向语音对话。

阅读原文 ↗推荐理由:Google推出新一代实时语音大模型Gemini 3.8 Live,展示了低延迟语音双向交互与打断能力。另有 1 家信源报道# 大模型# 语音# 多模态# Google# 推理