Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款语音模型的定位差异、基准成绩和开放渠道,读者可以据此判断它们适合哪些语音智能体场景。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款语音模型的定位差异、基准成绩和开放渠道,读者可以据此判断它们适合哪些语音智能体场景。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了模型在分辨率、更新频率和降水精度上的具体提升,读者可以据此判断新一代天气模型的实际能力。
Google DeepMind 发布 Gemini 3.7 Flash,这是其 Flash 系列中最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。
推荐理由:原文给出了新模型在编码、知识工作和网页开发上的具体基准提升,读者可据此判断其性价比与适用场景。
Google DeepMind 发布大规模多语种手语转文本(SL2T)模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的转写。
推荐理由:原文给出了模型的技术路线、数据规模和落地入口,读者可以据此判断手语 AI 从实验室走向消费产品的实际进展。
Google DeepMind 发布开源实验模型 DiffusionGemma,这是一个 26B 参数的 MoE 模型,通过文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。
推荐理由:原文给出了速度、参数量和硬件门槛等关键数字,读者可以据此判断它适合哪些本地交互场景。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达和低延迟(70ms)特性。模型可通过 API 使用,定价为每 1k 字符 $0.016,并提供开源权重版本。
推荐理由:原文给出了 Voxtral TTS 的参数量、定价、延迟和与 ElevenLabs 的对比评测,读者可据此评估它在语音智能体场景中的可用性。
Mistral 发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型。
推荐理由:Mistral Small 4 将推理、多模态与智能体编码能力统一到一个开源模型中,并给出可配置推理强度与效率数据,便于评估其部署价值。