跳到正文

#模型发布

今日 0 条
9月16日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。

    推荐理由:原文给出了两款语音模型的定位差异、基准成绩和开放渠道,读者可以据此判断它们适合哪些语音智能体场景。

9月3日周四
8月14日周五
8月12日周三
  1. Google DeepMind80

    Google DeepMind 发布手语转文本模型 SL2T,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语种手语转文本(SL2T)模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的转写。

    推荐理由:原文给出了模型的技术路线、数据规模和落地入口,读者可以据此判断手语 AI 从实验室走向消费产品的实际进展。

6月11日周四
  1. Google DeepMind78

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 上文本生成速度最高提升 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,这是一个 26B 参数的 MoE 模型,通过文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。

    推荐理由:原文给出了速度、参数量和硬件门槛等关键数字,读者可以据此判断它适合哪些本地交互场景。

3月24日周二
  1. Mistral AI73

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达和低延迟(70ms)特性。模型可通过 API 使用,定价为每 1k 字符 $0.016,并提供开源权重版本。

    推荐理由:原文给出了 Voxtral TTS 的参数量、定价、延迟和与 ElevenLabs 的对比评测,读者可据此评估它在语音智能体场景中的可用性。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4:统一推理、多模态与智能体编码能力的开源模型

    Mistral 发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型。

    推荐理由:Mistral Small 4 将推理、多模态与智能体编码能力统一到一个开源模型中,并给出可配置推理强度与效率数据,便于评估其部署价值。