在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音
Amazon SageMaker JumpStart 现支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型,提供全托管实时推理端点,可从数秒参考音频克隆说话人音色,无需重新训练。该模型覆盖 10 种语言,支持跨语言克隆和流式生成,输出 24 kHz 音频。用户可通过 SageMaker Python SDK 部署,并利用 CloudWatch 指标监控端点规模。
Amazon SageMaker JumpStart 现支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型,提供全托管实时推理端点,可从数秒参考音频克隆说话人音色,无需重新训练。该模型覆盖 10 种语言,支持跨语言克隆和流式生成,输出 24 kHz 音频。用户可通过 SageMaker Python SDK 部署,并利用 CloudWatch 指标监控端点规模。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零创建自定义角色声音、逐行导演台词,并覆盖 100 多种语言。
推荐理由:原文给出了两款新语音模型的能力边界、开放入口和评测表现,读者可据此判断其适用场景。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可自主解决高达 65% 的客服来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款语音模型的定位差异、基准成绩和开放渠道,读者可以据此判断它们适合哪些语音智能体场景。