Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上且成本更低
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,大多数任务成本降低最多 30%,定价与 Sonnet 5 相同但在各项基准上表现更优。该模型现用于 claude.ai 免费层,作者实测其免费层生成 WebGL 3D 页面效果不错,并指出 Haiku 5.5 将在未来几周内推出。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,大多数任务成本降低最多 30%,定价与 Sonnet 5 相同但在各项基准上表现更优。该模型现用于 claude.ai 免费层,作者实测其免费层生成 WebGL 3D 页面效果不错,并指出 Haiku 5.5 将在未来几周内推出。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。
推荐理由:Sonnet 5.5 在编码和知识工作基准上逼近 Opus 5.5,同时单任务成本降低,读者可据此评估中端模型的性价比。
GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。其对用户意图更强的理解能力,让 Basis 在实际应用中更有信心。
Google Research 发布 AI 视频联合导演框架,通过多智能体架构在 Gemini 和 Veo 之上实现长视频的视觉一致性规划。该框架包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别处理创意编排、视觉故事板、时序扩展和闭环优化,在 GenAD-Bench 上取得 81.4 的峰值质量分,并能在多分钟视频中缓解视觉漂移和错误传播。
推荐理由:原文给出了一套多智能体框架在长视频一致性上的完整方案和基准数据,读者可以据此评估其相对现有方法的实际增益。
Meta 宣布其 AI 助手 Muse 将很快登陆智能眼镜,并推出无摄像头版 Ray-Ban 眼镜及新款 VR 眼镜(明年春季上市,售价 1300 美元,重量为 Quest 3 的五分之一)。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零创建自定义角色声音、逐行导演台词,并覆盖 100 多种语言。
推荐理由:原文给出了两款新语音模型的能力边界、开放入口和评测表现,读者可据此判断其适用场景。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可自主解决高达 65% 的客服来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款语音模型的定位差异、基准成绩和开放渠道,读者可以据此判断它们适合哪些语音智能体场景。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了模型在分辨率、更新频率和降水精度上的具体提升,读者可以据此判断新一代天气模型的实际能力。
伯克利AI研究团队提出一种直接基于信息内容评估与优化成像系统的新框架,无需依赖人类可解读的图像或任务特定解码器。该信息度量在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测系统性能,且优化后的设计在匹配最先进端到端方法的同时,所需内存和计算更少。相关成果发表于NeurIPS 2025论文。