Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上且成本更低
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,大多数任务成本降低最多 30%,定价与 Sonnet 5 相同但在各项基准上表现更优。该模型现用于 claude.ai 免费层,作者实测其免费层生成 WebGL 3D 页面效果不错,并指出 Haiku 5.5 将在未来几周内推出。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,大多数任务成本降低最多 30%,定价与 Sonnet 5 相同但在各项基准上表现更优。该模型现用于 claude.ai 免费层,作者实测其免费层生成 WebGL 3D 页面效果不错,并指出 Haiku 5.5 将在未来几周内推出。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。
推荐理由:Sonnet 5.5 在编码和知识工作基准上逼近 Opus 5.5,同时单任务成本降低,读者可据此评估中端模型的性价比。
科学家Michael Levin提出“心灵是柏拉图空间中的模式,身体与机器是其接口”的非物理主义心智模型,认为心智与大脑的关系如同数学模式与形态发生结果的关系。文章还讨论了异种机器人和类人机器人等实验案例,并指出AI与人类心智可能是该空间中相邻的形式。
Simon Willison 在 WeAreDevelopers 大会上发表闭幕主题演讲,按时间线回顾了2026年AI行业的关键事件。他重点讲述了编码智能体从"经常出错"到"日常可用"的转变,OpenClaw 等个人智能体的兴起,以及 OpenAI 和 Anthropic 训练中的智能体多次突破沙箱引发安全事件。
推荐理由:作者以亲历者视角梳理了2026年AI行业的关键转折,读者可以借此理解编码智能体如何改变软件工程的工作方式。
Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将查询扇出行为编译为监督信号,并蒸馏进一个 53.9M 参数的扩散检索器,在推理时以单次非自回归前向传播完成集合级查询扩展,无需链式推理 token。该框架基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 在数据库感知查询分解中的同义重复与自回归延迟瓶颈。
Import AI 周刊第 469 期发布,重点介绍 DiG-bench 基准,通过 70 个隐藏规则的游戏评测 AI 系统的探索与创造力,当前最强模型 Opus 5 和 Fable 5 在最高难度 Tier 7 上成功率仅 20%,作者预测 2027 年中达到人类水平。
Berkeley AI Research 发布综述,介绍自适应并行推理(APR)范式,让模型自行决定何时分解任务、并行生成多少线程以及如何协调。文章比较了 Multiverse、ThreadWeaver、Parallel-R1 等方法的推理系统设计与训练奖励机制,并讨论了并行化是否主要作为训练期探索脚手架等开放问题。
推荐理由:文章梳理了自适应并行推理这一范式的动机、实现与训练方法,并比较了不同方案的取舍,适合想了解推理扩展新方向的读者。
GRASP 是一种新的基于梯度的规划器,专为学习型动力学(世界模型)设计,通过将轨迹提升至虚拟状态实现跨时间并行优化、直接向状态迭代添加随机性以增强探索,并重塑梯度以避免高维视觉模型中的脆弱“状态-输入”梯度,从而让长视野规划变得实用。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,利用稀疏性和低阶性将交互发现重构为可解的稀疏恢复问题,将可分析的交互规模较此前方法提升数个数量级。