AI 新闻周报:Opus 5.5 领跑解释视频,多款模型与工具更新
本周 AI 新闻汇总:Claude Opus 5.5 在 SimpleBench 上以 88.4% 领先,并因生成解释视频而广受好评;GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro 等模型发布或更新。
推荐理由:原文汇总了本周多款前沿模型与工具的动态,读者可快速了解各模型在评测与成本上的相对表现。
本周 AI 新闻汇总:Claude Opus 5.5 在 SimpleBench 上以 88.4% 领先,并因生成解释视频而广受好评;GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro 等模型发布或更新。
推荐理由:原文汇总了本周多款前沿模型与工具的动态,读者可快速了解各模型在评测与成本上的相对表现。
AI Evaluator Forum 发布 AEF-1,提出第三方 AI 评估的基线标准,涵盖访问权限、利益冲突、资助关系、回避与透明度。Anthropic 的 Dario 发文承诺单方面向嵌入式第三方评估员(如 METR)提供接近内部风险团队的访问权限,包括办公室工位、门禁和公司笔记本。