Google 发布 ERA 科学编码工具并开放 Computational Discovery 访问
Google 在 Nature 发表论文介绍其研究工具 ERA,该工具基于 Gemini 编写和优化科学代码,在基因组学、流行病学等多个基准上达到专家级水平。
推荐理由:ERA 的 Nature 论文与 Gemini for Science 工具同步落地,读者可据此判断 AI 科学编码工具的实际可用性。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google 在 Nature 发表论文介绍其研究工具 ERA,该工具基于 Gemini 编写和优化科学代码,在基因组学、流行病学等多个基准上达到专家级水平。
推荐理由:ERA 的 Nature 论文与 Gemini for Science 工具同步落地,读者可据此判断 AI 科学编码工具的实际可用性。
Google 发布 Gemini for Science,包含 Google Labs 上的三个实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)以及 Google Antigravity 上的 Science Skills 技能包。
推荐理由:原文给出了面向科研场景的智能体工具集和开放入口,读者可以据此判断它如何加速科学发现流程。
Google DeepMind 发布博客,展示其 AI 智能体 Co-Scientist 在爱丁堡大学的应用:研究人员用它梳理代谢功能障碍相关脂肪性肝炎(MASH)的文献,生成候选联合疗法假设。系统针对药物 resmetirom 仅对部分患者有效的问题,提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假设随后得到实验验证。
推荐理由:原文展示了 Co-Scientist 在真实科研问题中生成可验证假设的完整案例,读者可据此评估其辅助科研发现的实际价值。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科学假设。该系统通过假设生成工具向个人研究者开放,并已在肝纤维化、ALS、细胞衰老等研究中取得成果,包括发现一个在实验室测试中阻断91%疤痕相关反应的药物候选。
推荐理由:原文给出了多智能体系统的完整架构和多个真实科研应用案例,读者可以据此判断它在假设生成上的实际能力与开放入口。
Berkeley AI Research 发布综述,介绍自适应并行推理(APR)范式,让模型自行决定何时分解任务、并行生成多少线程以及如何协调。文章比较了 Multiverse、ThreadWeaver、Parallel-R1 等方法的推理系统设计与训练奖励机制,并讨论了并行化是否主要作为训练期探索脚手架等开放问题。
推荐理由:文章梳理了自适应并行推理这一范式的动机、实现与训练方法,并比较了不同方案的取舍,适合想了解推理扩展新方向的读者。
Google DeepMind 发布 AlphaEvolve 年度影响报告,展示其作为 Gemini 驱动的编码智能体在多个领域的应用成果。在基因组学中,AlphaEvolve 改进 DeepConsensus 模型,将变异检测错误率降低 30%;在电网优化中,将 GNN 模型找到可行解的能力从 14% 提升至超过 88%。
推荐理由:原文汇总了 AlphaEvolve 在基因组学、电网、量子物理和商业场景中的具体成果,读者可据此评估其跨领域应用价值。
Google DeepMind 宣布 AI co-clinician 研究计划,旨在让 AI 智能体在医生临床监督下协助患者护理。在 98 个基层医疗查询中,该系统在 97 例中零关键错误;在 OpenFDA RxQA 开放式药物问答上超越前沿模型。
推荐理由:原文给出了AI co-clinician在临床证据合成、药物问答和远程医疗多模态交互上的实测结果,读者可据此判断医疗AI当前的能力边界。
Mistral AI 发布 Workflows 公开预览,这是面向企业 AI 的编排层,提供持久执行、可观测性和人工审批能力,帮助将 AI 流程从概念验证推进到生产环境。
推荐理由:原文给出了企业级编排层的具体能力与部署模型,读者可据此判断它如何解决生产环境可靠性问题。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:官方发布稿给出了四个尺寸、上下文窗口和开源许可等关键规格,读者可据此评估其本地部署与微调价值。
Mistral AI 发布 Spaces CLI,一个为人类开发者和编码智能体共同设计的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。团队总结了设计原则:每个交互输入都有 flag 等价物、每个 flag 都有无头模式默认值、状态显式化、插件可内省、生成 context.json 和 AGENTS.md 上下文文件。
推荐理由:原文给出了 CLI 为智能体设计的完整原则清单,读者可据此改造自己的开发工具。
Mistral AI 发布 Forge 系统,企业可利用内部文档、代码库和运营数据训练定制模型,支持预训练、后训练和强化学习全流程,并兼容稠密与 MoE 架构及多模态输入。Forge 已与 ASML、爱立信、欧洲航天局等机构合作,模型可在企业自有基础设施内运行,同时支持智能体通过自然语言微调模型和优化超参数。
推荐理由:原文给出了企业自训模型的完整能力栈和已落地客户名单,读者可据此评估其与通用模型的差异。
Mistral 发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型。
推荐理由:Mistral Small 4 将推理、多模态与智能体编码能力统一到一个开源模型中,并给出可配置推理强度与效率数据,便于评估其部署价值。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用稀疏架构、6B 激活参数,Apache 2.0 协议开源,并已集成进 Mistral Vibe 及提供免费 API 端点。
推荐理由:原文给出了模型权重、评测分数和成本对比,读者可以据此判断它相对闭源竞品的性价比。
Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,自动读取 Rails 源码、生成或改进 RSpec 测试,并在 CI/CD 中无人干预运行。核心设计包括 AGENTS.md 提供执行计划、按文件类型拆分技能文件,以及 RuboCop 和 SimpleCov 自定义工具做最终校验。
推荐理由:原文完整展示了用 Vibe 构建自动生成 RSpec 测试的智能体,含 AGENTS.md、技能文件和自定义工具三层设计,读者可迁移到自己的测试场景。
Mistral 发布终端原生编码智能体 Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、执行前多选澄清、斜杠命令技能和统一智能体模式。Vibe 现已在 Le Chat Pro 和 Team 套餐上线,支持按量付费或自带 API key;Devstral 2 转为付费 API 访问,Experiment 计划仍提供免费额度。
推荐理由:原文给出了 Vibe 2.0 的新增控制能力和定价变化,读者可以据此判断它是否适合接入自己的开发工作流。
Mistral AI 发布下一代开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),两者均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 和 68.0% 的成绩。
推荐理由:原文给出了新模型在 SWE-bench Verified 上的成绩、与竞品的参数和成本对比,以及配套 CLI 工具,读者可以据此评估开源编码模型的性价比。
Mistral 推出 Le Chat 的 Memories(beta)功能,采用混合方式自动保存有用信息,并在召回时显示来源链接。用户可随时关闭记忆、使用无记忆的隐身对话、编辑或删除单条记忆,并支持导出和导入。官方还推出 Memory Insights 提示词,帮助用户探索记忆内容。
推荐理由:官方介绍了记忆功能的设计原则和具体能力,读者可以据此判断其透明可控的召回方式是否适合自己。
Mistral 为 Le Chat 推出 20 多个安全的企业级 MCP 连接器(测试版),覆盖 Databricks、Snowflake、GitHub、Atlassian、Asana、Stripe 等工具,支持搜索、总结和操作,并允许用户添加自定义 MCP 连接器。
推荐理由:原文给出了连接器目录、自定义 MCP 扩展和记忆功能的具体能力与开放范围,读者可据此判断 Le Chat 在企业工作流中的适用性。
Mistral AI 发布 Codestral 25.08 模型,接受补全数提升 30%,保留代码增加 10%,失控生成减少 50%,并改进指令遵循和代码能力。同时推出完整企业编码栈,包含 Codestral Embed 嵌入模型、Devstral 智能体模型和 Mistral Code IDE 插件,支持云端、VPC 或本地部署,已获 Capgemini、Abanca、SNCF 等企业采用。
推荐理由:原文给出 Codestral 25.08 的具体性能提升和完整企业级部署方案,读者可据此评估其与现有编码工具的差异。
Mistral 为 Le Chat 推出一批新功能,包括由工具增强的 Deep Research 代理驱动的深度研究模式、基于新语音模型 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言思考模式,以及基于 Black Forest Labs 技术的图像编辑功能。
推荐理由:官方一口气上线了深度研究、语音、推理和图像编辑四类新能力,读者可据此判断 Le Chat 的定位变化。