跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 41–60 条 · 共 64 条
5月20日周三
5月17日周日
  1. Google DeepMind70

    Google 推出 Gemini for Science:科学智能体工具与实验集

    Google 发布 Gemini for Science,包含 Google Labs 上的三个实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)以及 Google Antigravity 上的 Science Skills 技能包。

    推荐理由:原文给出了面向科研场景的智能体工具集和开放入口,读者可以据此判断它如何加速科学发现流程。

5月16日周六
  1. Google DeepMind60

    Google DeepMind 展示 Co-Scientist 加速肝病机制发现

    Google DeepMind 发布博客,展示其 AI 智能体 Co-Scientist 在爱丁堡大学的应用:研究人员用它梳理代谢功能障碍相关脂肪性肝炎(MASH)的文献,生成候选联合疗法假设。系统针对药物 resmetirom 仅对部分患者有效的问题,提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假设随后得到实验验证。

    推荐理由:原文展示了 Co-Scientist 在真实科研问题中生成可验证假设的完整案例,读者可据此评估其辅助科研发现的实际价值。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手,开放个人研究者申请

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科学假设。该系统通过假设生成工具向个人研究者开放,并已在肝纤维化、ALS、细胞衰老等研究中取得成果,包括发现一个在实验室测试中阻断91%疤痕相关反应的药物候选。

    推荐理由:原文给出了多智能体系统的完整架构和多个真实科研应用案例,读者可以据此判断它在假设生成上的实际能力与开放入口。

5月8日周五
  1. Berkeley AI Research62

    自适应并行推理:高效推理扩展的新范式综述

    Berkeley AI Research 发布综述,介绍自适应并行推理(APR)范式,让模型自行决定何时分解任务、并行生成多少线程以及如何协调。文章比较了 Multiverse、ThreadWeaver、Parallel-R1 等方法的推理系统设计与训练奖励机制,并讨论了并行化是否主要作为训练期探索脚手架等开放问题。

    推荐理由:文章梳理了自适应并行推理这一范式的动机、实现与训练方法,并比较了不同方案的取舍,适合想了解推理扩展新方向的读者。

5月6日周三
  1. Google DeepMind78

    Google DeepMind 发布 AlphaEvolve 年度影响报告

    Google DeepMind 发布 AlphaEvolve 年度影响报告,展示其作为 Gemini 驱动的编码智能体在多个领域的应用成果。在基因组学中,AlphaEvolve 改进 DeepConsensus 模型,将变异检测错误率降低 30%;在电网优化中,将 GNN 模型找到可行解的能力从 14% 提升至超过 88%。

    推荐理由:原文汇总了 AlphaEvolve 在基因组学、电网、量子物理和商业场景中的具体成果,读者可据此评估其跨领域应用价值。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 研究计划,探索医疗 AI 协作新模式

    Google DeepMind 宣布 AI co-clinician 研究计划,旨在让 AI 智能体在医生临床监督下协助患者护理。在 98 个基层医疗查询中,该系统在 97 例中零关键错误;在 OpenFDA RxQA 开放式药物问答上超越前沿模型。

    推荐理由:原文给出了AI co-clinician在临床证据合成、药物问答和远程医疗多模态交互上的实测结果,读者可据此判断医疗AI当前的能力边界。

4月27日周一
4月3日周五
3月31日周二
  1. Mistral AI62

    Mistral AI 发布 Spaces CLI,为人类与智能体共同设计

    Mistral AI 发布 Spaces CLI,一个为人类开发者和编码智能体共同设计的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。团队总结了设计原则:每个交互输入都有 flag 等价物、每个 flag 都有无头模式默认值、状态显式化、插件可内省、生成 context.json 和 AGENTS.md 上下文文件。

    推荐理由:原文给出了 CLI 为智能体设计的完整原则清单,读者可据此改造自己的开发工具。

3月18日周三
  1. Mistral AI60

    Mistral AI 推出 Forge,支持企业用专有数据训练前沿级模型

    Mistral AI 发布 Forge 系统,企业可利用内部文档、代码库和运营数据训练定制模型,支持预训练、后训练和强化学习全流程,并兼容稠密与 MoE 架构及多模态输入。Forge 已与 ASML、爱立信、欧洲航天局等机构合作,模型可在企业自有基础设施内运行,同时支持智能体通过自然语言微调模型和优化超参数。

    推荐理由:原文给出了企业自训模型的完整能力栈和已落地客户名单,读者可据此评估其与通用模型的差异。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4:统一推理、多模态与智能体编码能力的开源模型

    Mistral 发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型。

    推荐理由:Mistral Small 4 将推理、多模态与智能体编码能力统一到一个开源模型中,并给出可配置推理强度与效率数据,便于评估其部署价值。

3月11日周三
  1. Mistral AI67

    Mistral 用 Vibe 构建自动生成 Rails 测试的智能体

    Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,自动读取 Rails 源码、生成或改进 RSpec 测试,并在 CI/CD 中无人干预运行。核心设计包括 AGENTS.md 提供执行计划、按文件类型拆分技能文件,以及 RuboCop 和 SimpleCov 自定义工具做最终校验。

    推荐理由:原文完整展示了用 Vibe 构建自动生成 RSpec 测试的智能体,含 AGENTS.md、技能文件和自定义工具三层设计,读者可迁移到自己的测试场景。

1月28日周三
  1. Mistral AI70

    Mistral 发布终端原生编码智能体 Vibe 2.0

    Mistral 发布终端原生编码智能体 Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、执行前多选澄清、斜杠命令技能和统一智能体模式。Vibe 现已在 Le Chat Pro 和 Team 套餐上线,支持按量付费或自带 API key;Devstral 2 转为付费 API 访问,Experiment 计划仍提供免费额度。

    推荐理由:原文给出了 Vibe 2.0 的新增控制能力和定价变化,读者可以据此判断它是否适合接入自己的开发工作流。

12月9日周二
  1. Mistral AI78

    Mistral 发布 Devstral 2 系列编码模型及 Mistral Vibe CLI

    Mistral AI 发布下一代开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),两者均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 和 68.0% 的成绩。

    推荐理由:原文给出了新模型在 SWE-bench Verified 上的成绩、与竞品的参数和成本对比,以及配套 CLI 工具,读者可以据此评估开源编码模型的性价比。

9月2日周二
  1. Mistral AI62

    Mistral 推出 Le Chat 记忆功能(beta)

    Mistral 推出 Le Chat 的 Memories(beta)功能,采用混合方式自动保存有用信息,并在召回时显示来源链接。用户可随时关闭记忆、使用无记忆的隐身对话、编辑或删除单条记忆,并支持导出和导入。官方还推出 Memory Insights 提示词,帮助用户探索记忆内容。

    推荐理由:官方介绍了记忆功能的设计原则和具体能力,读者可以据此判断其透明可控的召回方式是否适合自己。

  2. Mistral AI62

    Mistral 发布 Le Chat 自定义 MCP 连接器与 Memories 记忆功能

    Mistral 为 Le Chat 推出 20 多个安全的企业级 MCP 连接器(测试版),覆盖 Databricks、Snowflake、GitHub、Atlassian、Asana、Stripe 等工具,支持搜索、总结和操作,并允许用户添加自定义 MCP 连接器。

    推荐理由:原文给出了连接器目录、自定义 MCP 扩展和记忆功能的具体能力与开放范围,读者可据此判断 Le Chat 在企业工作流中的适用性。

7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及完整企业编码栈

    Mistral AI 发布 Codestral 25.08 模型,接受补全数提升 30%,保留代码增加 10%,失控生成减少 50%,并改进指令遵循和代码能力。同时推出完整企业编码栈,包含 Codestral Embed 嵌入模型、Devstral 智能体模型和 Mistral Code IDE 插件,支持云端、VPC 或本地部署,已获 Capgemini、Abanca、SNCF 等企业采用。

    推荐理由:原文给出 Codestral 25.08 的具体性能提升和完整企业级部署方案,读者可据此评估其与现有编码工具的差异。

7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出深度研究、语音、推理与图像编辑新功能

    Mistral 为 Le Chat 推出一批新功能,包括由工具增强的 Deep Research 代理驱动的深度研究模式、基于新语音模型 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言思考模式,以及基于 Black Forest Labs 技术的图像编辑功能。

    推荐理由:官方一口气上线了深度研究、语音、推理和图像编辑四类新能力,读者可据此判断 Le Chat 的定位变化。