跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 21–40 条 · 共 58 条
6月11日周四
  1. Google DeepMind78

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 上文本生成速度最高提升 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,这是一个 26B 参数的 MoE 模型,通过文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。

    推荐理由:原文给出了速度、参数量和硬件门槛等关键数字,读者可以据此判断它适合哪些本地交互场景。

6月9日周二
  1. Google DeepMind82

    Google 发布 Gemini 3.5 Live Translate,支持 70+ 语言实时语音翻译

    Google 发布 Gemini 3.5 Live Translate,这是其最新的音频模型,可在 70 多种语言间进行近实时的语音到语音翻译,并保留说话者的语调、节奏和音高。

    推荐理由:原文给出了新模型在延迟、语种覆盖和产品落地上的具体变化,读者可以据此判断它对实时翻译场景的实际影响。

6月8日周一
  1. Google DeepMind75

    Google DeepMind 发布塞拉利昂AI教学试验结果:数学成绩提升显著

    Google DeepMind 公布了在塞拉利昂进行的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组高出 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的学习进步。

    推荐理由:原文给出了预注册试验的量化结果和交互数据,读者可据此评估AI辅助教学的实际效果与局限。

5月29日周五
5月28日周四
  1. Google Research62

    Google 发布零信任聚合方案,为端侧私有分析提供新安全设计

    Google Research 发布零信任聚合方案,结合新型格基密码协议与可信执行环境(TEE),让设备以单次消息提交数据,无需多轮在线交互。该方案确保 Google 只能获得匿名聚合结果,单个用户原始数据在任何服务器内存中都不会被重建。Android SafetyCore 将采用此方案评估安全工具的有效性,同时保证用户内容仅存于设备端。

    推荐理由:原文介绍了零信任聚合的新密码学方案,读者可借此了解端侧隐私分析如何在单次提交下兼顾安全与效率。

5月20日周三
5月18日周一
  1. Google DeepMind62

    Project Genie 接入 Street View 并面向 Google AI Ultra 订阅者全球开放

    Google DeepMind 宣布 Project Genie 新增 Street View 落地能力,用户可基于美国真实地点生成可交互的虚拟世界,并可选 Ocean World、B&W film 等风格。该功能即日起逐步向全球 18 岁以上 Google AI Ultra 订阅者开放,未来将扩展至更多地区。

    推荐理由:原文给出了Street View落地能力与订阅开放范围,读者可据此判断Genie在真实世界模拟上的实际可用性。

5月17日周日
  1. Google DeepMind70

    Google 推出 Gemini for Science:科学智能体工具与实验集

    Google 发布 Gemini for Science,包含 Google Labs 上的三个实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)以及 Google Antigravity 上的 Science Skills 技能包。

    推荐理由:原文给出了面向科研场景的智能体工具集和开放入口,读者可以据此判断它如何加速科学发现流程。

  2. Google DeepMind62

    Google 扩展内容溯源与验证工具,覆盖搜索、Chrome、Pixel 和云端

    Google 宣布扩展内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud。SynthID 已为超 1000 亿张图片和视频及 6 万小时音频加水印,Gemini 应用中的 SynthID 验证功能已被使用 5000 万次,现正扩展到 Search 和 Chrome。

    推荐理由:原文给出了内容溯源工具在搜索、Chrome、Pixel 和云端的扩展路径,读者可以据此判断行业内容验证标准的走向。

5月16日周六
  1. Google DeepMind60

    Google DeepMind 展示 Co-Scientist 加速肝病机制发现

    Google DeepMind 发布博客,展示其 AI 智能体 Co-Scientist 在爱丁堡大学的应用:研究人员用它梳理代谢功能障碍相关脂肪性肝炎(MASH)的文献,生成候选联合疗法假设。系统针对药物 resmetirom 仅对部分患者有效的问题,提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假设随后得到实验验证。

    推荐理由:原文展示了 Co-Scientist 在真实科研问题中生成可验证假设的完整案例,读者可据此评估其辅助科研发现的实际价值。

  2. Google DeepMind78

    Google DeepMind 详解 WeatherNext 如何帮助美国国家飓风中心提前五天预测飓风 Melissa 登陆牙买加

    Google DeepMind 发文介绍其 AI 天气模型 WeatherNext 在 2025 年飓风 Melissa 预报中的作用。该模型提前五天以 80% 置信度预测飓风将以 Category 5 强度登陆牙买加,提前三天置信度接近 100%,这是首次从如此低的初始风速成功预测风暴达到 Category 5 强度。

    推荐理由:原文展示了 WeatherNext 在飓风 Melissa 预报中的实际表现,读者可借此了解 AI 天气模型在极端事件中的能力边界。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手,开放个人研究者申请

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科学假设。该系统通过假设生成工具向个人研究者开放,并已在肝纤维化、ALS、细胞衰老等研究中取得成果,包括发现一个在实验室测试中阻断91%疤痕相关反应的药物候选。

    推荐理由:原文给出了多智能体系统的完整架构和多个真实科研应用案例,读者可以据此判断它在假设生成上的实际能力与开放入口。

5月6日周三
  1. Google DeepMind78

    Google DeepMind 发布 AlphaEvolve 年度影响报告

    Google DeepMind 发布 AlphaEvolve 年度影响报告,展示其作为 Gemini 驱动的编码智能体在多个领域的应用成果。在基因组学中,AlphaEvolve 改进 DeepConsensus 模型,将变异检测错误率降低 30%;在电网优化中,将 GNN 模型找到可行解的能力从 14% 提升至超过 88%。

    推荐理由:原文汇总了 AlphaEvolve 在基因组学、电网、量子物理和商业场景中的具体成果,读者可据此评估其跨领域应用价值。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 研究计划,探索医疗 AI 协作新模式

    Google DeepMind 宣布 AI co-clinician 研究计划,旨在让 AI 智能体在医生临床监督下协助患者护理。在 98 个基层医疗查询中,该系统在 97 例中零关键错误;在 OpenFDA RxQA 开放式药物问答上超越前沿模型。

    推荐理由:原文给出了AI co-clinician在临床证据合成、药物问答和远程医疗多模态交互上的实测结果,读者可据此判断医疗AI当前的能力边界。

  2. Google Research62

    Google Research 展示 ERA 在流行病预测、宇宙学、气候监测和神经科学中的四种应用

    Google Research 发文介绍其 Empirical Research Assistance(ERA)在四个领域的实际应用:在公共卫生方面,ERA 生成的流感。

    推荐理由:原文展示了ERA在流行病预测、宇宙学、气候监测和神经科学四个领域的实际应用,读者可以了解AI辅助科研工具从基准测试走向真实场景的进展。

4月23日周四
  1. Google Research62

    Google Photos 推出 Auto frame 功能,用 3D 感知重构图修复拍摄角度

    Google 宣布在 Google Photos 的 Auto frame 功能中推出新的 3D 感知图像编辑方法,可自动调整照片的相机视角和焦距,修复广角镜头造成的透视畸变。该方法分两步:先用 ML 模型估计 3D 场景和相机参数,再用生成式扩散模型补全新视角下缺失的内容,现已面向含人物的照片开放。

    推荐理由:原文给出了技术原理和产品入口,读者可以据此判断这项功能对日常照片编辑的实际价值。

4月22日周三
  1. Google DeepMind70

    Google DeepMind 提出 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练任务拆分到解耦的计算岛之间异步传输数据,以降低带宽需求并提升硬件故障下的韧性。

    推荐理由:原文给出了跨数据中心训练架构的带宽需求和故障恢复实测数据,读者可以据此评估它在规模化训练中的实际价值。

4月16日周四
  1. Google Research62

    Google 发布 Simula 框架:从第一性原理设计合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文,介绍推理优先的合成数据生成框架 Simula。Simula 采用无种子、智能体的方式,通过全局与局部多样化、复杂化和双批评质量检查四个可控轴生成数据集,并在五个领域验证了机制设计对数据质量与下游性能的关键作用。

    推荐理由:原文把合成数据生成重构为机制设计问题,并给出可独立控制的多样性、复杂度与质量轴,适合想系统化构建训练数据集的读者参考。

  2. Google DeepMind62

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,主打更强的可控性、表现力和质量。该模型在 Artificial Analysis TTS 榜单上取得 Elo 1211 分,支持 70 多种语言和原生多说话人对话,并引入音频标签功能,可通过自然语言指令精细控制语速、语气和表达。

    推荐理由:官方介绍了新 TTS 模型的音频标签控制能力和评测成绩,读者可据此判断其表达力与可控性提升。