跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 48 条
7月1日周三
6月13日周六
  1. Google Research62

    Google Research 发布两项研究:AI 辅助用户理解皮肤状况的效果与局限

    Google Research 发布两项关于 AI 辅助用户理解皮肤状况的研究。一项发表于 JAMA Dermatology 的量化研究显示,使用 AI 工具时参与者命名皮肤状况的准确率(23%)约为未辅助对照组(8%)的三倍,但确定下一步医疗措施的能力未见显著提升。

    推荐理由:原文用两项研究数据说明AI辅助在皮肤病识别上的效果与局限,读者可据此评估此类工具的实际价值。

6月11日周四
  1. Google DeepMind78

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 上文本生成速度最高提升 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,这是一个 26B 参数的 MoE 模型,通过文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。

    推荐理由:原文给出了速度、参数量和硬件门槛等关键数字,读者可以据此判断它适合哪些本地交互场景。

6月9日周二
  1. Google DeepMind82

    Google 发布 Gemini 3.5 Live Translate,支持 70+ 语言实时语音翻译

    Google 发布 Gemini 3.5 Live Translate,这是其最新的音频模型,可在 70 多种语言间进行近实时的语音到语音翻译,并保留说话者的语调、节奏和音高。

    推荐理由:原文给出了新模型在延迟、语种覆盖和产品落地上的具体变化,读者可以据此判断它对实时翻译场景的实际影响。

5月28日周四
  1. Mistral AI65

    Mistral 在 AI Now Summit 2026 发布工业工程 AI 栈,升级 Vibe 智能体并宣布新建 10 MW 数据中心

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,与 Airbus、BMW、ASML 合作,覆盖设计、仿真与生产环节并保障数据安全。

    推荐理由:Mistral 在 AI Now Summit 2026 上同时发布工业工程 AI 栈、Vibe 智能体升级和 10 MW 数据中心,读者可以一次看清其企业级全栈布局。

5月27日周三
  1. Mistral AI60

    Mistral 推出物理 AI,将 Emmi AI 纳入企业平台加速工程仿真

    Mistral 宣布推出物理 AI,将 Emmi AI 纳入其企业平台,用于 AI 原生的工业工程。该模型可从几何和边界条件直接预测物理场,单次前向推理在单 GPU 上数秒完成,而传统 CFD/FEM 仿真需数小时到数周。物理 AI 可加速产品设计、工装工艺设计和实时数字孪生,已面向 ASML、Airbus、Safran 和 Siemens Energy 等合作伙伴开放。

    推荐理由:Mistral 将 Emmi AI 纳入企业平台,把物理仿真从小时级压缩到秒级,为工业设计流程带来数量级的探索空间。

5月18日周一
  1. Google DeepMind62

    Project Genie 接入 Street View 并面向 Google AI Ultra 订阅者全球开放

    Google DeepMind 宣布 Project Genie 新增 Street View 落地能力,用户可基于美国真实地点生成可交互的虚拟世界,并可选 Ocean World、B&W film 等风格。该功能即日起逐步向全球 18 岁以上 Google AI Ultra 订阅者开放,未来将扩展至更多地区。

    推荐理由:原文给出了Street View落地能力与订阅开放范围,读者可据此判断Genie在真实世界模拟上的实际可用性。

5月17日周日
  1. Google DeepMind62

    Google 扩展内容溯源与验证工具,覆盖搜索、Chrome、Pixel 和云端

    Google 宣布扩展内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud。SynthID 已为超 1000 亿张图片和视频及 6 万小时音频加水印,Gemini 应用中的 SynthID 验证功能已被使用 5000 万次,现正扩展到 Search 和 Chrome。

    推荐理由:原文给出了内容溯源工具在搜索、Chrome、Pixel 和云端的扩展路径,读者可以据此判断行业内容验证标准的走向。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手,开放个人研究者申请

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科学假设。该系统通过假设生成工具向个人研究者开放,并已在肝纤维化、ALS、细胞衰老等研究中取得成果,包括发现一个在实验室测试中阻断91%疤痕相关反应的药物候选。

    推荐理由:原文给出了多智能体系统的完整架构和多个真实科研应用案例,读者可以据此判断它在假设生成上的实际能力与开放入口。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 研究计划,探索医疗 AI 协作新模式

    Google DeepMind 宣布 AI co-clinician 研究计划,旨在让 AI 智能体在医生临床监督下协助患者护理。在 98 个基层医疗查询中,该系统在 97 例中零关键错误;在 OpenFDA RxQA 开放式药物问答上超越前沿模型。

    推荐理由:原文给出了AI co-clinician在临床证据合成、药物问答和远程医疗多模态交互上的实测结果,读者可据此判断医疗AI当前的能力边界。

4月13日周一
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先模型的重大升级,通过增强空间推理和多视角理解,让机器人更精准地感知环境。

    推荐理由:官方介绍了新模型在空间推理、多视角理解和仪表读取上的能力提升,并给出 API 开放入口,读者可据此评估其落地价值。

4月3日周五
3月29日周日
  1. Google DeepMind65

    Google DeepMind 发布 AI 指针,重新构想鼠标交互

    Google DeepMind 发布由 Gemini 驱动的 AI 指针原型,让用户通过指向和说话即可完成操作,无需编写复杂提示词。该能力已集成到 Chrome 中,用户可选中网页内容直接向 Gemini 提问,并即将在 Googlebook 推出 Magic Pointer。

    推荐理由:原文给出了AI指针的交互原则和Chrome、Googlebook中的落地入口,读者可以据此判断这种免提示词交互会怎样改变日常使用AI的方式。

3月25日周三
3月24日周二
  1. Mistral AI73

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达和低延迟(70ms)特性。模型可通过 API 使用,定价为每 1k 字符 $0.016,并提供开源权重版本。

    推荐理由:原文给出了 Voxtral TTS 的参数量、定价、延迟和与 ElevenLabs 的对比评测,读者可据此评估它在语音智能体场景中的可用性。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4:统一推理、多模态与智能体编码能力的开源模型

    Mistral 发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型。

    推荐理由:Mistral Small 4 将推理、多模态与智能体编码能力统一到一个开源模型中,并给出可配置推理强度与效率数据,便于评估其部署价值。

3月12日周四
  1. Google Research78

    Google Research 推出 AI 驱动的城市山洪预报,最长提前 24 小时预警

    Google Research 宣布在 Flood Hub 上线城市山洪预报,利用基于 Gemini 从新闻报道中提取历史洪水事件构建的 Groundsource 数据集训练 LSTM 模型,可提前 24 小时预测人口密度超过 100 人/平方公里区域的山洪风险。模型目前以 20x20 公里分辨率运行,在多个全球南方国家的精度和召回率与美国 NWS 预警系统相当。

    推荐理由:原文给出了新模型的技术路线和与现有系统的性能对比,读者可以据此判断AI驱动的城市山洪预警在欠发达地区的覆盖价值。

  2. Google Research75

    Google Research 推出 Groundsource,用 Gemini 将新闻报道转化为结构化灾害数据

    Google Research 推出 Groundsource,一种利用 Gemini 从全球新闻报道中提取结构化历史灾害数据的方法。首个开放数据集覆盖 2000 年至今 150 多个国家的 260 万条城市山洪事件,人工审核中 82% 的事件在位置和时间上达到实际可用精度,并已用于 Google Flood Hub 的提前 24 小时城市山洪预报。

    推荐理由:原文给出了用 Gemini 从新闻提取灾害数据的完整流程和验证指标,读者可以据此评估该方法在构建历史数据集上的可靠性。

12月17日周三
  1. Mistral AI68

    Mistral 发布 OCR 3,性能大幅提升并上线 Document AI Playground

    Mistral 发布 OCR 3,在表单、扫描件、复杂表格和手写内容上对 OCR 2 取得 74% 的整体胜率,定价为每 1000 页 2 美元,批量 API 享 5 折优惠。模型支持 markdown 输出和 HTML 表格结构重建,可通过 API 或 Mistral AI Studio 中的 Document AI Playground 使用,并保持与 OCR 2 完全向后兼容。

    推荐理由:官方给出了新模型的性能提升、价格和接入方式,读者可以据此评估其在文档处理工作流中的性价比。