跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 41–45 条 · 共 48 条
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列模型,含 675B 参数 MoE 旗舰与 3B/8B/14B 边缘模型

    Mistral AI 发布 Mistral 3 系列,包含三个小尺寸稠密模型(14B、8B、3B)和旗舰 Mistral Large 3,后者为稀疏 MoE 架构,激活 41B、总参数 675B,全部以 Apache 2.0 许可证开源。

    推荐理由:Mistral 3 系列以 Apache 2.0 开源,覆盖从 3B 到 675B 参数的多档模型,并首次回归稀疏 MoE 架构,读者可据此评估其在大模型生态中的定位与可用性。

7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出深度研究、语音、推理与图像编辑新功能

    Mistral 为 Le Chat 推出一批新功能,包括由工具增强的 Deep Research 代理驱动的深度研究模式、基于新语音模型 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言思考模式,以及基于 Black Forest Labs 技术的图像编辑功能。

    推荐理由:官方一口气上线了深度研究、语音、推理和图像编辑四类新能力,读者可据此判断 Le Chat 的定位变化。

7月15日周二
  1. Mistral AI80

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 协议开源并上线 API。Voxtral 支持 32k token 上下文、多语言、问答与摘要及函数调用,定价从每分钟 0.001 美元起,在转录任务上优于 Whisper large-v3,价格低于同类 API 一半。

    推荐理由:原文给出了两款开源语音模型的规模、价格和基准对比,读者可以据此评估其在转录与理解任务上的性价比。

3月17日周一
  1. Mistral AI74

    Mistral 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral 发布 Mistral Small 3.1,在文本性能、多模态理解和 128k 上下文窗口上均有提升,推理速度达每秒 150 token,并超越 Gemma 3 和 GPT-4o Mini。模型以 Apache 2.0 许可开源,可在单张 RTX 4090 或 32GB 内存的 Mac 上运行,即日起可通过 API 和 Google Cloud Vertex AI 使用。

    推荐理由:原文给出了性能对比、推理速度和开源许可,读者可以据此判断它是否适合端侧或企业部署。

3月7日周五
  1. Mistral AI77

    Mistral 发布 Mistral OCR 文档理解 API

    Mistral 发布 Mistral OCR,一个光学字符识别 API,可理解文档中的媒体、文本、表格和公式,并以有序的图文交错形式提取内容。该 API 已作为 Le Chat 的默认文档理解模型,定价为 1000 页/美元,批量推理约翻倍,今日在 la Plateforme 上线,并支持选择性自托管。

    推荐理由:原文给出了新 OCR API 的能力、基准对比和定价,读者可以据此判断它在文档理解场景中的适用性。