跳到正文

#多模态

今日 4 条
7月1日周三
6月23日周二
  1. Mistral AI70

    Mistral 发布 OCR 4:支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4 文档解析模型,在提取文本之外返回边界框、类型化块分类和逐词置信度分数,支持 170 种语言、10 个语言组,可通过单个容器完全自托管。

    推荐理由:原文来自 Mistral 官方,给出 OCR 4 的结构化输出、多语言支持和自托管选项,还披露了基准评分局限,可作选型参考。

6月13日周六
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型,支持 70+ 语言近实时语音转语音翻译

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。

    推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。

5月27日周三
  1. Mistral AI46

    Mistral 推出 physics AI:工程加速的基础

    Mistral 将 Emmi AI 收入麾下,推出面向工程领域的 physics AI 基础模型。传统 CFD/FEM 仿真每个设计变体需数小时到数周,physics AI 可在单 GPU 上秒级前向推理预测物理场,但不取代第一性原理求解器。该能力已用于 ASML、Airbus、Safran、Siemens Energy 等合作伙伴,覆盖产品设计、工装工艺设计加速与实时数字孪生。

5月22日周五
  1. Google DeepMind29

    Google DeepMind 在亚太推出 Accelerator 加速器计划,聚焦“AI for the Planet”应对环境风险

    Google DeepMind 在亚太地区推出首期 Accelerator 加速器计划,主题为“AI for the Planet”。该计划为期三个月,面向区域内的初创公司、研究团队和非营利组织,帮助其利用前沿 AI 解决自然、气候、农业和能源等领域的环境问题。入选机构将获得专家指导和将前沿 AI 与科学 AI 模型集成到项目中的支持,计划以新加坡的线下 bootcamp 启动,现已开放报名。

5月18日周一
5月17日周日
5月16日周六
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。

    推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。

5月2日周六
4月30日周四
4月16日周四
4月14日周二
4月13日周一
3月25日周三
3月18日周三
3月17日周二
3月12日周四
  1. Google Research62

    Google Flood Hub 推出 AI 城市山洪预报,可提前 24 小时预测风险

    Google 宣布在 Flood Hub 上推出城市山洪预报,可提前 24 小时预测城市山洪风险。模型基于 LSTM 架构,用 Gemini 从新闻报告中提取历史山洪事件的 Groundsource 数据集进行训练,仅依赖全球气象产品,以 20x20 公里分辨率覆盖人口密度大于每平方公里 100 人的城市地区。

    推荐理由:原文给出模型方法、覆盖范围和与 NWS 对比的精度数据,读者可以据此了解城市山洪预报的可行路径。

1月10日周六
  1. Berkeley AI Research45

    以信息量驱动成像系统设计:Berkeley AI Research 提出基于互信息的评估与优化框架(NeurIPS 2025)

    Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息内容评估和优化成像系统的框架,用互信息指标统一分辨率、噪声等因素。该方法仅需噪声测量数据和噪声模型即可估计信息量,并提供真实信息的上界。在彩色摄影、射电天文、无透镜成像和显微成像四个领域,该指标能预测解码器性能,优化结果匹配 SOTA 端到端方法,同时内存、计算量更低且无需任务专用解码器。

12月17日周三
12月3日周三
  1. Mistral AI78

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均采用 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 MoE 架构的 Mistral Large 3(41B 激活、675B 总参数)以及 3B、8B、14B 三个尺寸的 Ministral 3 模型,全部以 Apache 2.0 协议开源。

    推荐理由:官方公告完整列出了模型规格、开源协议、部署方式与可用平台,读者可据此评估在自有环境落地的可行性。

11月19日周三
9月2日周二
  1. Mistral AI53

    Mistral AI 为 Le Chat 推出 Memories(beta)记忆功能

    Mistral AI 在 Le Chat 中推出 Memories(beta)记忆功能,采用自动保存与可见召回相结合的混合方案,召回时显示记忆来源链接。功能围绕透明、可控和主权三个原则设计:用户可随时关闭记忆、开启无记忆的 incognito 聊天、编辑或删除单条记忆,并支持导出导入。

8月1日周五
7月17日周四
7月15日周二
  1. Mistral AI70

    Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B 两个版本

    Mistral 发布开源语音理解模型 Voxtral,含 24B 的 Voxtral Small 和 3B 的 Voxtral Mini,均采用 Apache 2.0 许可证并可通过其 API 调用,价格低至每分钟 $0.001。

    推荐理由:官方公布了两个尺寸的开源语音理解模型、基准成绩和 API 价格,读者可据此评估其替代现有 ASR 方案的可行性。

5月7日周三
  1. Mistral AI64

    Mistral AI 发布 Mistral Medium 3,以约八分之一成本逼近 Claude Sonnet 3.7

    Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新级别模型。基准上达到或超过 Claude Sonnet 3.7 的 90%,定价为 $0.4 输入 / $2 输出每 M token,超越 Llama 4 Maverick 和 Cohere Command A,可在 4 张 GPU 以上环境自部署。

    推荐理由:官方给出与 Claude Sonnet 3.7 的基准对比、定价和部署门槛,读者可据此评估企业落地的性价比。

3月17日周一
3月7日周五
  1. Mistral AI67

    Mistral 发布 Mistral OCR API,主打复杂文档理解

    Mistral 发布光学字符识别 API Mistral OCR,接受图片和 PDF 输入,按顺序提取文本与图像,可配合 RAG 系统处理幻灯片、复杂 PDF 等多模态文档。

    推荐理由:官方给出内部基准对比、定价和自部署选项,读者可据此评估它在多模态文档理解和 RAG 流程中的可用性。