跳到正文

#多模态

今日 10 条
8月21日周五
8月17日周一
8月13日周四
  1. Microsoft Research44

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑空间推理能力

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布手语转文本模型 SL2T,登陆 Gboard 和 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。

    推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。

8月10日周一
  1. Hugging Face Blog78

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。

    推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理模型,可编排 VLA 模型等底层控制接口并调用 Google Search 等工具。

    推荐理由:官方给出了进度分类、时刻定位等具体基准数字和多机器人协作演示,读者可据此评估这款具身推理模型在真实机器人编排中的可用性。

  2. Google DeepMind46

    Google DeepMind 发布 Lyria 3.5,上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中可用。模型在音乐性、歌词和人声质量上均有提升:可生成更自然复杂的旋律结构,歌词更贴合提示词并具结构感知,人声更具表现力且发音更准确。此外用户可更方便地控制输出音乐的节奏与时长。

7月16日周四
  1. Hugging Face Blog32

    DharmaOCR 实测:新模型迭出,专业化优势依旧

    DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。

7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。

    推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。

7月13日周一
7月3日周五
  1. Google DeepMind49

    Google DeepMind 与 A24 宣布首个此类研究合作

    Google DeepMind 与 A24 宣布建立首个此类的研究型合作,将前沿 AI 研究实验室与电影公司配对,帮助艺术家开发新的工作流程与技术。双方将围绕多个项目开展长期研发协作,A24 的电影创作者可参与塑造新技术,Google DeepMind 则获得一线艺术家的反馈指导。此外,Google 已对 A24 进行投资,合作的具体目标和技术产出将随时间演进。

7月1日周三
6月23日周二
  1. Mistral AI70

    Mistral 发布 OCR 4:支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4 文档解析模型,在提取文本之外返回边界框、类型化块分类和逐词置信度分数,支持 170 种语言、10 个语言组,可通过单个容器完全自托管。

    推荐理由:原文来自 Mistral 官方,给出 OCR 4 的结构化输出、多语言支持和自托管选项,还披露了基准评分局限,可作选型参考。

6月13日周六
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型,支持 70+ 语言近实时语音转语音翻译

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。

    推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。

5月27日周三
  1. Mistral AI46

    Mistral 推出 physics AI:工程加速的基础

    Mistral 将 Emmi AI 收入麾下,推出面向工程领域的 physics AI 基础模型。传统 CFD/FEM 仿真每个设计变体需数小时到数周,physics AI 可在单 GPU 上秒级前向推理预测物理场,但不取代第一性原理求解器。该能力已用于 ASML、Airbus、Safran、Siemens Energy 等合作伙伴,覆盖产品设计、工装工艺设计加速与实时数字孪生。

5月22日周五
  1. Google DeepMind29

    Google DeepMind 在亚太推出 Accelerator 加速器计划,聚焦“AI for the Planet”应对环境风险

    Google DeepMind 在亚太地区推出首期 Accelerator 加速器计划,主题为“AI for the Planet”。该计划为期三个月,面向区域内的初创公司、研究团队和非营利组织,帮助其利用前沿 AI 解决自然、气候、农业和能源等领域的环境问题。入选机构将获得专家指导和将前沿 AI 与科学 AI 模型集成到项目中的支持,计划以新加坡的线下 bootcamp 启动,现已开放报名。

5月18日周一
5月17日周日
5月16日周六
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。

    推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。

5月2日周六
4月30日周四
4月16日周四
4月14日周二
4月13日周一
3月25日周三
3月18日周三
3月17日周二
3月12日周四
  1. Google Research62

    Google Flood Hub 推出 AI 城市山洪预报,可提前 24 小时预测风险

    Google 宣布在 Flood Hub 上推出城市山洪预报,可提前 24 小时预测城市山洪风险。模型基于 LSTM 架构,用 Gemini 从新闻报告中提取历史山洪事件的 Groundsource 数据集进行训练,仅依赖全球气象产品,以 20x20 公里分辨率覆盖人口密度大于每平方公里 100 人的城市地区。

    推荐理由:原文给出模型方法、覆盖范围和与 NWS 对比的精度数据,读者可以据此了解城市山洪预报的可行路径。