跳到正文

#多模态

今日 4 条
今天10月7日周三
  1. Hugging Face Blog43

    Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义

    Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。

10月1日周四
9月30日周三
  1. Hugging Face Blog63

    Hugging Face 发布 Open TTS Leaderboard:用客观指标评测多语言 TTS 与声音克隆

    Hugging Face 推出 Open TTS Leaderboard,用 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 以及 WavLM 说话人相似度等客观指标评估开源 TTS 模型,把单模型评测时间从约两周缩短到数小时。

    推荐理由:原文说明了用客观指标将 TTS 评测从数周缩到数小时的做法,以及主流竞技场对开源模型覆盖不足的结构性原因。

9月29日周二
  1. Microsoft Research62

    Microsoft Research 发布面向生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,一个包含生物学多模态世界模型和连接科学工具、文献与科研人员的交互框架的研究系统。它与 Broad Institute 合作将其用于胰腺导管腺癌(PDAC)研究,预测并排序可驱动肿瘤细胞状态转变的化合物,湿实验验证了排名靠前的候选化合物,从缩小化合物范围到确定待验证候选只需一个周末。

    推荐理由:微软官方介绍 Quine 的架构与 PDAC 癌症研究实测结果,读者可以了解 AI 世界模型如何压缩湿实验迭代周期。

9月28日周一
9月26日周六
9月25日周五
9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草稿模型,加速视觉语言推理

    Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。

    推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。

9月23日周三
9月18日周五
  1. Google Research47

    Google Research 用生成式 UI(GenUI)让教师创建交互式学习模拟

    Google Research 推出新的研究实验,教师可借助生成式 UI(GenUI)按自己的教学目标与课程动态生成定制化、引导式的交互学习模拟。研究基于 LearnLM 系列教育模型的主动学习原则,并发布了 30 多个由 AI 生成、经教师审核的英文 STEM 学习交互示例,覆盖物理、化学、生物和数学,面向初高中。

9月16日周三
9月3日周四
9月2日周三
  1. Google DeepMind70

    Google DeepMind 为 Gemini 3.7 Flash 等 Flash 模型推出 agentic 视频理解功能

    Google DeepMind 发布 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过动态搜索和检查视频片段替代固定 1 FPS 的静态处理,官方基准显示成本最多降 66%、token 消耗最多降 88%、准确率最多提升 7%。

    推荐理由:官方给出成本、token 和准确率的具体变化数字与开启方式,开发者可直接评估是否切换现有视频处理流程。

9月1日周二
8月28日周五
  1. Google DeepMind60

    Google DeepMind 发布 Gemini Omni 1.1 Flash,强化生成视频创作控制

    Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash,带来面向开发者的生成视频创意控制套件,可通过 Gemini API 在 Google AI Studio 中使用。

    推荐理由:官方发布给出了场景延展、关键帧插值、4K 放大等新能力的具体参数和开放渠道,开发者可据此评估是否接入生成视频工作流。

8月26日周三
8月21日周五
8月17日周一
8月13日周四
  1. Microsoft Research44

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑空间推理能力

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布手语转文本模型 SL2T,登陆 Gboard 和 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。

    推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。

8月10日周一
  1. Hugging Face Blog78

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。

    推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理模型,可编排 VLA 模型等底层控制接口并调用 Google Search 等工具。

    推荐理由:官方给出了进度分类、时刻定位等具体基准数字和多机器人协作演示,读者可据此评估这款具身推理模型在真实机器人编排中的可用性。

  2. Google DeepMind46

    Google DeepMind 发布 Lyria 3.5,上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中可用。模型在音乐性、歌词和人声质量上均有提升:可生成更自然复杂的旋律结构,歌词更贴合提示词并具结构感知,人声更具表现力且发音更准确。此外用户可更方便地控制输出音乐的节奏与时长。

7月16日周四
  1. Hugging Face Blog32

    DharmaOCR 实测:新模型迭出,专业化优势依旧

    DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。

7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。

    推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。

7月13日周一
7月3日周五
  1. Google DeepMind49

    Google DeepMind 与 A24 宣布首个此类研究合作

    Google DeepMind 与 A24 宣布建立首个此类的研究型合作,将前沿 AI 研究实验室与电影公司配对,帮助艺术家开发新的工作流程与技术。双方将围绕多个项目开展长期研发协作,A24 的电影创作者可参与塑造新技术,Google DeepMind 则获得一线艺术家的反馈指导。此外,Google 已对 A24 进行投资,合作的具体目标和技术产出将随时间演进。

7月1日周三