跳到正文

#多模态

今日 10 条
今天10月7日周三
  1. Hugging Face Blog43

    Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义

    Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。

  2. TechCrunch · AI42

    前 Ramp 工程师创办的 Melius 在推翻首款产品后融资 2000 万美元

    AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。

10月2日周五
  1. The Decoder55

    Tavus 发布 Griffin 人机交互模型,近半测试者在 1 分钟视频通话中误以为是真人

    Tavus 推出其称为首个 Human Interaction Model 的 Griffin,可实时处理语音、表情、语调、手势和停顿并双向生成视频。公司研究中 48% 的参与者在一分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%;Tavus 所述的 Nvidia 独立测试中 Griffin 得 3.83 分,接近真人的 3.92 分。

10月1日周四
  1. TechCrunch · AI59

    Google 发布 Gemini 4 Argon,称其为迄今最强大的模型

    Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。

9月30日周三
  1. Hugging Face Blog63

    Hugging Face 发布 Open TTS Leaderboard:用客观指标评测多语言 TTS 与声音克隆

    Hugging Face 推出 Open TTS Leaderboard,用 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 以及 WavLM 说话人相似度等客观指标评估开源 TTS 模型,把单模型评测时间从约两周缩短到数小时。

    推荐理由:原文说明了用客观指标将 TTS 评测从数周缩到数小时的做法,以及主流竞技场对开源模型覆盖不足的结构性原因。

9月29日周二
  1. Microsoft Research62

    Microsoft Research 发布面向生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,一个包含生物学多模态世界模型和连接科学工具、文献与科研人员的交互框架的研究系统。它与 Broad Institute 合作将其用于胰腺导管腺癌(PDAC)研究,预测并排序可驱动肿瘤细胞状态转变的化合物,湿实验验证了排名靠前的候选化合物,从缩小化合物范围到确定待验证候选只需一个周末。

    推荐理由:微软官方介绍 Quine 的架构与 PDAC 癌症研究实测结果,读者可以了解 AI 世界模型如何压缩湿实验迭代周期。

  2. Latent Space52

    AMD 以 82 亿美元收购 World Labs,其 Atlas 模型解决稀疏重建问题

    AMD 收购 World Labs,因 AMD 是上市公司,作者指出收购价为 82 亿美元。World Labs 自 2024 年成立以来构建图像、视频和空间重建的训练团队,收购 SceniX 后面向机器人仿真;其 Atlas 模型从零训练,可从 2D 图像预测下一视角,将生成模型与多视角几何结合,基本解决了计算机视觉中稀疏重建这一长期问题,应用于机器人 RL 环境、场景生成和房地产重建等领域。

9月28日周一
9月26日周六
9月25日周五
9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草稿模型,加速视觉语言推理

    Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。

    推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。

9月23日周三
9月18日周五
  1. Google Research47

    Google Research 用生成式 UI(GenUI)让教师创建交互式学习模拟

    Google Research 推出新的研究实验,教师可借助生成式 UI(GenUI)按自己的教学目标与课程动态生成定制化、引导式的交互学习模拟。研究基于 LearnLM 系列教育模型的主动学习原则,并发布了 30 多个由 AI 生成、经教师审核的英文 STEM 学习交互示例,覆盖物理、化学、生物和数学,面向初高中。

9月16日周三
9月3日周四
9月2日周三
  1. Google DeepMind70

    Google DeepMind 为 Gemini 3.7 Flash 等 Flash 模型推出 agentic 视频理解功能

    Google DeepMind 发布 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过动态搜索和检查视频片段替代固定 1 FPS 的静态处理,官方基准显示成本最多降 66%、token 消耗最多降 88%、准确率最多提升 7%。

    推荐理由:官方给出成本、token 和准确率的具体变化数字与开启方式,开发者可直接评估是否切换现有视频处理流程。

9月1日周二
8月28日周五
  1. Google DeepMind60

    Google DeepMind 发布 Gemini Omni 1.1 Flash,强化生成视频创作控制

    Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash,带来面向开发者的生成视频创意控制套件,可通过 Gemini API 在 Google AI Studio 中使用。

    推荐理由:官方发布给出了场景延展、关键帧插值、4K 放大等新能力的具体参数和开放渠道,开发者可据此评估是否接入生成视频工作流。

8月26日周三
8月21日周五