PhAI Labs 联合斯坦福等团队推出 JEPA-Anything,将 JEPA 扩展为跨物理到生物的通用世界模型
PhAI Labs 牵头、联合斯坦福、牛津和普林斯顿的研究团队发布 JEPA-Anything,将 Yann LeCun 提出的 JEPA 架构扩展为可跨七个领域工作的通用世界模型。
PhAI Labs 牵头、联合斯坦福、牛津和普林斯顿的研究团队发布 JEPA-Anything,将 Yann LeCun 提出的 JEPA 架构扩展为可跨七个领域工作的通用世界模型。
Mistral 发布迄今最大模型 Mistral Large 4(ML4,绰号 le Chonk)公开预览,总参数 1.05 万亿、激活 490 亿,API 已上线,权重预计月底发布。
Google 发布开源嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 740M,Google 称其在多模态嵌入基准上超越体量两倍的竞品。
Google Research 将 Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入作为即插即用输入,与五家机构在五类公共卫生挑战上完成独立验证,覆盖 MMR 疫苗接种、心血管疾病、登革热、产后抑郁和霍乱。
Pinterest 推出由 Pinterest Intelligence 驱动的新功能 Beauty Guides,可将美发和美甲类 Pin 转化为可带去沙龙的行动计划。
Mistral AI 发布 1 万亿参数的多模态大模型 Mistral Large 4,暂只能通过公开 guardrail endpoint 访问,计划在安全测试完成后三周内开放权重。该模型仅用 4000 块 Nvidia GPU 训练,优化用例包括网络安全、金融和芯片设计,公司上月以 210 亿欧元估值完成由 Samsung 领投的 D 轮融资。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。
Microsoft AI 发布实时语音转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首批部分结果延迟仅 100 多毫秒,年底前每小时音频定价 $0.54。
Google 今天在兼容 Android 设备的 Gemini Live 中推出 Guided Vision 功能,可对手机摄像头拍摄的画面进行实时语音描述,帮助用户读取小字、识别物体和描述周围环境。
OpenAI 宣布在全球推出两项 ChatGPT 新购物功能:虚拟试穿和收藏(Favorites)。用户可上传自拍或全身照试穿衣物配饰,也可上传商品截图请求试穿,试穿功能基于新发布的 ChatGPT Images 2.5 模型;收藏功能可把商品保存到应用内的 Library。
Tavus 推出其称为首个 Human Interaction Model 的 Griffin,可实时处理语音、表情、语调、手势和停顿并双向生成视频。公司研究中 48% 的参与者在一分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%;Tavus 所述的 Nvidia 独立测试中 Griffin 得 3.83 分,接近真人的 3.92 分。
TechCrunch 采访 Airbnb CEO Brian Chesky,他在公司本周上线 AI 搜索后提出 AI 智能体需要操作系统级支持,认为 iOS、macOS、Windows 都不是 AI 操作系统,AI 理想在内核层运行。
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建了多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型联合编码视觉、音频和转录信号。
Airbnb 在秋季产品更新中推出 AI 搜索,用户可通过开关用文字或语音提示搜索房源,界面会根据偏好显示动态筛选条件,例如输入 baby 会自动出现婴儿床、游乐场等筛选。
Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。
Hugging Face 推出 Open TTS Leaderboard,用 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 以及 WavLM 说话人相似度等客观指标评估开源 TTS 模型,把单模型评测时间从约两周缩短到数小时。
推荐理由:原文说明了用客观指标将 TTS 评测从数周缩到数小时的做法,以及主流竞技场对开源模型覆盖不足的结构性原因。
Microsoft Research 推出 Quine,一个包含生物学多模态世界模型和连接科学工具、文献与科研人员的交互框架的研究系统。它与 Broad Institute 合作将其用于胰腺导管腺癌(PDAC)研究,预测并排序可驱动肿瘤细胞状态转变的化合物,湿实验验证了排名靠前的候选化合物,从缩小化合物范围到确定待验证候选只需一个周末。
推荐理由:微软官方介绍 Quine 的架构与 PDAC 癌症研究实测结果,读者可以了解 AI 世界模型如何压缩湿实验迭代周期。
AMD 收购 World Labs,因 AMD 是上市公司,作者指出收购价为 82 亿美元。World Labs 自 2024 年成立以来构建图像、视频和空间重建的训练团队,收购 SceniX 后面向机器人仿真;其 Atlas 模型从零训练,可从 2D 图像预测下一视角,将生成模型与多视角几何结合,基本解决了计算机视觉中稀疏重建这一长期问题,应用于机器人 RL 环境、场景生成和房地产重建等领域。
Microsoft Research Asia – Singapore(MSRA – Singapore)于 2025 年 7 月 24 日启用,是 Microsoft 在东南亚的首个研究实验室。
AWS 展示了基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代基于 DOM 选择器的传统脚本,降低 UI 变动导致的维护成本。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
Runway 推出研究预览版 GWM Worlds 2,通过 WorldPrompt 格式用提示词控制模拟世界中的角色、镜头和环境,可实时生成 720p、24 fps 视频和 48,000 Hz 音频。
Google Research 发布 AI 视频联合导演研究,构建了基于 Gemini 和 Veo 的多智能体编排层,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近乎实时的视频生成与语音结合,为 Gemini 的对话式 AI 提供动态视觉形象,具备精确唇形同步、自然表情和流畅轮次切换。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。
推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。
invideo 使用 GPT-6 Astra 提升视频编辑能力:剪辑规划更精准,色彩校正与调色效率提升 3 倍,并可在一天内制作 50 个自定义特效。
NVIDIA 于 9 月 22-23 日在新加坡 Raffles City Convention Centre 举办 AI Day Singapore,与伙伴展示东南亚地区的 AI 进展。
Google Research 推出新的研究实验,教师可借助生成式 UI(GenUI)按自己的教学目标与课程动态生成定制化、引导式的交互学习模拟。研究基于 LearnLM 系列教育模型的主动学习原则,并发布了 30 多个由 AI 生成、经教师审核的英文 STEM 学习交互示例,覆盖物理、化学、生物和数学,面向初高中。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中首次亮相,Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7x,DeepSeek-R1 上达 2.5x。
曼彻斯特大学与 NVIDIA Earth-2 团队合作,将 Earth-2 CorrDiff 生成式降尺度模型改用于空气污染预测,并加装了可直接利用空气质量观测数据的 Earth-2 StormCast。
H Company 发布 NeoMME,一个 260M 与 800M 两种规格的多语言多模态编码器,用单个双向 Transformer 同时处理文本 token 和 32×32 图像 patch,以掩码离散扩散目标从零训练,不依赖预训练视觉塔或因果语言模型。
Google DeepMind 发布 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过动态搜索和检查视频片段替代固定 1 FPS 的静态处理,官方基准显示成本最多降 66%、token 消耗最多降 88%、准确率最多提升 7%。
推荐理由:官方给出成本、token 和准确率的具体变化数字与开启方式,开发者可直接评估是否切换现有视频处理流程。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash,通过知识蒸馏将十亿参数 GigaPath 编码器压缩为 22M 参数 ViT-S 编码器,在约 50 倍算力降低的情况下性能与原模型差距在 3% 以内。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主执行数据发现、清洗、特征工程、模型训练与评估的完整地理空间预测流程,将此前需数周人工数据工程的工作缩短到几分钟。
Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash,带来面向开发者的生成视频创意控制套件,可通过 Gemini API 在 Google AI Studio 中使用。
推荐理由:官方发布给出了场景延展、关键帧插值、4K 放大等新能力的具体参数和开放渠道,开发者可据此评估是否接入生成视频工作流。
Google 在 CHI 2026 发表研究原型 AgentHands,让 AI 智能体在 Android XR 等沉浸式环境中生成与语音同步的手势,延续 Project Astra 与 Gemini 3.1 Flash Live 的方向。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名化的到访流动模式融入语言模型的地点表示,捕捉 POI 的时间活动节奏。