Mistral 发布万亿参数 Mistral Large 4 公开预览,主打安全与欧洲主权
Mistral 发布迄今最大模型 Mistral Large 4(ML4,绰号 le Chonk)公开预览,总参数 1.05 万亿、激活 490 亿,API 已上线,权重预计月底发布。
Mistral 发布迄今最大模型 Mistral Large 4(ML4,绰号 le Chonk)公开预览,总参数 1.05 万亿、激活 490 亿,API 已上线,权重预计月底发布。
Google 发布开源嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 740M,Google 称其在多模态嵌入基准上超越体量两倍的竞品。
Mistral AI 发布 1 万亿参数的多模态大模型 Mistral Large 4,暂只能通过公开 guardrail endpoint 访问,计划在安全测试完成后三周内开放权重。该模型仅用 4000 块 Nvidia GPU 训练,优化用例包括网络安全、金融和芯片设计,公司上月以 210 亿欧元估值完成由 Samsung 领投的 D 轮融资。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
Microsoft AI 发布实时语音转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首批部分结果延迟仅 100 多毫秒,年底前每小时音频定价 $0.54。
Tavus 推出其称为首个 Human Interaction Model 的 Griffin,可实时处理语音、表情、语调、手势和停顿并双向生成视频。公司研究中 48% 的参与者在一分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%;Tavus 所述的 Nvidia 独立测试中 Griffin 得 3.83 分,接近真人的 3.92 分。
Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。
推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中首次亮相,Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7x,DeepSeek-R1 上达 2.5x。
H Company 发布 NeoMME,一个 260M 与 800M 两种规格的多语言多模态编码器,用单个双向 Transformer 同时处理文本 token 和 32×32 图像 patch,以掩码离散扩散目标从零训练,不依赖预训练视觉塔或因果语言模型。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash,通过知识蒸馏将十亿参数 GigaPath 编码器压缩为 22M 参数 ViT-S 编码器,在约 50 倍算力降低的情况下性能与原模型差距在 3% 以内。
Microsoft Research 发布 Skala 1.1,其训练数据是上一版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,且计算成本相当于 meta-GGA 泛函。Skala 现已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP,同时推出跟踪各版本计算性能的动态基准。
Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。
推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时同步临床视频问诊,感知非语言线索并引导虚拟体格检查。
推荐理由:原文给出架构设计、评测规模和与 PCP 对比的量化结果,还坦承模拟场景等局限,可帮助读者理解音视频临床 AI 的实际边界。
Microsoft Research 推出研究模型 CARE-X,一个统一胸部 X 光 VLM,基于 SigLIP2-so400M 与 Phi-4-mini-instruct(3.8B),通过辅助头联合训练提供报告生成与带置信度的结构化预测,并用 DAPO 强化学习对齐临床奖励。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。
推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Google DeepMind 推出 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并通过自然语言多轮编辑,支持角色一致性和物理表现。
推荐理由:官方首次介绍 Omni 家族,说明了对话式改视频、多输入组合和物理表现的具体能力边界。
Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。
推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 在指点、计数、成功检测等空间与物理推理能力上显著提升。
Mistral AI 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态、Devstral 智能体编码能力统一到单一模型的小型模型,采用 Apache 2.0 许可开源。
推荐理由:官方发布正文给出了完整的架构参数、基准对比和部署要求,读者可据此评估其替代多模型组合的可行性。
Mistral 发布新一代模型系列 Mistral 3,包括 MoE 架构的 Mistral Large 3(41B 激活、675B 总参数)以及 3B、8B、14B 三个尺寸的 Ministral 3 模型,全部以 Apache 2.0 协议开源。
推荐理由:官方公告完整列出了模型规格、开源协议、部署方式与可用平台,读者可据此评估在自有环境落地的可行性。
Mistral 发布开源语音理解模型 Voxtral,含 24B 的 Voxtral Small 和 3B 的 Voxtral Mini,均采用 Apache 2.0 许可证并可通过其 API 调用,价格低至每分钟 $0.001。
推荐理由:官方公布了两个尺寸的开源语音理解模型、基准成绩和 API 价格,读者可据此评估其替代现有 ASR 方案的可行性。
Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新级别模型。基准上达到或超过 Claude Sonnet 3.7 的 90%,定价为 $0.4 输入 / $2 输出每 M token,超越 Llama 4 Maverick 和 Cohere Command A,可在 4 张 GPU 以上环境自部署。
推荐理由:官方给出与 Claude Sonnet 3.7 的基准对比、定价和部署门槛,读者可据此评估企业落地的性价比。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上改进文本性能、增加多模态理解,上下文窗口扩至 128k tokens,推理速度达 150 tokens 每秒。
推荐理由:原文来自官方发布,给出基准对比、开源协议和硬件要求,读者可以据此评估它在轻量部署场景的可用性。