Google 发布图像模型 Nano Banana 2.1,价格约降一半
Google 发布图像生成与编辑模型 Nano Banana 2.1,接替 2026 年 2 月发布的 Nano Banana 2,价格约降一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Google 发布图像生成与编辑模型 Nano Banana 2.1,接替 2026 年 2 月发布的 Nano Banana 2,价格约降一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Tavus 推出其称为首个 Human Interaction Model 的 Griffin,可实时处理语音、表情、语调、手势和停顿并双向生成视频。公司研究中 48% 的参与者在一分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%;Tavus 所述的 Nvidia 独立测试中 Griffin 得 3.83 分,接近真人的 3.92 分。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。
推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。
Google DeepMind 于 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在超过 100 种语言中自定义角色声音、从 30 秒音频样本复刻声音、逐行指导表演节奏与方言变化,并原生支持双说话人场景生成。
推荐理由:官方公告给出了两款 TTS 模型的能力细节、基准成绩和开放渠道,读者可以据此判断语音创作工作流的变化。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。
推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。