Google 发布图像模型 Nano Banana 2.1,价格约降一半
Google 发布图像生成与编辑模型 Nano Banana 2.1,接替 2026 年 2 月发布的 Nano Banana 2,价格约降一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Google 发布图像生成与编辑模型 Nano Banana 2.1,接替 2026 年 2 月发布的 Nano Banana 2,价格约降一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Simon Willison 用“在火星上乱穿马路的穿渔网袜犰狳”SVG 生成提示词测试 Mistral Large 4,并与 claude-opus-5.5、gpt-6.1-sol 和 gemini-3.8-flash 的输出进行对比,各模型均使用默认推理级别。
AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。
Black Forest Labs 发布 Flux 3 模型家族的图像侧模型 Flux 3 Image,宣称支持在不改动图片其他部分的前提下进行多步编辑,覆盖文生图、图生图、文字渲染与照片级写实。
Ideogram 发布新模型 Ideogram 4.5,宣称只修改用户指定的图像区域,其余部分保持不变,解决多次编辑后出现伪影的问题。模型提供四档质量、每张 0.8 至 22 美分,原生 2K 分辨率,已在 Ideogram 平台和 API 上线,合作伙伴包括 Picsart、Runway、Pika 和 Leonardo AI,官方称开源权重版本即将推出。
Google Research 推出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量“转向阻尼”网络在不动主模型权重的情况下引导图像生成。基于 Stable Diffusion v1.4 的实验中,其完全解锁版本在 Human Preference Score(HPS-v2)评测下对基线达到 90% 胜率,并支持对闭源模型做黑盒/灰盒控制。
AWS 机器学习博客教程展示在 Amazon SageMaker AI 上用同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。
Hugging Face 发布 Workflow1111,将 AUTOMATIC1111 的主要功能重建为单个 Gradio Workflow 画布,包含 11 条媒体管线、73 个节点,覆盖文生图、hi-res fix、图生图、prompt 矩阵、VLM 反推、检测生成 inpaint 蒙版、ControlNet 风格预处理器、背景去除、PNG Info 和图生视频。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更具个性化、更精致且更贴合创意的图像。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 扩散模型推理,通过新的 Nunchaku Lite 路径即可用 from_pretrained() 加载预量化 checkpoint,无需本地 CUDA 编译。
推荐理由:原文给出 W4A4 量化在 Diffusers 中原生加载后的实测延迟与显存数据,读者可据此评估消费级 GPU 跑大模型的可行路径。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出。
Hugging Face 详解 PRX 图像生成模型的数据管道:混合公开与内部数据集做预训练,用 VLM 重新生成长描述文本,再转成可流式训练语料。文本编码器已换为 Qwen3-VL 并改为训练时在线计算 text latents,吞吐仅损失约 3–4%。图像统一以 JPEG quality 92 编码,数据用 Lance 构建、以 MDS(Mosaic Streaming)流式供训练。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。
Google 宣布将一项基于 3D 场景理解的照片重构方法上线到 Google Photos 的 Auto frame 功能。