跳到正文

#图像生成

今日 3 条
今天10月7日周三
  1. TechCrunch · AI42

    前 Ramp 工程师创办的 Melius 在推翻首款产品后融资 2000 万美元

    AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。

10月2日周五
  1. The Decoder57

    Ideogram 4.5 发布,主打局部图像编辑不改其余部分

    Ideogram 发布新模型 Ideogram 4.5,宣称只修改用户指定的图像区域,其余部分保持不变,解决多次编辑后出现伪影的问题。模型提供四档质量、每张 0.8 至 22 美分,原生 2K 分辨率,已在 Ideogram 平台和 API 上线,合作伙伴包括 Picsart、Runway、Pika 和 Leonardo AI,官方称开源权重版本即将推出。

9月30日周三
  1. Google Research38

    Google Research 提出 Diffusion Controller 框架,统一并简化 AI 图像生成控制

    Google Research 推出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量“转向阻尼”网络在不动主模型权重的情况下引导图像生成。基于 Stable Diffusion v1.4 的实验中,其完全解锁版本在 Human Preference Score(HPS-v2)评测下对基线达到 90% 胜率,并支持对闭源模型做黑盒/灰盒控制。

9月29日周二
9月10日周四
9月8日周二
7月23日周四
  1. Hugging Face Blog70

    Diffusers 原生支持 Nunchaku 4-bit 扩散模型推理,新增 Nunchaku Lite 集成路径

    Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 扩散模型推理,通过新的 Nunchaku Lite 路径即可用 from_pretrained() 加载预量化 checkpoint,无需本地 CUDA 编译。

    推荐理由:原文给出 W4A4 量化在 Diffusers 中原生加载后的实测延迟与显存数据,读者可据此评估消费级 GPU 跑大模型的可行路径。

7月16日周四
7月6日周一
  1. Hugging Face Blog47

    Hugging Face PRX 系列第四篇:我们的数据策略

    Hugging Face 详解 PRX 图像生成模型的数据管道:混合公开与内部数据集做预训练,用 VLM 重新生成长描述文本,再转成可流式训练语料。文本编码器已换为 Qwen3-VL 并改为训练时在线计算 text latents,吞吐仅损失约 3–4%。图像统一以 JPEG quality 92 编码,数据用 Lance 构建、以 MDS(Mosaic Streaming)流式供训练。

7月1日周三
4月23日周四