Ideogram 称新模型 Ideogram 4.5 可局部编辑图像而不影响其余部分
Ideogram 发布新模型 Ideogram 4.5,称其只改动用户指定区域,换装等局部编辑不会改变人物身形和背景。该模型提供四档质量,单张价格 0.8 至 22 美分,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线,目标场景包括产品摄影、室内设计、照片修复和图内文字编辑。
Ideogram 发布新模型 Ideogram 4.5,称其只改动用户指定区域,换装等局部编辑不会改变人物身形和背景。该模型提供四档质量,单张价格 0.8 至 22 美分,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线,目标场景包括产品摄影、室内设计、照片修复和图内文字编辑。
Google Research 提出 Diffusion Controller 框架,将去噪过程重构为连续控制问题以统一图像生成控制。其轻量级附加网络在匹配人类偏好上优于行业标准,完全解锁版本对基线模型达到 90% 胜率。该框架基于 Stable Diffusion v1.4 骨干,利用 HPS-v2 评估,支持对闭源模型进行无代码修改的控制。
GPT-6 Astra 构建了实验性工具 Photo Scrubber,用于自动识别并模糊照片中的陌生人面部。该工具基于 Google MediaPipe C++ 库编译为 WebAssembly,并集成 BlazeFace 人脸检测模型实现本地处理。
在 Amazon SageMaker AI 上部署同一个 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,生成的 MP4 存回 S3,示例提供命令行与 Streamlit 界面。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更贴近用户原本的构想。
推荐理由:OpenAI 官方发布 ChatGPT Images 2.5,读者可了解其把草图与参考照片转为个性化成图的定位。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 4-bit 量化 checkpoint,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出了 Nunchaku Lite 在 Diffusers 中的加载方式与实测延迟和显存数据,读者可据此判断消费级 GPU 跑扩散模型的实际收益。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的 score smoothing——正则化使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,4 秒生成文本到图像,每张 1K 图像 0.034 美元;后者支持高质量视频生成与对话式编辑,输出视频定价为每秒 0.10 美元。
推荐理由:两款模型同日开放开发者入口,并给出延迟、单价与能力边界,便于评估图像到视频的串联工作流。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,用机器学习理解场景与空间布局,再用生成式 AI 想象新视角下的画面。
推荐理由:Google Photos 把照片当作 3D 场景重投影,读者可了解自动改视角这一新编辑路径的实现思路。