OpenAI GPT-4o模型推出重大更新：为ChatGPT增加了图像生成和编辑功能

文章来源：08AI导航网发布时间：2025-04-10 13:48:50

Openai于2025年3月25日正式宣布在GPT-4o模型中集成图像编辑和视觉生成功能，用户可以通过对话式来生成图像、修改现有视觉内容，甚至设计复杂的材料，如图表、菜单和地图等。

OpenAI GPT-4o模型推出重大更新：为ChatGPT增加了图像生成和编辑功能.webp

功能特点：

实时迭代：用户可以实时迭代图像请求，例如要求生成“城市中的蜗牛”，然后通过改变背景或添加配饰来细化场景。

复杂指令处理：该系统能够处理更复杂的图像构图指令。

文本渲染改进：GPT-4o在图像中渲染清晰且结构化的文本方面有了显著提升，使其能够更好地生成信息图表、图表、标志等专业视觉内容。

“修复”功能：用户可以对现有图像进行“修复”，编辑前景和背景元素，即使照片中有人物也适用。

虽然GPT-4o处理图像请求的速度比其前身DALL·E 3慢，但生成的图像更准确、更详细。图像生成可能需要长达一分钟的时间。

OpenAI表示，GPT-4o的图像能力训练使用了“公开可用的数据”，以及来自合作伙伴（如Shutterstock）的专有内容。

多模态生成：GPT-4o的图像生成器与文本生成器集成在同一模型中，能够更好地结合文本和图像。

自回归生成方式：与DALL-E 3等扩散模型不同，GPT-4o采用自回归方式，从左到右、从上到下逐步生成图像，这可能是其文本渲染和对象绑定能力更强的原因。

这个功能更新现在对OpenAI每月200美元的Pro计划订阅用户开放，然后扩展到免费和Plus层级用户，还有就是通过OpenAI API的开发者。

详细情况：https://openai.com/index/introducing-4o-image-generation/

上一篇: OpenAI推出的GPT-4o图像生成有哪些功能特点？

2025年3月25日，OpenAI通过一场直播活动正式发布了GPT-4o的原生图像生成功能，并将其集成到ChatGPT和Sora平台，用户可以通过文字提示生成高质量图像，甚至对现有图像进行风格化编辑。

下一篇: Gemini 2.5 Pro与Gemini 2.5相比较，有哪些提升？

Gemini 2 5 Pro是谷歌最新发布的AI模型，相比Gemini 2 5，Gemini 2 5 Pro在推理、编码、多模态支持和上下文处理等方面都优于Gemini 2 5，是谷歌目前最智能的AI模型。