
DALL-E 3
OpenAI神经网络,用于从文本描述生成图像,同时加深对细节和场景逻辑的理解.

概览
倒数3
DALL-E 3 神经网络描述
DALL-E 3是OpenAI的第三代图像生成模型,于2023年10月发布. 神经网络从文本描述中创建了视觉内容,与之前的版本相比,大大改善了对复杂请求,细节,场景逻辑的理解.
DALL-E 3的关键特征是与ChatGPT的集成. 用户可以在对话模式下描述所期望的图像,而GPT-4则会自动帮助精减即时并澄清细节. 该模型正确地使文字在图像内部——字母,标题,头条——成为过去许多图像生成器的严重问题.
DALL-E 3通过ChatGPT订阅(Free and Plus),付费的OpenAI API,也通过由Azure OpenAI提供动力的Microsoft Copilot提供. 该工具被定位为解决文本描述准确性比艺术创作更重要的任务。
DALL-E 3 个特征
| 特征 | 数值 |
|---|---|
| 类型 | 文本到图像生成器 |
| 开发者 | 开放AI |
| 发布日期 | 2023年10月2日 (英语). |
| 类别 | 图像生成、文本到图像、图形设计、 AI 助手 |
| 最大分辨率 | 1792x1024 像素 |
| 支持的格式 | 1024×1024, 1024×1792, 1792×1024 (英语). |
| 图像上的文本渲染 | 对 |
| ChatGPT 整合 | 是( GPT-4 自动改进提示) |
| 世代样式 | 活性(丰富、有创意)、自然(现实主义) |
| 主要平台 | 网站(网络界面),API |
| 俄语支持 | 对 |
| 每月访问 | ~120M (英语). |
| 评级 | 5个中的4.4个 |
DALL -E 3神经网络适合谁?
设计师和艺术家
DALL-E 3适合创建概念艺术,插图,和视觉材料,其中需要高精度地匹配描述. 该模式允许在不涉及额外资源的情况下迅速形成想法。
销售商和广告专家
该工具对于生成横幅,广告图像,以及带有文字的视觉特别有用,其中准确传达意义很重要. 通过与ChatGPT的对话来完善结果的能力可以加快内容编写过程.
媒体专家和内容创建者
DALL-E 3适合插图文章,创建封面,并在需要快速获得与描述严格相匹配的图像时为网站和社交媒体生成视觉内容.
基因艺术的初学者
由于与ChatGPT的集成和一个简单的接口,神经网络没有经过特殊培训的用户就可以访问. 要开始,只需用自然语言来描述所期望的形象.
如何使用 DALL-E 3 神经网络
通过查特GPT
最常见的方法是通过ChatGPT使用. 简单描述你想要的图像,神经网络将产生结果. GPT-4 自动改进了提示, 帮助您更精确地拟定请求 。 在对话模式下,可以澄清细节并完善图像而无需完全重写请求.
通过 OpenAI API
为了融入第三方服务和应用程序, /v1/images/generations 与方法 model: dall-e-3 使用参数。 这个 size (图像大小), quality (质量), style (风格),和 n (图像数量——总是DALL-E 3)参数得到支持.
Via 微软副驾驶
DALL-E 3也通过由Azure OpenAI提供动力的微软Copilot提供,它扩展了企业客户的使用选择.
DALL-E 3 的关键特征
从文本描述中准确生成
该模型创建了尽可能与描述相匹配的图像,包括有多个对象和小细节的复杂场景. DALL-E 3处理多步请求并解释抽象概念.
图像内文本渲染
DALL-E 3的长处之一是正确渲染所生成图像内的字幕,界面元素,横幅和标题. 这使得该模型特别需要广告和设计.
ChatGPT 集成和自动即时改进
GPT-4自动改进了用户请求,帮助更准确地制定. 在对话模式下,可以通过澄清细节来完善结果,而不必从零开始.
HD 模式和样式设置
HD模式的支持细节可达1792x1024像素. 现存有两代风格:生动活泼(丰富,有创意)和自然活泼(现实主义). 该模型支持了广泛的视觉取向:光现实主义,油画,水彩,数字艺术.
DALL-E 3的优点
对案文和复杂请求的准确理解
DALL-E 3比许多替代品更能理解文本描述,并试图尽可能准确地复制,特别是在复杂的场景和细节中. 这是模型相对于竞争对手的关键优势.
ChatGPT 整合
通过对话来完善图像的能力使生成过程变得方便而直观. 不需要复杂的配置——一切通过自然语言进行.
正确图像内的文本生成
该模型可以制作字幕,字母和文本元素,这对于广告材料,横幅,和演示都至关重要.
图像权利属于用户
已创建的图像属于用户 。 OpenAI的再版,发售,或发售均不需要许可.
内置安全过滤器
该系统包括限制产生不想要的内容:暴力、色情、仇恨言论。 用户可以选择不将其图像用于模型培训。
DALL-E的缺点
安全政策限制
有些请求可能因安全政策而被驳回。 该模式禁止以侵犯版权的名字和内容来生成真实人的图像.
创造力低于替代品
与Midjourney相比,DALL-E 3的成绩可能不太有创意——模型更注重准确性而不是艺术风格和独创性.
有限自由进入
完全使用需要订阅。 自由选择有限——基本ChatGPT自由计划对代数有限制,分辨率为1024×1024.
没有通过 API 编辑模式
通过公共 API 的插图功能(编辑图像的一部分)只能通过 DALL-E 2. DALL-E 3 通过 API 支持完全从零开始生成. ChatGPT Plus通过对话的编辑能力有限.
API高成本
API生成每幅图像花费0.04-0.08美元,比使用自发的"稳定分泌"版本更为昂贵.
什么任务DALL-E 3解决?
制作广告材料和横幅
该模型允许生成标语并广告图像,准确匹配文字和视觉,包括正确渲染字幕.
说明内容
DALL-E 3适合为文章,网站和演示制作插图,并严格遵守文字描述.
快速视觉原型
该工具允许您在不涉及设计师的情况下快速测试视觉创意,为电影,电子游戏,和广告创作概念艺术和原型.
用文本生成图像
创建带有标题、标志和头条的图像,用于营销、演示和界面要素。
DALL-E 3 定价
ChatGPT 免费
有限制的免费访问:基础分辨率为1024×1024像素,每天有限的几代人.
ChatGPT 加号
订阅费用每月为20美元。 包括每3小时50代人,进入HD模式,以及全功能.
OpenAI API 软件
Pay-per-us. Standard (1024×1024)——每幅图像0.040美元. HD (1024×1024)——每幅图像0.080美元.
伙伴服务
一些伙伴服务提供DALL-E 3的5至15美元。
DALL-E的使用条款 3
活性使用需要ChatGPT Plus订阅或API支付. 自由选项有限——自由ChatGPT计划限制出代数.
DALL-E 3有内置安全过滤器. 该系统拒绝按姓名、明确内容、有暴力或仇恨言论的材料以及侵犯版权的内容制作真实人图像的要求。
用户可以选择不将其图像用于模型培训。 所创建的图像属于用户——不需要OpenAI的许可来重印,销售或发行.
DALL-E 3 可用性
DALL-E 3通过网络界面(website)和OpenAI API提供. 主要使用方式是通过ChatGPT(自由与附加). 该模型也可通过由Azure OpenAI提供动力的微软副驾驶机提供.
界面支持俄语. 一些地区可能需要一个VPN才能进入. 可在网络平台和移动版本中查阅。
如何DALL-E 3 与替代品的区别
与中途岛比较
与Midjourney相比,DALL-E 3不太注重创意和艺术风格,更注重遵循文字描述的准确性. 如果Midjourney以其美学而出名,DALL-E 3则以迅速理解精度而出名,特别是在图像内部的文本方面.
与稳定扩散的比较
DALL-E 3的艺术品质比"稳定分化"(自发地使用)要低,但其遵循提示的准确性更高. DALL-E 3的API成本高于自办的"稳定扩散"版本. 同时,DALL-E 3不需要技术设置或复杂的硬件.
与DALL-E 2的比较
与上个版本相比,DALL-E 3更准确地遵循了文本描述,特别是在复杂的场景中. 添加了分辨率可达1792x1024像素的HD模式,图像上文本渲染,以及自动即时改进的GPT-4集成.
结论
DALL-E 3是OpenAI于2023年10月发布的旗舰图像生成模型. 它的主要优点是准确坚持文本描述并正确处理图像内部的文本,这使得模型与竞争对手不同. 与ChatGPT的集成使得图像创建过程变得方便,并且没有经过特殊培训的用户可以访问. DALL-E 3适用于设计,广告,和营销方面的应用任务,准确性比艺术表现更重要. 同时,该模型也有局限性:与一些替代品相比,API成本更高,没有通过公共API进行编辑的模式,严格的安全政策可能会拒绝一些请求. 总体而言,DALL-E 3是图像生成的平衡解决方案,准确性和遵守描述比创作自由更重要.











