Image: OpenAI
OpenAI宣布了其生成型AI视觉艺术平台DALL-E的第三个版本,该平台现在允许用户使用ChatGPT创建提示,并包括更多安全选项。
相较于前代产品,DALL-E3有着显著的提升,并实现了与ChatGPT的无缝集成。其突出特点在于面对详细而冗长的提示时,它能够更好地理解和解读用户的意图;即使用户难以准确表达自己的想法,ChatGPT也能够介入,协助生成全面的提示。
在The Verge的演示中,首席研究员兼DALL-E团队负责人Aditya Ramesh促使ChatGPT帮助他为山区的一家拉面餐厅设计一个标志。然后,ChatGPT写了一个更长的提示,DALL-E给出了四个选项。OpenAI表示,这种与聊天机器人的连接可以让更多的人创作人工智能艺术。虽然目前的DALL-E版本可以模仿在世艺术家的风格,但即将推出的DALL-E3在设计上将拒绝复制其版权作品的请求。艺术家们可以通过OpenAI网站上的专用表格提交他们的原创作品,以便在必要时请求删除。
DALL-E于2021年1月首次发布,先于Stability AI和Midtravel的其他文本到图像生成AI艺术平台。到2022年DALL-E 2发布时,OpenAI打开了一个等待名单,以控制谁可以使用该平台,因为有人批评DALL-E可以生成真实感的露骨图像,并在生成照片时显示出偏见。该公司于去年9月取消了候补名单,并向公众开放了DALL-E 2。
这个新版本的DALL-E将于10月首次向ChatGPT Plus和ChatGPT Enterprise用户发布,随后研究实验室及其API服务将于秋季发布。OpenAI计划错开DALL-E 3的发布时间,但没有承诺何时发布免费的公共版本。
好文章,需要你的鼓励
AI项目从试点转向生产阶段时,企业面临意外的云成本激增问题。推理工作负载需要全天候运行以确保服务正常,成本可能一夜间飙升1000%以上。许多公司每月费用从5000美元激增至50000美元。为控制成本,企业开始采用混合架构:将推理工作负载迁移至本地或托管设施,训练任务保留在云端。这种模式可削减60-80%的基础设施支出,在保持性能的同时实现成本可预测性。
北航团队发布AnimaX技术,能够根据文字描述让静态3D模型自动生成动画。该系统支持人形角色、动物、家具等各类模型,仅需6分钟即可完成高质量动画生成,效率远超传统方法。通过多视角视频-姿态联合扩散模型,AnimaX有效结合了视频AI的运动理解能力与骨骼动画的精确控制,在16万动画序列数据集上训练后展现出卓越性能。
企业在AI模型选择上面临开放源码与封闭专有技术的抉择,这一选择对财务和定制化都有重要影响。开放模型如Meta Llama提供更大控制权和定制选项,而封闭模型如OpenAI GPT-4o提供简化使用和企业级支持。专家建议采用投资组合策略,根据准确性、延迟、成本、安全性等因素选择合适模型,而非单一选择。
这项研究解决了AI图片描述中的两大难题:描述不平衡和内容虚构。通过创新的"侦探式追问"方法,让AI能生成更详细准确的图片描述,显著提升了多个AI系统的性能表现,为无障碍技术、教育、电商等领域带来实用价值。