9月9日,字节跳动 Seed 团队宣布推出豆包图像创作模型 Seedream 4.0。该模型支持文生图、图像编辑及多图参考等功能,多模态生图效果、速度和可用性在专业评测中达到业界领先水平。
目前,Seedream 4.0 已在豆包App、即梦AI、扣子等产品正式上线,用户可以免费体验。该模型也已通过火山引擎开放给企业客户。
Seed 团队表示,“Seedream 4.0 不仅仅是一个图像生成模型,更是一个具备知识和思考能力的多模态创意引擎。”
测试案例显示,Seedream 4.0 不仅能理解物理规律与时间约束、三维空间等复杂语境,还能在解谜、填字、续写漫画等任务中保持风格一致与细节精致,逻辑推理和创意生成能力表现出色。
Seedream 4.0 测试效果(Prompt:六个小时后这个图片的场景是什么样子)
据介绍,Seedream 4.0 可灵活支持文本、图像的组合输入,抽取不同图片元素进行创作,还可一次生成角色连贯、风格统一的组图,实现表情包、连环画等各类创意玩法。
同时,该模型支持高度自由的艺术风格迁移,最高可生成 4K 分辨率的商用级图像,并具备出色的文字渲染能力,还可处理基础的公式、表格、统计图等复杂排版,广泛适用于教育、电商、广告设计、影视后期等应用场景。
Seedream 4.0测试效果(Prompt:参考图2的风格,将图1做风格转换)
基于高效的模型架构和多层推理加速,Seedream 4.0 实现了高质量和高效生成的平衡。Seed 官网显示,Seedream 4.0 在各维度专业评测的综合表现排名业界前列,视觉美感、速度等关键指标成绩突出,并展现出较强的可靠性。
图:MagicBench “文生图”及“单图编辑”人工评测基准(数据来源:Seed官网)
Seed 团队表示,图像创作正在从文生图进入多模态交互的新阶段,Seedream 4.0 已具备通用多模态创意引擎的雏形。团队将继续探索更实时的交互式生成体验,进一步深度融合多模态推理与世界知识,更好地帮助用户激发灵感、实现创意。
好文章,需要你的鼓励
本文探讨如何使用生成式AI和大语言模型作为倾听者,帮助用户表达内心想法。许多主流AI如ChatGPT、Claude等被设计成用户的"最佳伙伴",或试图提供心理健康建议,但有时用户只想要一个尊重的倾听者。文章提供了有效的提示词技巧,指导AI保持中性、尊重的态度,专注于倾听和理解,而非给出建议或判断。同时提醒用户注意隐私保护和AI的局限性。
北京大学团队开发出WoW世界模型,这是首个真正理解物理规律的AI系统。通过200万机器人互动数据训练,WoW不仅能生成逼真视频,更能理解重力、碰撞等物理定律。其创新的SOPHIA框架让AI具备自我纠错能力,在物理理解测试中达到80.16%准确率。该技术将推动智能机器人、视频制作等领域发展,为通用人工智能奠定重要基础。
人工通用智能和超级人工智能的出现,可能会创造出一种全新的外星智能形态。传统AI基于人类智能模式构建,但AGI和ASI一旦存在,可能会选择创造完全不同于人类认知方式的新型智能。这种外星人工智能既可能带来突破性进展,如找到癌症治愈方法,也可能存在未知风险。目前尚不确定这种新智能形态是否会超越人类智能,以及我们是否应该追求这一可能改变人类命运的技术突破。
香港大学和蚂蚁集团联合推出PromptCoT 2.0,这是一种让AI自动生成高质量训练题目的创新方法。通过"概念-思路-题目"的三步策略,AI能像老师备课一样先构思解题思路再出题,大幅提升了题目质量和训练效果。实验显示该方法在数学竞赛和编程任务上都取得了显著提升,为解决AI训练数据稀缺问题提供了新思路。