9月9日,字节跳动 Seed 团队宣布推出豆包图像创作模型 Seedream 4.0。该模型支持文生图、图像编辑及多图参考等功能,多模态生图效果、速度和可用性在专业评测中达到业界领先水平。
目前,Seedream 4.0 已在豆包App、即梦AI、扣子等产品正式上线,用户可以免费体验。该模型也已通过火山引擎开放给企业客户。
Seed 团队表示,“Seedream 4.0 不仅仅是一个图像生成模型,更是一个具备知识和思考能力的多模态创意引擎。”
测试案例显示,Seedream 4.0 不仅能理解物理规律与时间约束、三维空间等复杂语境,还能在解谜、填字、续写漫画等任务中保持风格一致与细节精致,逻辑推理和创意生成能力表现出色。
Seedream 4.0 测试效果(Prompt:六个小时后这个图片的场景是什么样子)
据介绍,Seedream 4.0 可灵活支持文本、图像的组合输入,抽取不同图片元素进行创作,还可一次生成角色连贯、风格统一的组图,实现表情包、连环画等各类创意玩法。
同时,该模型支持高度自由的艺术风格迁移,最高可生成 4K 分辨率的商用级图像,并具备出色的文字渲染能力,还可处理基础的公式、表格、统计图等复杂排版,广泛适用于教育、电商、广告设计、影视后期等应用场景。
Seedream 4.0测试效果(Prompt:参考图2的风格,将图1做风格转换)
基于高效的模型架构和多层推理加速,Seedream 4.0 实现了高质量和高效生成的平衡。Seed 官网显示,Seedream 4.0 在各维度专业评测的综合表现排名业界前列,视觉美感、速度等关键指标成绩突出,并展现出较强的可靠性。
图:MagicBench “文生图”及“单图编辑”人工评测基准(数据来源:Seed官网)
Seed 团队表示,图像创作正在从文生图进入多模态交互的新阶段,Seedream 4.0 已具备通用多模态创意引擎的雏形。团队将继续探索更实时的交互式生成体验,进一步深度融合多模态推理与世界知识,更好地帮助用户激发灵感、实现创意。
好文章,需要你的鼓励
Meta与特拉维夫大学联合研发的VideoJAM技术,通过让AI同时学习外观和运动信息,显著解决了当前视频生成模型中动作不连贯、违反物理定律的核心问题。该技术仅需添加两个线性层就能大幅提升运动质量,在多项测试中超越包括Sora在内的商业模型,为AI视频生成的实用化应用奠定了重要基础。
数据分析平台公司Databricks完成10亿美元K轮融资,公司估值超过1000亿美元,累计融资总额超过200亿美元。公司第二季度收入运营率达到40亿美元,同比增长50%,AI产品收入运营率超过10亿美元。超过650家客户年消费超过100万美元,净收入留存率超过140%。资金将用于扩展Agent Bricks和Lakebase业务及全球扩张。
上海AI实验室发布OmniAlign-V研究,首次系统性解决多模态大语言模型人性化对话问题。该研究创建了包含20万高质量样本的训练数据集和MM-AlignBench评测基准,通过创新的数据生成和质量管控方法,让AI在保持技术能力的同时显著提升人性化交互水平,为AI价值观对齐提供了可行技术路径。