智象HiDream V1:视频生成技术理解现实世界的突破

最近,AI视频生成技术发展迅猛。多款新型视频生成模型接连推出,智象的HiDream-O1-Video-1.0(简称HiDream V1)在此波浪潮中异军突起,跻身全球前列,展现出了中国模型的强劲实力。以字节Seedance、MiniMax H3和阿里Wan 3.0为代表的多家企业,已形成全球视频生成模型的集中竞争。尤其是创业公司智象的出现,标志着这一领域不仅有大型企业主导,还开始有新兴力量加入。

在这几个月中,视频生成的应用场景逐渐扩展至影视、广告和电商等多个领域,行业竞争的重点也悄然变化。现在,视频模型不仅需要满足画质、时长和人物一致性等基本要求,还必须对复杂运动和物理规律有深刻理解。随着对更复杂动作的处理,视频生成也成为探索世界模型的重要路径。

在9月中旬,智象推出了该公司的全模态音视频生成模型HiDream V1,该模型在各大排行榜上表现优秀,成功跻身全球前十。值得注意的是,该模型的发布意味着智象在全模态世界模型的布局中完成了重要一环,同时也标志其已进入视频生成的核心竞争圈。 球友会官网

目前,用户在使用视频生成工具时,往往需要详细描述镜头、光照、动作和时长。然而,实际上,用户给模型的输入通常较为口语化和模糊。因此,模型对用户的意图进行理解和生成有效视频显得尤为重要。HiDream V1通过多模态意图理解模块先分析用户需求,再利用结构化规划将自然语言转换为可执行的分镜信息,从而实现完整的镜头构建。

值得一提的是,HiDream V1创新性地允许模型根据内容自我规划视频时长,而不是简单依赖设定的时间。它支持5到20秒的灵活生成,提供1080p高清输出,确保了单镜头的画质。

为了验证这套机制的有效性,智东西进行了实测。通过语音输入提示词和参考图,HiDream V1很好的捕捉到了故事情节,并精确展现了人与动物的动态。即便输入的提示词较短,HiDream V1也能自然缩短视频时长,没有强行延长或引入无关情节。 球友会官网

最后,测试中还检验了HiDream V1在音画一致性上的表现。在生成过程中,即使故意在提示词中遗漏了一个字,模型依旧能够准确理解生成场景,展示了强大的技术能力。