品玩

科技创新者的每日必读

打开APP
关闭
业界动态

智象未来全新HiDream-O1-Video-1.0发布,问世即跻身全球第一梯队榜单

shuohang

发布于 2小时前

9月15日,智象未来正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。HD-V1采用智象自研原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出5-20秒1080p高保真视频。在意图理解、物理规律理解、自主规划叙事、音画一体化生成等维度,HD-V1均实现全面升级,达到全球领先水平。

双榜亮相:全球首次登场即列第一梯队

HD-V1在两项国际权威评测榜单中位居世界前列。在全球领先的独立AI基准测试与分析平台Artificial Analysis Image to Video Leaderboard(With Audio)上,HD-V1取得全球第四。该榜单以标准化、可复现的基准,对全球头部视频生成模型进行系统评测,被视为衡量AI视频模型综合实力的重要标尺。

在Arena Image-to-Video中,HD-V1取得第8。该平台是专注于AI视频生成模型的盲测评测子平台,是目前评估图生视频模型能力的重要第三方参考,被全球国际主流AI厂商广泛引用。多模态是当下全球人工智能的核心战场,图生视频则是其中技术密度最高、竞争最激烈的方向之一。HD-V1以双榜高位完成全球首次亮相,标志着中国优秀大模型企业已实现领先超越,跻身全球AI视频模型第一梯队。

意图与物理并重

视频生成的难点,常常不在“会不会画”,而在“有没有听懂”。用户输入往往口语化、碎片化、模糊化。HD-V1前置多模态意图理解模块,借助多模态理解模型的深度理解与思考,对视频内容进行结构化规划。规划涵盖镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段、台词与背景声等音效设计。理解越深,规划越稳,规划越稳,后续联合生成越不容易“跑偏”。

HD-V1的另一重要突破是更懂物理,物体在重力作用下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续,这些物理规律既被理解,也被写进视频模型的叙事之中,成为画面生成的底层逻辑。当物理规律进入生成逻辑,画面的真实质感得到全面提升。

在同样提示词下,HD-V1生成的红线随双手发力自然隆起、延展,张力、走向与形变贴合真实物理,苹果抛出、接住、稳定手持,节奏自然发生,乒乓球在桌面弹跳,掉落节奏符合物理规律,每次掉落的声音也随高度变化。后训练阶段,智象采用Diffusion Reinforcement Learning,并设计与人工认知对齐的多模态Reward模型,对音视频内容进行从画面到声音、从局部到整体的统一评估。其技术产品哲学,是以人的感受为尺度。

叙事一致性:全局规划与多模态Reward对齐

针对高保真画质、叙事连贯性与人物一致性等关键指标,HD-V1实现全面优化升级。它不只追求单帧画面的精美,更让视频内容在整体叙事维度上自洽。智象提出“先规划、后联合生成、再以多模态Reward对齐”的技术思路,让模型在全局层面规划叙事与角色状态,在联合生成中约束画面、动作和语义,并以多模态奖励信号对齐画质、连贯性与物理合理性。人物、情绪、动机、物理规律一旦进入连续镜头,就必然互相影响,这一思路让它们在同一框架内协同。

时长随内容打破固定窗口

多数视频生成时长遵循固定提示词路线。用户输入生成5秒,模型只能在这个时间窗口内填充内容,内容叙事“被迫”适应时长。HD-V1把时长决策交还给内容本身。模型根据事件展开逻辑、动作完成周期、叙事推进节奏,自行规划生成时长。这一能力的关键,不在简单改变帧数,而在把时长选择与内容情境绑定,服务用户真正的目标,在连贯叙事中交付合理、真实质感的完整画面。

音画同源:文本、视频、音频联合建模

音画同步是AI视频生成模型的重要挑战。部分方案采用后期拼接路线,音画一致性面临限制。HD-V1采用原生全模态架构,对文本、视频、音频信号进行联合建模。三者在同一生成过程中相互约束、相互对齐:画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。这种联合建模直接服务于音画同步与叙事连贯。镜头切换时,环境声与配乐随之过渡,人物开口时,口型、气口与情绪同频,物理动作发生时,拟音效果与撞击反馈更贴近真实因果。

世界模型闭环:四大模型同源演进

从今年4月正式发布原生全模态世界模型架构HiDream-O1以来,智象陆续发布基于同一架构的模型家族,并在各自赛道取得国际权威榜单领先位置。图像生成模型HiDream-O1-Image系列中,商用版1.5版本在国际独立评测平台Artificial Analysis文生图榜单取得中国第一、全球第二,开源版本也取得第二。交互式世界模型HiDream-O1-World名列行业首个交互式世界模型基准WBench综合总榜第一。具身世界模型HiDream-O1-Embodied先后在RoboColiseum的扰动适应和空间推理子榜单中登顶榜首。

随着HiDream-O1-Video-1.0正式发布,业内首个原生全模态世界模型闭环就此成型。图像、视频、3D交互与具身动作,在统一原生的世界模型中交汇、共生、循环。智象未来CTO姚霆表示:“HiDream-O1-Video-1.0是智象原生全模态世界模型矩阵的关键组成部分。我们始终相信,视频生成的代际进化不仅仅是像素的提升和时长的延续,而在于模型是否真正理解创作者的意图和真实世界的物理规律。HD-V1从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’。这次在两项国际权威榜单中再次进入第一梯队,是对智象原生全模态技术路线最直接的验证。”

智象创始人梅涛表示:“基于我们对下一代人工智能技术路线的认知,智象致力于构建‘一个原生全模态底座、四大模型同源演进’的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化走向可落地的原生全模态体系。”

在HD-V1发布之际,智象同时宣布完成C+轮融资,本轮投资方为新微资本、交子资本、工银资本,体现了资本市场对其原生全模态技术路线、世界模型布局以及产业化潜力的认可。随着HiDream-O1-Video-1.0的发布,智象未来正向着原生全模态世界模型目标加速迈进。

下载品玩App,比99.9%的人更先知道关于「业界动态」的新故事

下载品玩App

比99.9%的人更先知道关于「业界动态」的新故事

iOS版本 Android版本
立即下载
shuohang

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测