9月15日,智象未来正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。HD-V1采用智象自研原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出5-20秒1080p高保真视频。在意图理解、物理规律理解、自主规划叙事、音画一体化生成等维度,HD-V1均实现全面升级,达到全球领先水平。
双榜亮相:全球首次登场即列第一梯队
HD-V1在两项国际权威评测榜单中位居世界前列。在全球领先的独立AI基准测试与分析平台Artificial Analysis Image to Video Leaderboard(With Audio)上,HD-V1取得全球第四。该榜单以标准化、可复现的基准,对全球头部视频生成模型进行系统评测,被视为衡量AI视频模型综合实力的重要标尺。
在Arena Image-to-Video中,HD-V1取得第8。该平台是专注于AI视频生成模型的盲测评测子平台,是目前评估图生视频模型能力的重要第三方参考,被全球国际主流AI厂商广泛引用。多模态是当下全球人工智能的核心战场,图生视频则是其中技术密度最高、竞争最激烈的方向之一。HD-V1以双榜高位完成全球首次亮相,标志着中国优秀大模型企业已实现领先超越,跻身全球AI视频模型第一梯队。
意图与物理并重
视频生成的难点,常常不在“会不会画”,而在“有没有听懂”。用户输入往往口语化、碎片化、模糊化。HD-V1前置多模态意图理解模块,借助多模态理解模型的深度理解与思考,对视频内容进行结构化规划。规划涵盖镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段、台词与背景声等音效设计。理解越深,规划越稳,规划越稳,后续联合生成越不容易“跑偏”。
HD-V1的另一重要突破是更懂物理,物体在重力作用下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续,这些物理规律既被理解,也被写进视频模型的叙事之中,成为画面生成的底层逻辑。当物理规律进入生成逻辑,画面的真实质感得到全面提升。
在同样提示词下,HD-V1生成的红线随双手发力自然隆起、延展,张力、走向与形变贴合真实物理,苹果抛出、接住、稳定手持,节奏自然发生,乒乓球在桌面弹跳,掉落节奏符合物理规律,每次掉落的声音也随高度变化。后训练阶段,智象采用Diffusion Reinforcement Learning,并设计与人工认知对齐的多模态Reward模型,对音视频内容进行从画面到声音、从局部到整体的统一评估。其技术产品哲学,是以人的感受为尺度。
叙事一致性:全局规划与多模态Reward对齐
针对高保真画质、叙事连贯性与人物一致性等关键指标,HD-V1实现全面优化升级。它不只追求单帧画面的精美,更让视频内容在整体叙事维度上自洽。智象提出“先规划、后联合生成、再以多模态Reward对齐”的技术思路,让模型在全局层面规划叙事与角色状态,在联合生成中约束画面、动作和语义,并以多模态奖励信号对齐画质、连贯性与物理合理性。人物、情绪、动机、物理规律一旦进入连续镜头,就必然互相影响,这一思路让它们在同一框架内协同。
时长跟随内容,打破固定窗口
多数视频生成时长遵循固定提示词路线。用户输入生成5秒,模型只能在这个时间窗口内填充内容,内容叙事“被迫”适应时长。HD-V1把时长决策交还给内容本身。模型根据事件展开逻辑、动作完成周期、叙事推进节奏,自行规划生成时长。这一能力的关键,不在简单改变帧数,而在把时长选择与内容情境绑定,服务用户真正的目标,在连贯叙事中交付合理、真实质感的完整画面。
音画同源:文本、视频、音频联合建模
音画同步是AI视频生成模型的重要挑战。部分方案采用后期拼接路线,音画一致性面临限制。HD-V1采用原生全模态架构,对文本、视频、音频信号进行联合建模。三者在同一生成过程中相互约束、相互对齐:画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。这种联合建模直接服务于音画同步与叙事连贯。镜头切换时,环境声与配乐随之过渡,人物开口时,口型、气口与情绪同频,物理动作发生时,拟音效果与撞击反馈更贴近真实因果。
世界模型闭环:四大模型同源演进
从今年4月正式发布原生全模态世界模型架构HiDream-O1以来,智象陆续发布基于同一架构的模型家族,并在各自赛道取得国际权威榜单领先位置。图像生成模型HiDream-O1-Image系列中,商用版1.5版本在国际独立评测平台Artificial Analysis文生图榜单取得中国第一、全球第二,开源版本也取得第二。交互式世界模型HiDream-O1-World名列行业首个交互式世界模型基准WBench综合总榜第一。具身世界模型HiDream-O1-Embodied先后在RoboColiseum的扰动适应和空间推理子榜单中登顶榜首。
随着HiDream-O1-Video-1.0正式发布,业内首个原生全模态世界模型闭环就此成型。图像、视频、3D交互与具身动作,在统一原生的世界模型中交汇、共生、循环。智象未来CTO姚霆表示:“HiDream-O1-Video-1.0是智象原生全模态世界模型矩阵的关键组成部分。我们始终相信,视频生成的代际进化不仅仅是像素的提升和时长的延续,而在于模型是否真正理解创作者的意图和真实世界的物理规律。HD-V1从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’。这次在两项国际权威榜单中再次进入第一梯队,是对智象原生全模态技术路线最直接的验证。”
智象创始人梅涛表示:“基于我们对下一代人工智能技术路线的认知,智象致力于构建‘一个原生全模态底座、四大模型同源演进’的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化走向可落地的原生全模态体系。”
在HD-V1发布之际,智象同时宣布完成C+轮融资,本轮投资方为新微资本、交子资本、工银资本,体现了资本市场对其原生全模态技术路线、世界模型布局以及产业化潜力的认可。随着HiDream-O1-Video-1.0的发布,智象未来正向着原生全模态世界模型目标加速迈进。




0 条评论
请「登录」后评论