品玩

科技创新者的每日必读

打开APP
关闭

Seedance 2.5 进厂,机器成了新观众

AI 视频,开始出现在你看不到的地方。

周一笑

发布于 1小时前

火山引擎 FORCE 原动力大会上,Seedance 2.5 演示了两个看起来毫不相干的能力。

一个发生在广告世界里,一条口红广告在镜头与场景不变的前提下被批量换色,官方管这叫“一次创作、多版交付”。另一个藏在给机器人行业准备的案例里,一段真实的机械臂操作视频被换掉了桌面材质和背景,指令的最后一句写着“不要改变机械臂的位置和形状”。

这其实是同一个能力,视频局部编辑。它在广告业的名字叫多版交付,在机器人学里的名字叫域随机化,一种给机器人训练数据做扩充的标准手段。同一个技术动作,在两个世界里有两个名字。

7 月 31 日,Seedance 2.5 正式发布,陆续上线即梦、豆包、扣子、小云雀,API 将在近期通过火山引擎开放。比功能列表更值得注意的是发布当日公布的合作名单,徐工集团、灵初智能、微分智飞、穹彻智能。一款视频生成模型的首发客户名单里,出现了重型机械、具身智能和无人机公司。

最近在社交网络上传播最广的一批 Seedance 2.5 作品,有一支重现 1998 年世界杯欧文经典进球的短片,播放量超过 1300 万。而名单上的这些公司拿它生成的东西,不会出现在任何时间线上,有些甚至从一开始就没打算给人看。

AI 视频的下一批大客户,可能真的不是人。

不只是创作者的刚需

过去两年,视频生成的主要竞争一直围绕创作者展开,更长的时长、更高的画质、更像电影的镜头语言。这场竞争在今年出现了一些新的变化,OpenAI 的 Sora 独立应用在 4 月停止服务,而幸存者们不约而同地调转了船头。

火山引擎总裁谭待在不久前的一次采访里透露过一个数据,Seedance 2.0 落地之后,工作日的负载与使用次数反超了周末。

娱乐工具的使用曲线不长这样,生产工具才长这样。至于方向,在他看来影视短剧只是 Seedance 落地的一个切口,更多的合作场景在工业制造、自动驾驶、具身智能。

对企业来说,一条惊艳的视频只是锦上添花,一万条能改、能复用、能本地化、能进入工作流的视频素材才是刚需。这解释了为什么制造与零售最先落地。徐工集团把 Seedance 用在工业操作培训与工序 SOP 视频的生成上,替代传统实拍与三维动画来压缩成本。

企业的产线我们无法复现,但这类任务可以缩小到一张桌子上验证。产品说明视频是制造和零售场景里最标准化的需求,也是比较容易检验对错的场景。我们在字节旗下的小云雀里做了一个实验,给 Seedance 2.5 一张自热火锅的产品图,让它直出一支 30 秒的英语使用说明视频。

结果一次生成,步骤顺序全部正确,发热包放外盒底部、冷水没过发热包、食材盒放回、盖盖留出透气孔,连“加水至水位线”都有专门的特写镜头。

更有意思的是模型对“说明书”的理解。指令里没有任何人物要求,平台的工作流自动生成了一位系围裙的美食博主,竖屏,教程腔,标准的短视频开箱格式,甚至先用图像模型造好了“达人参考图”,用来保证人物在多个镜头之间的一致性。

一个在消费内容里长大的系统,接到工业需求时,会下意识用它最熟悉的模具来接。而企业想要的说明书、培训视频、本地化版本,恰好都能被这条现成的内容流水线顺手接住。所谓进厂,不用新修一条路,第一站就在类似的场景里。

同一支视频,我们又让它交了一版阿拉伯语的。阿语从右往左书写、字母连写,是“原生支持 10 余种语言”里最硬的试金石。

同一支说明书的阿拉伯语版本

生成结果的字形、连笔和排版方向都是对的,演示者形象与英语版保持一致,两版的镜头切换点几乎逐一对应,叙事结构被完整沿用了下来。仔细检查生成的阿拉伯语文本,个别用词仍有生造的痕迹。对说明书这种严谨品类来说,发布前把母语审校留在流程里,仍是必要的一环。

机器坐进观众席

说明书和培训视频,再工业,终究还是拍给人看的。往产业纵深再走一步,视频的观众开始变成机器。而机器看视频,是为了学习。

具身智能从业者有一个共同的焦虑,数据。英伟达具身智能研究负责人 Jim Fan 用“数据金字塔”描述机器人的数据结构,塔基是互联网规模的图文视频,中间是仿真数据,塔尖是真机采集的操作数据,最有价值,也最稀缺昂贵。

黄仁勋在 GTC 上说得更直接,真实世界的数据采集缓慢、昂贵,而且永远不够。这句话有数字背书。风投机构 Bessemer 今年的报告估算,全球机器人操作数据的总量大约只有 30 万小时,互联网视频则超过 10 亿小时,而未来两年,全行业花在机器人数据上的钱将超过 30 亿美元。真实数据靠人一条一条遥操作采集,成本随人力线性增长,合成一段视频的成本,只剩几分钟的算力。两种成本曲线的差距,足以改变一个行业获取数据的方式。

自动驾驶走得更早。特斯拉用神经网络模拟器系统性地合成对抗性极端场景,英国自动驾驶公司 Wayve 的世界模型 GAIA-2 专为生成驾驶场景而建。IDC 对 2026 年具身智能的判断里,训练数据正从单一实采转向虚实融合,仿真合成数据成为规模化训练的主体。

这条赛道上原本是清一色的专用系统。英伟达 3 月在 GTC 上发布了面向物理 AI 的 Cosmos 3,并在 6 月全面开源,英伟达公布的合作生态里,有 ABB、发那科这样的工业机器人巨头,也有 Figure、Agility 这样的人形公司。

变化发生在另一头,消费级视频模型开始反向走进来。

做了七年创意工具的 Runway,去年 12 月发布了建立在自家视频模型之上的世界模型家族 GWM,机器人方向的官方用例几乎逐条对应数据扩充,今年 2 月它为此融到 3.15 亿美元,英伟达和 AMD 都在投资人名单里。而据官方披露,已有具身企业在用 Seedance 做数据合成,自动驾驶工程师在用它合成极端天气与边缘路况。

反方也一直存在。Yann LeCun 多年来坚持认为像素生成学不到真正的物理,他离开 Meta 后创业的方向,恰恰是另一条技术路线的世界模型。视频生成到底能不能给物理世界供数,最终要看下游任务的指标。

而行业当前的共识做法透露出一种务实,公开的产业案例里,最常见的做法是“编辑”,不碰“凭空生成”。拿真实采集的视频做底,只改环境、光照、材质,不动动作与机位。真实视频自带动作标签和物理正确性,编辑只动视觉层,恰好绕开了纯生成路线的两个死穴,Cosmos Transfer 是这个思路

我们照着这个思路用 Seedance 2.5 做了一组实测。底片取自斯坦福等机构联合发布的 DROID 机器人操作数据集,一段 13 秒的真实机械臂抓取视频。

真实视频

只改光照的增广版本

更换环境的版本

换环境、换光照,保护清单里的碗、薯片袋和绿色小包全部原位,机械臂的动作序列与底片一致,只改光照的那一版,几乎挑不出毛病。

Seedance 2.5 把整个场景替换成空间站舱内这种极端环境,抓取动作、画面构图,连机械臂本身都还是原来那套。域随机化欢迎极端环境,但训练数据不欢迎换一台机器。轻编辑与重编辑之间,这就是今天的边界。

一段真实行车记录仪视频

下雨版本

用行车记录仪视频改天气,暴雨版的湿路反光、信号灯倒影的位置与颜色都符合物理直觉,街道结构与车道线保持完好。模型甚至“自作主张”为画面里的车辆点亮了车灯,它知道雨天该开灯,这也让数据更接近真实分布。

失败同样有规律。让模型往路面上加入一个“从货车上掉落的沙发”,沙发出现了,坠落从未发生。它以摆放整齐的姿态凭空进场。

换成飘在空中塑料袋,它正常飘了三秒,在画面中间原地淡出,之后又零星闪出几只幽灵似的小塑料袋,像被模型忘掉之后,又想起了几次。凭空插入新物体、演绎连续的物理过程,眼下是所有视频生成模型共同的边界。

而一条纯文字生成的机械臂倒橙汁,液面守恒、玻璃透明,连投影都随液面上升而拉长,逐帧查看,壶内减少与杯内增加的程度吻合,物理细节全部在线。

需要说明的是,以上每个条目我们都只生成了一次,单次抽样无法体现模型的上限,它反映的是一个普通用户不挑不选,第一次能拿到什么。把这些结果放在一起,是一张更有信息量的答卷。改属性稳,简单场景的物理表现意外能打,不过连续的物理过程,坠落、下雨的雨滴,依然有改善空间。整体来看,给机器造数据这件事,离规模化已经更近了一步。

长出接口的通用视频模型

产业对视频模型的要求,拆开来其实很具体。

机器人的一个完整操作任务常常超过 15 秒,Seedance 2.5 的 30 秒单段直出,第一次盖住了完整的长程时序,也正好是一支标准产品演示的长度。数据扩充要过验收,考的是局部编辑的精度,广告的多版交付,考验的也是同一件事。企业积累的品牌资产、产品图与场景库,对应的是 50 个多模态参考素材的容量。

新增的白模与绿幕参考,把三维资产接进了生成管线,即梦还同步上线了 Maya 与 Blender 插件。发布会上那个接近十万面的宇宙飞船白模 demo,轮廓与结构在镜头推进中保持稳定,这个能力如今已经被做成模板,支持对画面指定区域定向重绘。行业普遍把这类演示解读为影视预演,换个角度看,一个通用视频模型开始接受结构化的三维输入,还配上了专业软件的接口,这是它长出专业工作流的信号。而结构化输入换照片级输出,正是 Cosmos Transfer 的工作模式。

更底层的优势在成本结构。专用仿真系统的研发投入,要靠一个狭窄的 B2B 市场摊销,显然不会便宜。但 Seedance2.5 上线后,产业用户能够以 API 的价格,用到被内容市场滋养出来的前沿视频模型。

验收台前

字节对这批产业合作的表述相当克制,视频生成在实体行业仍是探索阶段的工具,这与我们对 Seedance 2.5 的实测印象一致。它今天最可靠的用法,是给真实数据做扩充、给标准化内容做批量生产。做合成数据的从业者也反复强调过,合成数据需要物理仿真、渲染管线与验证闭环的整套基建,生成只是其中一环,但门槛的坍塌是真实的,视频生成能力的竞争已经把成本打了下来。

过去,想要合成数据意味着一套仿真基建和一支专门团队。现在一段真实视频,一句“不要改变机械臂的位置和形状”,加上几百积分,就能换来一批等待验收的增广素材。当造一条数据的成本从一套人力流程,降到几分钟算力,产业要回答的问题就从“要不要用”,变成了“怎么验收”。

下一支千万播放的 Seedance 视频,还会出现在社交网络的时间线上。而它交付的另一些视频,不会有播放量,它们被切成帧、打上标签,喂进某台机器人的训练集,然后在某个仓库里,变成一次没有观众的、正确的抓取。

给机器看的视频不需要好看,只需要正确。这门生意里没有掌声。验收通过,就是全部的好评。

周一笑

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测