发布日期 2025-06-20 | B站
正文
中国团队逆袭国际AI巨头,只用224张显卡,就训练出了世界顶级的视频模型。还记得这个去年轰动了整个科技圈的视频吗?
Sora点燃的期待
2024年2月,OpenAI发布了名为Sora的人工智能模型,输入简单的文字描述,就能输出长达60秒的高清连贯视频。要知道,2023年的AI视频模型还只能生成像威尔·史密斯吃意面这样的鬼畜视频,平均时长也只有3到4秒,除了把大伙逗乐之外,几乎没有任何实际用途。"Sora为电影制作注入了活力""革命性的文本转视频工具""Sora可能会彻底改变营销和内容创作",Sora瞬间点燃了科技圈的情绪。
但让人失望的是,OpenAI只招募了一些数字艺术家和视频从业者试用,时不时放出一些看似精美的样片,但Sora迟迟没有正式发布,艺术家用Sora宣传的内容只有经过了OpenAI的批准才能公开。说是帮Sora测试,更不如说是在给Sora打免费的广告,对Sora的期望逐渐被消磨殆尽。
40天后,Open-Sora横空出世
而就在Sora发布后的不到40天,一家中国团队横空出世,宣布将Open-Sora全面开源。顾名思义,Open-Sora是一个类Sora架构的视频生成模型。Open-Sora的团队将模型架构、训练好的模型权重、复现的所有训练细节、数据预处理流程、Demo展示和详细的上手教程,在GitHub上面全面开源,任何人都可以免费上手使用,而这些是由Open-Sora生成的视频。
其实早在半个月之前,Open-Sora团队就已经完整开源了Sora复现架构方案,团队负责人亲自录制视频,介绍如何快速复现Sora,或将其应用于实际业务。Open-Sora将复现成本直接降低到46%,相比选择的闭源策略、训练和推理都依赖昂贵超算集群的Sora,Open-Sora不仅大幅降低了训练成本,还采取了开源策略,让人人都可以参与创作、帮助改进。
Open-Sora的成本有多低?它只使用了64块H800进行训练,整个复现过程只花了1万美元左右,简直便宜到令人发指。Open-Sora一发布,就登上了GitHub全球热门榜首,三个月获得了1.75万颗星标。此后Open-Sora持续迭代,支持生成更长时间、更高分辨率的视频,增加了文生视频、图生视频、视频生视频等多种模式,并且引入了3D自编码器、整流和新的平衡条件,大幅度提升了生成视频的质量。
开源社区的接力
Open-Sora点燃了开源社区的热情。从贡献者的头像就可以看出,这个项目吸引了来自世界各地的大佬,国内外的开发者齐心协力,推动开源社区追赶Sora的水平,并且生成了多条分支和基于此开发的新项目。比如在小米技术团队发表的关于使用自动驾驶环视视频生成世界模型的研究论文中,小米团队就将Open-Sora作为其骨干架构的基础模型,用于实现多视图视频的生成;而英伟达投资的Lambda Labs团队也基于Open-Sora,打造出了数字乐高宇宙的积木动画。
迟到的Sora摔了跟头
而在另一边,OpenAI直到去年12月,才终于正式发布了Sora。著名科技媒体Verge在体验了Sora之后尴尬地表示,Sora的实际结果远非令人满意,很多视频都有奇怪和不一致的问题,还有每个月付200美元才能生成1080P的视频,Sora还有很长的路要走。纽约邮报更是一点面子都不给,上传了一段脸上长出第三条腿的体操视频,看得让人毛骨悚然,只说了Sora连基础的物理知识都不会。
都说好饭不怕晚,但来得晚的也未必都是好饭。开发高性能视频生成模型的成本十分昂贵,投资机构Factorial Funds曾估计,为了训练Sora,OpenAI需要大量的算力训练模型,成本甚至比ChatGPT还贵,至少要在4200到10500张英伟达H100上训练一个月,光是硬件成本就要1.26到3.15亿美元,是训练ChatGPT的好几倍。OpenAI投入了大量成本训练,最后却没有大力出奇迹,只做到了大力出小奇迹,根本不适合普通人用。价格便宜和质量好总得沾一个,但Sora不仅贵得离谱,质量也没好到哪里去。
与此同时,Open-Sora则因为低成本、全公开,而被视为是Sora的平价替代,在开发者圈获得了截然不同的口碑。
Open-Sora 2.0的逆袭
2025年3月,Open-Sora正式推出了2.0版本。2.0版是一个11B参数的商用大模型,相比于之前的1.2版,2.0版和Sora的性能差距从4.52%缩小到了0.69%,几乎实现了追平。更重要的是,2.0版的整个训练过程只用到了224张GPU,成本也只有20万美元。发布当天,Open-Sora团队也一并公开了模型权重、推理代码和训练流程,确保任何人都可以使用与复现Open-Sora 2.0的成果。
几天之后,Open-Sora团队负责人登陆英伟达GTC大会,并向所有人详细介绍了Open-Sora。他说,在开发过程中,团队最重要的目标就是降低成本。这场发布会,也成了Open-Sora逆袭Sora的屠龙之战。故事到这里并没有结束,Open-Sora和Sora的竞赛还没有跑到终点,开源社区和闭源社区的竞争也会继续下去。
这次Open-Sora背后的团队,是北京一家叫潞晨科技的企业。除了Open-Sora,潞晨科技还有另一个很成功的开源产品,叫Colossal-AI。Colossal-AI一发布,就连续多天在GitHub上霸榜热门第一。Colossal-AI把大模型的训练成本降低了10倍,容量提升了100倍,其中关键的AIMV优化技术被英伟达官方GitHub认证,以业界最佳方案提速17倍。
大教堂与市集
从年初爆火的DeepSeek,到Open-Sora和Colossal-AI,越来越多的来自中国的开源项目,正在改变全球开源生态的格局。1999年,开源运动的旗手埃里克·雷蒙德在那本知名的《大教堂与集市》里,提出了一个经典的比喻:传统封闭的软件开发就像是建造一座大教堂,少数工程师在高墙之内闭门搭建,外界只能等到作品完成,才能一窥全貌;而开源的软件开发,就像是一个熙熙攘攘的市集,摊位林立、吆喝不断,人人都能围观、挑选、砍价,乃至轻手改造,在众目睽睽之下,任何软件缺陷都能迅速暴露,并得到修补。
过去5年,大模型动辄上亿美元的训练和部署价格,让世界上绝大多数企业只能隔窗相望。与此同时,中国的开发者社区却通过一系列完全开源的大模型,把同类能力的复现成本要到2~3个数量级以下。如果说Sora和GPT就是那个巍峨的大教堂,DeepSeek、Open-Sora这样的开源项目就是灯火透明的市集,让更多的普通人走进摊位,动手改良,把这股烟火气吹进每个地方。
在过去30年的时间里,中国的开源社区逐渐从有人玩Linux的小众圈子,成长为全球开源舞台上最活跃、增长最快的力量之一。2024年,北京发布《北京推动"人工智能+"行动计划》,把鼓励开源高参数大模型写进政府条文,建设全球开源之都,并通过资金、算力和政策支持开源项目,为集市里的摊位降低摆摊的成本和摊位的租金,要和招揽客流。
2024年9月,潞晨科技得到了北京市人工智能产业投资基金的投资,并且在2025年2月,又获得了北京经开区产业升级基金的投资,在不到半年的时间里,连续两次获得了北京市政府资金的加注。类似的例子还有很多,2024中国开源报告显示,北京聚集了全国最多的开发者,并在过去一年新增了1.4万名开发者。
推动开源社区发展的目的,不是简单地要搞软件慈善,而是要真真实实地推动各行各业的变点。中国信通院的报告显示,在中国有许多专精特新的中小企业,他们对AI有着旺盛的需求,但绝大多数企业一年的信息化数字化预算不足500万元,难以支撑昂贵的大模型应用成本,对他们来说,开源模型往往是唯一可负担的方案。在许多工业和创新领域,开源模型已经发挥了实实在在的价值。
在开源社区的集市里,来自世界各地的开发者们互相交流、快速迭代、相互借鉴、共同繁荣,大集市本身也因越来越多中国项目的加入,正在变得越来越热闹,而这也将是全球生产力解放的开始。
附录
信息来源
- Open-Sora 2.0论文《Training a Commercial-Level Video Generation Model in $200k》(来源 Hugging Face Papers)
- 潞晨科技获北京经济技术开发区产业升级股权投资基金投资、半年内完成两轮融资(来源 科创板日报)
- Factorial Funds对Sora训练算力需求的估算,4200-10500张H100(来源 分析文章中文译文)
- 《北京市推动"人工智能+"行动计划(2024-2025年)》(京发改〔2024〕1081号,来源 北京市人民政府门户网站)
已核对
- Sora于2024年12月正式开放使用(口播"去年12月"与发布时间线吻合)。
- Open-Sora 2.0为11B参数模型,论文标题即"用20万美元训练出商用级视频生成模型",VBench与人类评测显示性能与Sora相当;训练成本20万美元已按论文核实。
- 潞晨科技(北京潞晨科技有限公司)位于北京经济技术开发区,2025年2月获经开区产业升级股权投资基金投资,官方报道称其"半年内完成两次融资"。
- Colossal-AI为潞晨科技开源项目(GitHub仓库hpcaitech/ColossalAI),定位为降低大模型训练成本。
- 埃里克·雷蒙德《大教堂与集市》1999年成书,"大教堂与市集"比喻为开源运动经典论述。
- 《北京市推动"人工智能+"行动计划(2024-2025年)》2024年由北京市发改委、市经信局、市科委中关村管委会联合印发。
待核对
- 口播中的具体数字与技术名未能逐一核实:Open-Sora复现成本降低到46%、64块H800与1万美元复现成本、三个月1.75万颗星标、与Sora性能差距从4.52%缩小到0.69%、Colossal-AI训练成本降10倍与容量提升100倍、"AIMV优化技术"获英伟达官方GitHub认证并提速17倍(技术名存疑,或为"AIMB")。
- "英伟达投资的Lambda Labs团队基于Open-Sora打造数字乐高宇宙积木动画"未能核实,团队名按原声保留。
- "鼓励开源高参数大模型"一处表述存疑,未能与政策原文逐字核对。
- 潞晨科技获北京市人工智能产业投资基金投资的具体月份(口播2024年9月)未精确核实。
- "2024中国开源报告"中北京新增1.4万名开发者的数字未单独核实。