专栏名称: 易安说AI
分享业务架构、技术架构、系统设计方案,以及微服务架构源码,提供业务场景答疑
目录
相关文章推荐
成都商报  ·  老板为女儿办252桌婚宴,吃完嫌52万贵拒付 ... ·  3 小时前  
成都商报  ·  老板为女儿办252桌婚宴,吃完嫌52万贵拒付 ... ·  3 小时前  
普象工业设计小站  ·  日本的神社有多奇葩? ·  昨天  
51好读  ›  专栏  ›  易安说AI

Open-Sora 2.0发布,这才是视频生成开源模型该有的样子!

易安说AI  · 公众号  ·  · 2025-03-14 23:58

正文

请到「今天看啥」查看全文




1.2 11B 参数规模媲美主流闭源大模型

  • 媲美 HunyuanVideo 和 30B Step-Video: Open-Sora 2.0 采用 11B 参数规模 ,训练后在 VBench 和人工偏好(Human Preference) 评测上都取得与用高昂成本开发的主流闭源大模型同等水平。

  • 用户偏好评测: 在视觉表现、文本一致性和动作表现三个评估维度上,Open Sora 在至少两个指标上超越了开源 SOTA HunyuanVideo,以及商业模型 Runway Gen-3 Alpha 等。以小成本获取了好性能。


图片


图片

  • VBench 指标表现强势: 根据视频生成权威榜单 VBench 的评测结果,Open-Sora 模型的性能进步显著。从 Open-Sora 1.2 升级到 2.0 版本后,与行业领先的 OpenAI Sora 闭源模型之间的性能差距大幅缩小,从之前的 4.52% 缩减至仅 0.69% ,几乎实现了性能的全面追平。此外,Open-Sora 2.0 在 VBench 评测中取得的分数已超过腾讯的 HunyuanVideo,以更低的成本实现了更高的性能,为开源视频生成技术树立了全新标杆!


2. 实现突破:低成本训练与高效能优化

Open Sora 自开源以来,凭借其在视频生成领域的高效与优质表现,吸引了众多开发者的关注与参与。然而,随着项目的深入推进,也面临着高质量视频生成成本居高不下的问题。为解决这些挑战,Open Sora 团队展开了一系列卓有成效的技术探索,显著降低了模型训练成本。根据估算,市面上 10B 以上的开源视频模型,动辄需要上百万美元的单次训练成本,而 Open Sora 2.0 将该成本降低了 5-10 倍。

图片

作为开源视频生成领域的领导者,Open-Sora 不仅继续开源了模型代码和权重,更开源了 全流程训练代码 ,成功打造了强大的开源生态圈。据第三方技术平台统计,Open-Sora 的学术论文引用量半年内获得近百引用,在全球开源影响力排名中稳居首位,领先所有开源的 I2V/T2V 视频生成项目,成为全球影响力最大的开源视频生成项目之一。

图片

2.1 模型架构

Open-Sora 2.0 延续 Open-Sora 1.2 的设计思路,继续采用 3D 自编码器 Flow Matching 训练框架 ,并通过多桶训练机制,实现对不同视频长度和分辨率的同时训练。在模型架构上,引入 3D 全注意力机制






请到「今天看啥」查看全文