Sora 能根据文本提示生成最长 60 秒、保持主体与场景一致性的高保真视频,还可进行视频扩展、补全与风格迁移。其技术路线是将视频压缩为时空 Patch 后用 Transformer 进行扩散训练,继承了 LLM 的可扩展性哲学。
OpenAI 将其称为'世界模拟器'的雏形——通过视频学习物理世界的交互规律。Sora 引发了视频生成赛道(Runway、Pika、可灵、即梦等)的全面提速,也重新点燃了'视频即数据'的 Scaling Law 讨论。
Sora 能根据文本提示生成最长 60 秒、保持主体与场景一致性的高保真视频,还可进行视频扩展、补全与风格迁移。其技术路线是将视频压缩为时空 Patch 后用 Transformer 进行扩散训练,继承了 LLM 的可扩展性哲学。
OpenAI 将其称为'世界模拟器'的雏形——通过视频学习物理世界的交互规律。Sora 引发了视频生成赛道(Runway、Pika、可灵、即梦等)的全面提速,也重新点燃了'视频即数据'的 Scaling Law 讨论。