OpenAI 发布 Sora:视频生成的 GPT-3 时刻

Sora 能根据文本提示生成最长 60 秒、保持主体与场景一致性的高保真视频,还可进行视频扩展、补全与风格迁移。其技术路线是将视频压缩为时空 Patch 后用 Transformer 进行扩散训练,继承了 LLM 的可扩展性哲学。

OpenAI 将其称为'世界模拟器'的雏形——通过视频学习物理世界的交互规律。Sora 引发了视频生成赛道(Runway、Pika、可灵、即梦等)的全面提速,也重新点燃了'视频即数据'的 Scaling Law 讨论。

阅读原文(OpenAI)↗ ← 返回资讯列表