搜索:Genie

共命中 12 条(服务端检索)
什么是世界模型:从「生成视频」到「可交互的模拟器」
LeCun 的 JEPA 主张、DeepMind Genie 3、NVIDIA Cosmos 与李飞飞的 World Labs,讲清世界模型与视频生成模型的本质区别:一个产出录像,一个产出可交互、可预测的环境。
原创 研究前沿 精选 · 原创 · 昨天 阅读 3·访客 3
世界模型上车:端到端之后,自动驾驶把训练与验证搬进了「生成的世界」
端到端架构解决了「怎么开」,却顺手摧毁了旧的验证体系——模块没了,没法分模块打分;而真实路测里程的需求随性能提升指数增长。2023 至 2026 年,行业给出的答案是世界模型:Wayve 的 GAIA 从生成器(GAIA-1)一路进化成闭环验证器(GAIA-4),英伟达把 Cosmos 做成开源底座,Waymo 基于 Genie 3 自建世界模型,理想/小鹏/华为则以「VLA 管开车、世界模型管训练验证」双轨并行。本文拆解这条技术线的逻辑、格局与保真度之争。
原创 研究前沿 精选 · 原创 · 今天 阅读 4·访客 4
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
原创 大模型 精选 · 原创 · 昨天 阅读 3·访客 3
视频生成模型 2026 全景:Sora 2、Veo 3.1、可灵、即梦、Vidu 卷到了哪里
从 Sora 2 的音画同步到可灵 4.0 的 4K HDR 30 秒长镜头,盘点 2026 年视频生成模型的版本演进、能力边界与定价方式,并给出一套按场景选型的参考框架。
原创 大模型 精选 · 原创 · 昨天 阅读 10·访客 10
Reka Releases Rho-1: A 19B Omni-Reasoning Model That Understands, Generates Video and Outputs Robot Actions in One
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
智能体 MarkTechPost · 2天前 阅读 1·访客 1
GPT-6要“吃掉”3D公司?这家公司不到2年ARR翻百倍,破1亿美元
听雨* 2026-10-04 08:53:29 来源:量子位 专业3D模型反而更稀缺了 听雨 发自 凹非寺 量子位 | 公众号QbitAI GPT-6 Astra一发布,3D圈已经坐不住了… 它能用Blender盖出这样一栋房子,再直接导…
智能体 量子位 · 4天前 阅读 17·访客 17
实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
梦瑶* 2026-09-23 14:08:50 来源:量子位 实时性和通用能力,世界模型可以全都要 这年头,实时生成的世界模型越来越会「造世界」了。 画面更夯,控制更细,但一旦走到实时生成这一步,继续往上做能力,就会有个很难绕开的坎: 能…
大模型 量子位 · 9-23 阅读 28·访客 28
Runway wants to turn AI video generation into a live stream you control in real time
Runway wants to stream AI video as users prompt it, rather than make them wait for finished clips. The approach builds o…
行业动态 The Decoder · 9-20 阅读 21·访客 20
优步全球范围裁员 10%,被裁员工称 AI 已大举渗透日常工作
IT之家 9 月 18 日消息,据《商业内幕》今天(18 日)晚间报道,在优步(Uber),AI 已经渗透到员工工作的许多环节,从回答 Slack 里的内部问题,到替乘客行程中联系客服时收到的消息撰写回复。 6 名近期遭裁员的员工透露,过去…
行业动态 IT之家 · 9-18 阅读 12·访客 12
图形学宗师童欣加盟Meshy,要做“AI for Fun”的头号玩家
他要和这一代最富有想象力的年轻人一起,去创造一个新的图形学。]
行业动态 量子位 · 9-17 阅读 13·访客 13
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 86·访客 67
GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
World-action models (WAM) predict future states to guide robot actions, enabling learning from both action-free video an…
智能体 HuggingFace Daily Papers · 9-4 阅读 17·访客 16