跳到正文
The Decoder· Tomislav Bezmalinović·· 3 小时前AI 评分61

Odyssey-3 生成式世界模型开放免费公开研究预览

Odyssey-3 is a new generative world model that you can try for free

AI 导读

加州 AI 公司 Odyssey 发布 Odyssey-3 世界模型的公开研究预览,用户可通过文本提示实时生成并探索交互式环境,开发者可申请 API。

正文 · AI 翻译

Odyssey 正在公开其世界模型 Odyssey-3。据该公司称,它可以实时生成交互式世界,并在物理基准测试中取得最高分。

总部位于加州的 AI 公司 Odyssey 已发布其 世界模型 Odyssey-3 的公开研究预览版。用户可以通过文本提示生成交互式环境,并实时探索这些环境。该模型模拟物理过程,并根据特定操作预测环境的变化。开发者可以申请 API 访问权限。

创始人 Oliver Cameron 和 Jeff Hawke 于 9 月 15 日 首次公布该模型,重点关注机器人、自动驾驶和视频游戏。此次的新变化 是公开访问、更多技术细节以及基准测试结果。

现在就能试的交互式 AI 世界

免费在线演示 基于 Odyssey-3 Flash 运行。该模型可根据文本描述生成交互式环境。用户可以在第一人称和第三人称视角之间切换,在生成的世界中移动、触发事件,并观察模型的实时响应。

Odyssey-3 构建在自回归扩散 Transformer 之上,基于之前的帧和用户操作持续生成新的视频帧。据 Odyssey 称,该模型在训练过程中从视觉观察中学习物理关系和因果关系。

训练数据包括带有事件描述的互联网视频、与相应键盘和鼠标输入配对的视频游戏画面,以及模拟的物理交互。一项额外的训练技术减少了所需的计算步骤数量,使实时生成成为可能。

根据 官方基准测试提交,基础版 Odyssey-3 模型拥有 140 亿参数,并以 832 × 480 像素生成视频。Odyssey-3 Pro 支持 1280 × 720 像素。

物理基准测试成绩附带警告

据该公司称,更强大的 Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频基准测试中获得 66.1 分。该测试评估流体力学、光学、固体力学、磁学和热力学等领域的物理行为。模型必须续写真实世界实验的视频,其输出会与实际结果进行对比。

不过,66.1 分的最高成绩附带一个重大警告。它来自单次测试运行,其中一种选择方法为每个任务从八个生成的视频中挑选一个。基准测试规则要求进行四次测试运行,并在宣称纪录时报告标准差。所报告的纪录未达到这一标准。如果不使用选择方法,Odyssey-3 Pro 在四次运行中平均得分为 63.37 分。两项结果都出现在 官方排行榜 上,但均由 Odyssey 自己提交。

截图来源:Odyseey

在 WorldMark 基准测试 上,根据其 自己的评估,Odyssey-3 在四个类别中的三个中排名第一:第一人称风格化(77.2)、第三人称真实(79.0)和第三人称风格化(76.3)。在第一人称真实类别中,它以 80.6 分排名第三。WorldMark 测试模型遵循控制指令的能力、生成图像的质量,以及模拟世界随时间推移保持一致性的程度。

一个面向机器人、无人机和 GTA V 的模型

Odyssey 希望在不同任务中使用同一个世界模型,从操控机械臂到无人机导航,再到控制游戏角色。对于每个应用,该模型都会搭配一个专用控制器,将模型的预测转化为具体指令。

据公司介绍,在测试中,一个基于 Odyssey-3 构建的 AI 控制了多个机械臂。几十小时的演示数据就足以完成训练。这些机器人还能在抓取失败后自行恢复,即使这类情况并不在训练数据之中。

在人形机器人方面,Odyssey 正与瑞士机器人公司 Flexion 合作。据称,Flexion 基于 Odyssey-3 构建的控制器表现比对比模型更可靠,即使在条件发生变化时也是如此。

Odyssey 还构建了一个基于模拟飞行数据训练的无人机控制器。据公司介绍,在虚拟室内环境中,无人机能够躲避障碍物并按指令飞往特定目标。

Odyssey-3 也能玩电子游戏。公司展示了一个自主游玩 GTA V 的 AI,它可以驾驶车辆并与敌人战斗。一个用约两小时 GTA 视频训练的控制器无需任何额外训练,就能把技能迁移到《荒野大镖客 2》上,操控骑马的角色。

Odyssey 还计划将其世界模型用于训练 AI 智能体。在一个演示中,一个智能体接收了用自然语言下达的任务,并尝试在 Odyssey-3 生成的环境中通过自身行动完成它。目标是让智能体从自身行动的结果中学习,这可能是一种全新的 AI 训练范式。

目前的公开研究预览提供交互式环境生成功能,而机器人和自主系统则还需进一步的开发工作。

构建世界模型的竞赛

Odyssey 由 Oliver Cameron 和 Jeff Hawke 于 2023 年创立。2026 年 6 月,该公司从包括 Amazon 和 AMD Ventures 在内的投资者那里筹集了 3.1 亿美元。

世界模型旨在让 AI 系统理解空间和物理关系。Google DeepMind 正在通过用于生成交互式世界的 Genie 3 追求类似的方法。由李飞飞创立的初创公司 World Labs 也在开发类似技术。AMD 于 9 月下旬宣布,计划以约 82 亿美元收购 World Labs。

没有炒作的 AI 新闻 – 由人工精选

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六期的独家 "AI Radar" 前沿报告、完整档案访问权限,以及评论区的访问权限。

来源:The Decoder · the-decoder.com