3D
Artificial Intelligence
《Cube:Roblox视角下的3D智能》
Author
Venue
Abstract
基于海量数据训练的基础模型已在文本、图像、音频和视频领域展现出卓越的推理与生成能力。我们在 Roblox 的目标是构建一个面向 3D 智能的基础模型,该模型能够协助开发者创建 Roblox 体验的各个方面,从生成 3D 对象和场景,到为动画角色进行骨骼绑定,再到编写描述对象行为的程序脚本。 本文探讨了此类3D基础模型的三个关键设计要求,并介绍了我们构建该模型的第一步。我们认为3D几何形状将成为核心数据类型,并阐述了我们针对3D形状分词器的解决方案。我们展示了该分词方案如何应用于文本转形状生成、形状转文本生成以及文本转场景生成等场景。 我们演示了这些应用如何与现有的大型语言模型(LLMs)协同工作,以执行场景分析和推理。最后,我们将讨论构建一个完全统一的3D智能基础模型的路线图。我们的代码和模型权重可在以下链接获取:https://github.com/Roblox/cube。
