菜单
小墨

小墨

从Vibe Coding到Vibe Worlding:AI开始自己“造世界”了

2023年,Vibe Coding的概念横空出世,让编程从「敲键盘」变成了「和AI对话」。如今,类似的革命正在3D世界构建领域重演——港科大(广州)联合腾讯AI平台部团队提出了VibeWorlding框架,一个可以通过自然语言多轮对话自主构建和编辑交互式3D世界的多模态智能体系统。用户只需说一句「给我造一个阴森的荒漠神殿」,或「把桌子旁边那把椅子往前挪两米」,剩下的检索资产、布局摆放、碰撞检测、渲染确认等复杂操作,全部交给AI智能体完成。

VWE-Bench:一个严谨的评测体系

VibeWorlding的核心创新在于将3D世界构建任务形式化为一个多轮、多模态、工具集成的推理过程。系统接收用户的多模态请求后,智能体会自主推断意图、规划场景布局、调用3D工具(检索/添加/旋转/平移/删除资产),并在每一轮结束后观察沙盒返回的多模态反馈——包括3D地图文本和五视角渲染图——如此循环直到产出完整的交互式3D世界。这不是又一个「文本转3D」的生成模型,而是一整套可训练、可验证、可复现的基准与强化学习框架。

双重约束验证器:既要「立得住」又要「听得懂」

VibeWorlding包含两大核心组件。首先是VWE-Bench评测基准,这是一个覆盖2,616个高质量3D资产、323个人工标注种子世界、6,828条逆向合成用户查询的综合评测体系。数据集的构建采用「人机协作」路线:由美术标注员确定资产概念与类别,用图像生成模型生成参考图,再用3D生成模型将图片转为3D网格,经质量过滤后沉淀高质量资产;专业美术再用这批资产手工搭建功能完整的种子世界;最后让MLLM「倒着看」种子世界,逆向生成多样化的用户查询。这种方法确保了评测数据的真实性和多样性,既包含精确可验证的编辑指令,也有模糊表达、场景批判等更贴近真实用户口吻的查询。

只要有可靠的验证器和奖励信号,开源的中小规模模型完全可以通过强化学习后训练反超闭源前沿模型。

“VibeWorlding研究团队”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

实验结果:开源模型反超闭源前沿

评判一个3D世界是否「过关」,VibeWorlding设定了两条硬性标准。物理可行性验证采用纯Python几何检测,确保物体不能互相穿模、不能悬空;意图满足验证则由MLLM裁判从生态合理性、3D理解、3D推理、检索合理性四个维度综合评估。第二大组件VibeWorlding-Gym训练管线,则将物理可行性和意图满足作为双重约束验证器,同时支撑公平评测和强化学习奖励计算。系统先用大模型反向合成冷启动SFT轨迹,再用GRPO算法在双重约束验证器提供的奖励信号下做多模态强化学习,让智能体同时从「纯文本从零构建」和「多模态图文编辑」两类任务中联合学习。

瓶颈与未来方向

实验结果令人振奋。经过强化学习后训练的开源模型VibeWorlder-30B-A3B,在综合Pass@1指标上达到59.3%,反超GPT-5.5(57.3%)和Qwen3.8-Max(56.9%),成为该任务上表现最好的模型。更值得关注的是能力拆解分析:强化学习对3D推理能力的提升最为显著,从基座模型的6%-20%跃升至56%-85%;检索能力被提升到91%-99%,甚至超过前沿闭源模型。但碰撞检测仍是所有模型的共同瓶颈——即便经过RL训练,通过率也只有59%-68%。这说明多模态智能体在语义理解上已相当成熟,但在精确空间执行上仍有明显短板。

如有侵权,请联系删除。

#多模态AI#3D生成#强化学习#开源框架
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信