AMD Silo AI 携手博洛尼亚大学,启动面向机器人与自动驾驶领域的空间 AI 研究

May 19, 2026

行驶中的车辆通过技术实现互联

此次研究合作的核心目标是,基于 AMD ROCm 开源软件栈构建具备几何感知能力的感知模块

AMD Silo AI博洛尼亚大学计算机科学与工程系 (DISI) 正式启动研究合作,依托 AMD ROCm 原生平台,将显式三维几何信息融入面向机器人与自动驾驶的视觉 - 语言 - 动作 (VLA) 模型及世界模型流水线。此次合作将 DISI 下属专注于立体视觉与深度估计的研究团队 CVLab,确立为双节点学术研究中心中的空间 AI 节点,与摩德纳-雷焦·艾米里亚大学 (UniMoRE) 并驾齐驱。该研究中心的研究成果将为 AMD Silo AI 开放式物理 AI 研究项目“World Models Foundry”提供支持,并与包括欧盟科学 AI 工厂在内的多项欧盟专项计划保持高度协同。

“在机器人与自动驾驶的下一波浪潮中,我们所需的 AI 系统不能只具备内容分类或生成能力。这类系统必须建立具备真实物理依据的三维世界认知,在不同时段、不同观测视角下保持感知一致性,且能在各类计算平台上高效运行。这正是本次合作的核心所在。”,AMD 软件开发高级总监 Niko Vuokko 如此表示。他补充道:“我们将与 DISI 及其他生态合作方共同构建 VLA 与世界模型流水线目前所欠缺的空间 AI 层。我们的目标是将几何理解领域的前沿研究成果转化为开放、高性能的 ROCm 原生软件,推动整个物理 AI 生态向前发展。”

DISI CVLab 是计算机视觉领域的知名研究团队,在立体视觉、深度估计和三维重建方面拥有深厚积累,并在 CVPR、ICCV 和 ECCV 等重要学术会议上发表了大量研究成果。AMD Silo AI 与 CVLab 将联合设计感知与表示模块,将显式三维几何与深度信息融入端到端 VLA 架构和世界模型架构中。研究工作将重点面向 AMD Instinct MI 系列 GPU 及未来的 ROCm 平台。

本次研究围绕三大核心方向展开:

  1. 几何感知骨干网络:涵盖立体视觉、深度估计、多视角感知、鸟瞰图 (BEV) 及三维场景表示。

  2. 基于 ROCm 的高效几何感知训练与推理:包括 BEV 与点云流水线,以及集成于端到端 VLA 架构的几何模块。

  3. 面向机器人和自动驾驶场景的专项评测:使用仿真数据与真实数据,重点评估空间推理能力、三维感知一致性,以及面对视角变化、物体遮挡的稳健性。

博洛尼亚大学 (DISI) 副教授 Matteo Poggi 表示:“多年来,我们的研究工作一直专注于帮助机器从图像中恢复深度、形状和结构信息。此次合作让我们有机会将这一研究方向引入到机器人与自动驾驶领域更庞大的 VLA 和世界模型技术栈中。借助 AMD 平台,我们可以将几何感知视觉研究成果转化为 ROCm 原生的构建块,在相关平台上进行测试,并开源发布,以便更广泛的社区能够使用并持续改进。”

通过与 Generative Bionics 展开合作,该研究还具备直接的产业应用价值。Generative Bionics 是意大利知名的机器人公司,专门设计和部署可满足实际应用需求的全栈人形机器人系统。Generative Bionics 与 DISI、UniMoRE 和 AMD 保持着紧密的工程合作,致力于将研究成果转化为切实可用的机器人平台。

关于博洛尼亚大学与 CVLab

博洛尼亚大学始建于 1088 年,是欧洲历史最悠久、最负盛名的研究型大学之一。CVLab 是博洛尼亚大学计算机科学与工程系下属的一个研究团队,在立体视觉、深度估计、三维重建以及几何感知领域具备深厚专业积淀。该团队在 CVPR、ICCV、ECCV 和 ICRA 等重要会议上发表了大量研究成果,并为 3D 视觉开源基准测试和工具做出了积极贡献。

Share:

Article By


Related Blogs