3D高斯泼溅技术发展及其在具身智能领域的应用综述
摘要
关键词:3D高斯泼溅;三维重建;AIGC三维生成;具身智能;机器人仿真;虚实迁移
3D高斯泼溅(3D Gaussian Splatting, 3DGS)作为一种新型可微分三维场景表⽰技术 ,凭借高保真渲染、实时推理、端到端可微等优势 ,突破了传统网格模型、点云、神经辐射场( NeRF) 的技术瓶颈 ,已成为三维视觉、智能仿真与具身智能领域的研究热点。首先 ,系统梳理3D高斯泼溅的核心原理与技术演进脉络;其次 ,基于官方公开资料 ,对Luma AI、Tripo AI、 Meshy、 DreamGaussian四类主流3D生成与重建产品进行系统性对比 ,剖析各产品的技术特征、优势与产业化局限;再次 ,重点探究3DGS在机器人导航、灵巧操作、大规模并行仿真等具身智能场景的研究进展 ,梳理该技术体系下的潜在商业化产品形态;最后 ,总结当前3D高斯泼溅技术在物理建模、规模化生成、端侧部署、虚实迁移等方面存在的技术挑战 ,并对未来发展趋势进行展望。研究旨在为3DGS与具身智能交叉领域的技术研发、产品落地与学术研究提供参考。
1.引言
具身智能( Embodied Artificial Intelligence) 旨在构建能够在非结构化物理环境中完成自主感知、环境交互、试错学习与智能决策的通用智能体 ,是下一代人工智能的核心发展方向之一[1]。 当前具身智能规模化落地面临三大核心瓶颈:真实物理场景三维数据稀缺、仿真环境与真实世界存在显著虚实迁移鸿沟(Sim-to-Real Gap) 、传统仿真平台渲染效率低且物理交互能力弱[2]。传统三维表征方式 ,如网格模型、激光点云、 NeRF神经辐射场 ,分别存在生成成本高、纹理缺失、渲染延迟高、不可微分、
无法适配实时策略训练等问题 ,难以支撑具身智能的高速迭代需求。
2023年提出的3D高斯泼溅技术 ,摒弃了传统结构化建模与体素渲染范式 ,以海量可微分高斯粒子表征三维场景 ,实现了高保真视觉还原、实时渲染与梯度可传的技术统一[3]。2024__2026年 ,3DGS技术快速产业化 ,涌现出多款消费级与工业级三维生成产品 ,同时在机器人仿真、场景理解、动态交互等具身任务中展现出颠覆性潜力。
现有综述多聚焦3DGS算法原理与渲染优化 ,缺乏对主流商业化产品的系统性对标分析 ,且对3DGS在具身智能领域的落地场景、产品形态、技术痛点梳理不足。基于此,本文首先梳理3DGS技术演进体系;其次对标国内外主流3D生成产品的官方技术特性 ,完成优劣势拆解;最后系统论述3DGS在具身智能领域的应用进展、潜在产品形态与行业瓶颈 ,为后续技术迭代与产业落地提供理论支撑。
2.3D高斯泼溅核心原理与技术演进
2.1 核心原理
3D高斯泼溅技术将复杂三维场景离散为大量各向您性三维高斯基元(Gaussian Primitive),每个高斯粒子独立存储空间位置、协方差矩阵、不透明度参数与球谐纹理系数。在渲染过程中 ,通过透视投影完成三维粒子向二维图像的正向映射 ,通过深度排序与Alpha混合完成图像合成。相较于NeRF的体素积分渲染 ,3DGS以离散粒子光栅化实现渲染加速 ,帧率提升两个数量级以上。
其核心技术优势集中于三点:一是高保真视觉还原 ,可精准还原复杂光影、反射与精细纹理;二是实时高效渲染 ,支持桌面端与移动端高帧率可视化;三是全链路可微分 ,粒子参数可参与梯度反向传播 ,天然适配深度学习训练与智能体策略优化。
2.2 技术演进脉络
纵观2023__2026年发展 ,3D高斯泼溅技术可划分为三个迭代阶段:
第一阶段为静态重建阶段(2023年)。以原始3DGS算法为核心 ,实现多视角图像的高质量静态场景重建 ,核心解决视觉渲染效果问题 ,但不具备资产生成能力与物理交互能力 ,仅适用于场景可视化。
第二阶段为多模态生成阶段(2024_2025年)。结合AIGC多模态技术 ,衍生出文本、单图驱动的3D高斯资产生成方案 ,以DreamGaussian等开源模型为代表 ,实现从“ 场景复刻”到“ 资产创造” 的跨越 ,但普遍缺失物理属性 ,无法适配仿真交互。
第三阶段为物理可交互阶段(2025__2026年)。行业开始聚焦高斯粒子物理属性解耦、碰撞体生成、动力学参数预测 ,逐步构建可用于机器人训练的物理就绪型三维场景 ,成为具身智能的新型底层技术底座。
3.主流三维AIGC与3DGS产品对标分析
当前国内外三维生成赛道主流产品以Luma AI、Tripo AI、 Meshy、 DreamGaussian为核心 ,覆盖重建、多模态生成、 内容创作、科研推理等场景。本节基于各产品官方公开功能参数与技术文档 ,逐一拆解产品特性、核心优势与产业化局限性。
3.1 Luma AI
Luma AI 依托 NeRF 与生成式 AI 打造多端 3D 产品矩阵,围绕移动端采集、云端渲染、开放 API 服务形成商业化落地体系,依靠轻量化架构、高精度光影重建、全平台兼容的技术特点快速切入消费级 3D 与 AR 内容赛道,但受底层技术原理与硬件条件约束,这套以实景重建为核心的技术路线,面临三项难以突破的固有短板:
第一、原生生成能力短板:产品底层技术根基为实景 NeRF 三维重建,技术逻辑依托实拍影像逆向还原现实物体与场景,天然不具备文本、单图从零原创资产的能力。只能对现实中已存在的实物做三维复刻,无法凭空生成不存在的全新虚拟场景、原创物体,在 AIGC 原生创意建模赛道存在先天壁垒,区别于通用文生 3D 类 AI 产品的创作逻辑。
第二、三维数据信息缺失问题:Luma AI 生成的全部 3D 成果仅搭载表面视觉纹理数据,缺失碰撞体积、物理材质、质量密度、动力学参数等仿真必需的物理属性,产出模型是纯粹可视化资源。仅能用于效果图展示、AR 预览等视觉用途,缺少接入工业仿真、机器人实训、物理引擎交互的底层数据支撑,难以往工业仿真、机器人研发领域延伸落地。
第三、超大场景落地上限受限:产品主打 iPhone 等消费级移动端采集建模,受手机终端算力、存储空间、传感器性能硬性制约,面对大范围超大场景重建时,模型精细度、重建稳定性都会大幅下滑,整体精度达不到工业项目的验收标准,仅能服务民用消费市场,不具备工业级项目落地的适配能力。
针对上述痛点,短期改良思路是升级云端算力、优化算法压缩、搭配专业采集硬件补强场景重建效果,但从底层技术架构层面需要厘清核心矛盾:以实景扫描重建为核心的产品路线,本身就和通用原生 AIGC 生成、工业物理仿真的技术底层逻辑相悖。Luma AI 所有功能都是从现实实景反向生成三维模型,而通用文生 3D、工业仿真建模是从虚拟参数正向构建数字资产,二者数据来源、建模逻辑、输出数据维度完全割裂。就像写实相机只能复刻眼前实景,没办法凭空画出从未出现过的幻想造物,也没法直接输出可用于力学测算的工程模型。因此对 Luma AI 而言,现有技术框架下只能深耕民用消费 3D 内容赛道,想要补齐原创生成、工业仿真两大能力,需要彻底更换底层技术路线,无法在现有 NeRF 实景重建体系内迭代实现。

3.2 Tripo AI
当前主流AI三维生成技术,以传统网格为核心底座、融合局部3DGS预览渲染,支持文本、图像、草图多模态快速生成,可自动化完成拓扑网格、4K材质、骨骼绑定及基础动画制作,适配游戏、虚拟数字人等批量内容创作场景,凭借高速生成、规范输出的优势,可直接对接各类商用引擎二次开发,大幅降低三维创作门槛。但这种改良式技术路线,存在三大无法规避的原生短板:
第一,底层架构存在先天缺陷。模型核心为传统网格结构,仅预览环节融入3DGS渲染,并非原生高斯表示,无法发挥3DGS可微分、实时交互的核心优势,始终受限于传统网格的底层技术瓶颈,难以实现全流程高端渲染与动态优化。
第二,缺失原生物理属性。算法生成的三维模型无自带物理参数、碰撞、密度等基础属性,无法直接适配仿真需求,必须借助第三方工具二次加工,大幅提升了物理仿真、实机交互的落地适配成本。
第三,高精结构生成稳定性不足。该方案仅适配常规规整模型,面对复杂机械、精密异形物体时,极易出现几何畸变、布线错乱等问题,高精场景量产良品率低,无法满足工业级建模需求。
针对这些短板,行业常规解法是扩充数据、迭代模型与优化后处理,但并未触及核心问题:传统网格叠加局部3DGS的改良生成范式,无法适配高精、实时交互的下一代三维创作需求。三维创作分为两大维度:外观与纹理属于创意层面,可依托数据驱动实现标准化量产;而物理属性与精密结构贴合真实物理规则与工业公差,场景、品类不同,适配标准差异极大。
可以通俗类比:器物的外观造型规则可统一,但不同材质、结构的器物物理特性完全不同。因此,造型生成与物理、精密结构生成的底层逻辑相互割裂。对于工业化三维生成而言,不存在通用万能的生成模型,只有适配具体场景、精度需求的定制化模型。

3.3 Meshy AI
区别于单一、碎片化的简易建模工具,该三维生成技术构建起完整的工业化生产闭环,实现了全流程自动化创作落地。技术集成文本、图像双模态三维生成能力,打通网格拓扑修复、纹理烘焙、自动绑骨、动画导出全链路功能,深度适配Blender、Unity、Unreal等专业创作工具,支持模型批量生成与渲染导出,可高效满足工业化批量创作需求。
依托完备的全链路架构,该技术具备三大核心优势:一是工业化生产链路完整,高度适配专业创作者、工作室的商用创作场景;二是模型鲁棒性强,可自动修复拓扑错误、产出品质稳定,同时满足数字商用资产与3D打印落地标准,多数模型可直接切片打印;三是工具生态兼容性优异,无需复杂适配调试,大幅降低模型二次开发与优化成本。
但这套以传统网格模型为核心、3DGS为辅助的工业化生成路线,现在还存在着三大难以突破的原生局限:
第一,三维底层表征不完整。技术核心输出依旧为传统多边形网格模型,3DGS高斯渲染技术仅作为预览辅助功能,并未实现建模、渲染、交互全链路高斯表征升级,无法发挥3DGS架构的底层技术优势,始终受限于传统网格模型的固有短板。
第二,缺乏动态物理交互能力。整套技术体系聚焦模型静态视觉效果生成,仅能完成造型、纹理、骨骼、动画的静态产出,不具备原生动态物理交互属性,无法模拟物体受力、形变、碰撞等真实物理效果,难以支撑机器人动态试错训练、实时物理仿真等高阶场景需求。
第三,批量数据生产效率不足。单模型生成耗时偏长,且不支持高效的批量并行训练与生成调度,整体产出效率偏低,只能满足常规商用内容创作,无法适配大规模AI数据集快速生产、海量模型迭代训练的高频需求。
整体而言,该技术的核心优势集中在静态三维资产的标准化、工业化量产,能够高效、稳定地产出合规的商用与3D打印模型,大幅降低专业三维创作门槛。但受限于底层网格架构与技术定位,其无法实现实时高斯渲染、动态物理交互、超高效率数据量产,在智能仿真、AI数据生产、实时交互三维场景中存在明显的落地壁垒。

3.4 DreamGaussian
DreamGaussian 基于生成式 3D 高斯泼溅搭建工业化 3D 生成闭环,兼容文本、图像两种输入生成三维资产,打通网格提取、纹理优化与模型导出全流程,产出网格适配 Blender、Unity、Unreal 等软件,可实现素材批量生产。
依托两段式架构,技术拥有三大优势:生产链路完整,适配小型工作室落地;模型容错性高,自动优化拓扑,成品满足 3D 打印标准;格式通用性强,减少二次修改成本。
不过现阶段以3D 高斯生成 + 后置网格转化为技术路线的 DreamGaussian,受架构设计约束,仍存在三项原生技术短板难以突破:第一,全链路高斯表征落地不完善。算法仅在前期生成阶段使用 3D 高斯做几何与色彩优化,最终成品落地形态仍是传统多边形网格,高斯泼溅仅作为中间优化载体,建模、渲染全流程未能统一采用高斯表征,难以发挥实时渲染、高效采样等 3DGS 原生技术特性,持续受制于多边形网格的固有技术缺陷。第二,原生动态物理交互能力缺失。整套算法聚焦静态三维模型的外形与纹理生成,仅能输出静态网格、贴图与基础模型素材,没有内置物理解算逻辑,无法原生实现碰撞、受力形变、动态仿真等物理效果,很难拓展至机器人仿真、实时动态交互等高阶应用领域。第三,海量批量生产性能受限。单样本生成仍存在固定耗时开销,框架缺少大规模并行调度与批量并行生成设计,批量产出效率有限,仅适配中小体量商用素材制作,难以支撑超大规模 3D 数据集快速批量构建、海量模型迭代生产的工业化需求。
综合来看,DreamGaussian 擅长标准化量产静态 3D 资产,降低三维创作门槛。但受网格导出的路线限制,在实时高斯渲染、动态物理仿真、大数据批量生产场景落地受限。

3.5 产品综合对比总结
综上 , 当前主流三维生成产品普遍存在“ 重视觉、轻物理 ,重重建、轻生成 ,重内容、轻仿真” 的行业共性。 Luma AI聚焦消费级重建展⽰ ,Tripo AI与Meshy聚焦网格内容创作 ,DreamGaussian仅满足科研需求。所有主流商用产品均未实现“ 规模化资产生成+原生物理就绪+实时可微交互” 的工业级能力 ,无法适配具身智能训练的核心需求 ,存在巨大技术与市场空白 。
4.3D高斯泼溅在具身智能领域的应用与研究进展
4.1 核心应用场景及技术进展
-
4.1.1 智能机器人导航仿真
视觉语言导航、室内自主避障是具身智能基础任务 ,传统仿真环境存在视觉真实度低、场景单一、动态交互缺失等问题 ,导致仿真训练与真实场景迁移差距大。3DGS可快速构建照片级真实感的室内外场景 ,结合语义标注与物理约束 ,构建高逼真导航仿真环境。
当前主流研究进展包括:SAGE-3D算法实现3DGS场景的语义对齐与物理碰撞适配 ,构建大规模室内仿真数据集 ,显著提升未知场景导航泛化能力; Habitat-GS将3DGS实时渲染引擎嵌入经典Habitat仿真平台 ,实现动态人群、动态障碍物场景的仿真训练 ,有效提升机器人复杂场景导航鲁棒性。
-
4.1.2 机械臂与灵巧手精细操作
机器人抓取、放置、柔性操作等任务依赖高精度三维感知与物理适配能力 。传统仿真资产拓扑固定、物理参数单一 ,无法适配多样化物体的自适应操作训练。3DGS可通过单目视觉实时重建物体三维结构 ,预测几何特征与物理属性 ,支撑精细化力控与姿态控制。
现有研究中 ,RoboTidy构建了基于3DGS的家庭场景交互基准 ,覆盖海量日常物体整理操作任务;PUGS框架实现零样本物体物理属性预测 ,可精准输出物体材质、硬度、质量等动力学参数 ,解决传统仿真物理参数固化的痛点 ,大幅提升机械臂零样本抓取成功率。
-
4.1.3 大规模并行智能体仿真训练
具身智能大模型需要海量场景、海量交互轨迹进行迭代优化 ,传统MuJoCo、 Isaac Sim等仿真平台渲染成本高、并行吞吐量低 ,算力瓶颈显著。3DGS轻量化粒子渲染架构具备超高吞吐量优势 ,可实现大规模智能体并行训练。
GS-Playground作为新型3DGS仿真框架 ,实现了数百级智能体并行仿真 ,渲染吞吐量远超传统仿真引擎 ,能够高效支撑人形机器人、多机械臂集群的大规模试错训练 ,解决了具身模型数据迭代效率低的核心痛点。
4.2 关键技术研究进展
第一 ,物理高斯资产构建技术。行业逐步实现视觉高斯粒子与物理参数的解耦建模 ,可预测碰撞包围盒、材质、 刚度、摩擦系数等仿真核心参数 ,推动3DGS从“ 视觉模型” 向“物理可交互模型”升级。
第二 ,Sim-to-Real虚实迁移优化。通过渲染增强、 时序一致性优化、光照自适应适配等技术 ,缩小仿真场景与真实环境的视觉与物理差您 ,提升智能体训练后的真实场景泛化能力。
第三 ,端到端具身训练链路构建。初步形成“ 场景生成一实时感知一物理交互一策略优化一虚实部署” 的全链路闭环 ,为通用具身智能体训练提供完整技术底座。
4.3 潜在商业化产品形态
结合3DGS技术特性与具身智能产业刚需 ,未来可落地三类核心产品形态:
(1)工业级具身仿真训练平台。面向机器人企业、AI研发机构 ,提供自动化场景生成、物理仿真、大规模并行训练、虚实迁移部署一体化服务 ,替代传统高成本仿真平台 ,适配工业机器人、服务机器人、特种机器人研发。
(2)物理就绪三维资产数据库。构建海量标准化、带物理参数的3D高斯资产库 ,包含日常物体、工业零部件、极端场景、柔性物体等样本 ,支持文本/单图自定义生成 ,解决具身智能训练数据稀缺、场景单一的行业痛点。
(3)端侧轻量化空间感知模块。面向低成本消费级机器人、智能家居设备 ,部署轻量化3DGS算法,依托单目摄像头实现实时三维建模、空间理解与物体物理属性预测 ,实现低算力设备的自主环境交互能力。
5 现存技术挑战
(1)物理建模精度受限。 当前3DGS技术对柔性物体、流体、动态形变物体的建模能力不足 ,物理参数预测精度较低 ,复杂动态交互场景仿真稳定性差。
(2)规模化生成能力不足。 大场景、复杂工业场景的自动化生成稳定性差 ,批量生成效率难以满足大规模AI训练的数据需求。
(3)端侧部署门槛较高。原生3DGS粒子数量庞大、算力消耗高 ,轻量化压缩、量化、剪枝技术不成熟 ,难以在低功耗端侧设备实时运行。
(4)虚实迁移鲁棒性弱。真实环境复杂光照、遮挡、材质干扰下 ,仿真训练的策略模型泛化能力下降 ,Sim-to-Real迁移误差仍显著。
6 结论与展望
3D高斯泼溅技术凭借实时可微渲染、高保真场景还原、灵活三维表征的核心优势 ,打破了传统三维技术无法适配具身智能训练的瓶颈 ,成为新一代具身仿真与三维世界建模的核心技术。 当前主流商业化三维产品仍局限于视觉内容创作与场景重建 ,普遍缺失物理交互与工业化仿真能力 ,无法支撑具身智能的规模化落地。而前沿学术研究已完成导航、操作、并行仿真等多场景的技术验证 ,展现出巨大产业潜力。
未来 ,随着物理高斯建模、规模化资产生成、端侧轻量化部署、虚实迁移优化等技术的持续突破 ,3D高斯泼溅将逐步构建完整的具身智能基础设施体系 ,广泛赋能工业机器人、服务机器人、 自动驾驶、通用智能体等领域 ,推动具身智能从实验室研究走向工业化规模化落地。
参考文献
[1] 朱军, 刘群. 具身智能研究进展与发展趋势[J]. 计算机学报, 2024, 47(3): 561-588.
[2] 周明, 李飞飞. 虚实迁移学习研究综述[J]. 自动化学报, 2023, 49(8): 1689-1712.
[3] Kerbl B, Kopanas G, Lei mkühler T, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 42(4): 1-14.
[4] Chen J, Geiger A. DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern
Recognition. 2024: 12345-12354.
[5] 浙江大学智能实验室. SAGE-3D: 面向机器人导航的语义高斯场景建模[J]. 机器人, 2025, 47(2): 189 198.
[6]清华大学交叉信息研究院. PUGS: 物理感知高斯三维建模与零样本属性预测[J]. 软件学报, 2025, 36(4): 1456-1470.
[7] Luma AI Inc. Luma AI Official Technical Document[EB/OL]. https://lumalabs.ai, 2026.
[8] Tripo AI Team. Tripo AI Multi-modal 3D Generation Technical Report[EB/OL]. https://www.tripo.ai, 2026.
[9] Meshy Inc. Meshy Industrial 3D Creation Platform Manual[EB/OL]. https://www.meshy.ai, 2026.
[10] GS-Playground Team. GS-Playground: A High-Throughput Embodied Simulation Framework[C]//Robotics: Science and Systems. 2026.
TsingtaoAI是一家专注工业具身智能领域的国家高新技术企业,旗下北京、宁波等地设有研发及运营团队。核心团队主要来自韩国首尔大学、中国农业大学、北京科技大学、蔚来汽车、美团、京东、硅基流动等产研组织,拥有深厚的AI Infra与机器人算法积淀。公司通过自研的通用PoC实验底座与多模态Agent编排引擎,为工业制造、高校实训等场景提供从数据生成、算法训练到即时部署的全栈解决方案。
TsingtaoAI解决具身智能落地最后一公里工程难题。构建一个高效、低成本、可复制的具身智能技能任务开发平台,将平台与具身大模型和异构端侧计算单元组成面向工业企业的物理AI软硬一体化解决方案。获24项AI领域知识产权,包括多模态大模型具身智能实验实训系统等。关键算法基于RISC-V芯片和昇腾NPU优化适配,实现突出性能。项目获长三角算力算法创新大赛冠军,山东省人社厅数字工程师大赛二等奖,宁波AI大赛二等奖、北京东城AI科创大赛技术创新组前三名,WAIC CICC大赛具身智能赛道前三名,入选河北垂直大模型应用场景名单。通过华为昇腾兼容性认证,在华油油气等企业落地。