KITECH: Building a factory digital twin and synthetic data pipeline for manufacturing AI

Sep 4, 2026
KITECH factory digital twin - point cloud, URP, and HDRP shown together

在这段录制好的演讲中,博士韩国工业技术研究院(KITECH) 制造人工智能合作Team负责人 Hongin Won 和Unity Korea 的技术帐户管理员Woojin Park 共同介绍了一个为期 14 周的项目,该项目将一家铸造厂变成了数字孪生体。他们介绍了团队如何使用Unity Industry从点点云数据构建场景而无需 CAD,如何使用Unity AI加速优化和UI工作,以及如何将孪生体变成一个合成数据管线,用于训练 AI 进行人机协作。

你将学到什么

  • 该团队如何构建金属铸造厂的数字孪生模型?该模型基于点点云数据构建,无需任何CAD源文件。
  • Unity AIAsset ManagerAsset TransformerVersion Control在生产管线中扮演什么角色?
  • 如何将数字孪生模型与现实世界的测量数据进行比对,并校准仍然存在的差距。
  • 如何自动生成带标签的训练数据,而不是手动标注帧?
数据统计——来自演示文稿
Metric
项目周期
Value
距离开赛还有14周
整理好的源资产
Value
从627降至218
源代码签入
Value
77
数据集可视化
Value
39个中的20个
用于增强现实的基于物理的世界模型
Value
超过10
数据集中的事件捕获
Value
17(9人机协作,8纯机器人)
传感器同步率
Value
20 Hz
捕获的原始帧
Value
超过10万
总计拍摄时间
Value
超过80分钟

在即将到来的AI工厂时代,机器人和人形机器人可以共存,我们相信管线可以作为模拟和数据层。

Dr. Hongin Won
Dr. Hongin Won - Korea Institute of Industrial Technology
Manufacturing AI Collaboration Team Lead
KITECH——基于Unity数字孪生的制造人工智能合成数据管道

本次演讲录制于 2026 年 7 月的Unite Seoul 大会。

了解 Unity Industry

Video文字稿

演讲者

  • Woojin Park, Unity Korea技术帐户管理员
  • 博士Hongin Won,韩国工业技术研究院(KITECH)制造人工智能研究中心制造人工智能合作Team负责人
  • 黄在勋,KITECH研究员

运行时:41分钟

关于本文字稿:为了便于阅读,此文本已进行编辑。

引言:一个骨架化的工厂场景,最终演变成一个鲜活的数字孪生体。

[00:00] 朴宇镇:今天,我将讨论基于Unity数字孪生的制造人工智能合成数据管线。我是朴宇镇(Woojin Park), Unity Korea 的技术帐户管理员。在Unity,我负责为工业客户提供技术支持。在这个项目中,我将展示我们与 KITECH 合作 14 周,为支持工厂数字孪生所做的工作。

如果用一句话来概括今天的演讲,那就是这句话。这是一个骨架状的工厂场景如何变成一个鲜活的数字孪生体的旅程。

[00:51]我将谈谈韩国工业技术研究院和Unity使用Unity AI 的历程。我将首先介绍Unity AI及相关产品。接下来,我将转向项目本身,即 KITECH VPH-Metal。

在正式开始之前,让我先给大家展示一下最终result视频。您现在看到的这个区域是成型机制作砂模的地方。在这里,转换产品会被已移除浇口,经过脱模区,然后进入最终研磨和后处理区。我相信,本次演示结束后,您将会明白这个场景是如何在Unity中构建的。

[01:38]我参加过很多关于物理人工智能及相关主题的会议和研讨会。通常在这些课程中,你会看到像这样的工厂的照片、图像或视频,然后你会想,“好吧,我明白了,你可以用Unity或其他工具编译版本数字孪生体。”但究竟需要多少人,需要多少时间进行规划,以及哪些工具可以加快速度?说实话,这类信息通常很难获得。今天我将谈谈我们使用了哪些产品,我们是如何构建它的,以及我们如何利用人工智能加速这一过程。

Unity AI包含以下内容:代理、MCPServer和生成器

[02:23] Unity AI由以下部分组成。第一个是Unity Agent。此外还有 MCPServer和生成器。目前,只需记住这些关键术语即可。

Unity Agent 允许您直接在编辑器中使用基于 Claude 或 Gemini 等的 AI。至于 MCPServer,韩国有很多环境运行在封闭网络上。因此,如果您的公司内部设置了像 Claude 或 Codex 这样的代理,您可以通过该协议将其连接起来,并将其与Unity一起使用。

那么Unity Agent 和 MCP Server之间最大的区别是什么?Unity Agent 在后端运行我们自己开发的技能,大约有 70 到 80 个。因此,它可以进一步加速Unity的开发。

[03:12] Unity的最终目标是3D实时应用程序。当你想到一个3D实时应用程序时,你需要动画、声音、物体,以及大量的纹理和图像。所以,这不仅仅是编写代码的问题。如果您使用Unity Agent 或 MCP Server,您还可以使用生成器为每种资源类型生成的 AI 资源。

Unity Industry工具:Asset Manager、Version Control和Asset Transformer

[03:45]此外, Unity Industry还包括Asset Manager(用于管理资源的工具)、 Version Control(用于版本管理的工具)和Asset Transformer(可将您的资源或 CAD 模型准备好直接用于模拟)。这就是三种工具。

从零开始:从点云端到网格

[04:15]鉴于你们之前已经看过今天项目的最终版本,你们中的许多人可能想知道这一切是从哪里开始的。在这样的项目中,拥有 CAD 数据的人通常会将 CAD 文件导入Unity ,然后继续进行项目。但我们没有 CAD 文件可供参考,所以我们从点点云数据开始。

然后,我们将该点云端转换为简化的低多边形网格,之后,我们使用Asset Transformer、 Asset Manager、 Unity Version Control、 Unity AI和许多其他工具和软件包,在 14 周内完成了该项目。你现在看到的是从同一角度在Unity中可视化的点云端。

[05:04]左边是资源,然后是不同的工具,例如Asset Transformer、Asset Manager、自动化、编辑器和人工智能。我将解释每种工具的用途。您可能最感兴趣的部分是右侧的培训部分,或者仿真和数字孪生部分。最后,我将解释点云端是如何连接到 Unity 的Asset Manager以及数字孪生等输出的。

Asset Transformer:优化资产并使其可用于仿真

[05:42]让我们从Asset Transformer和Unity AI开始。左边的服装略有不同。在右下角,您可以看到同一件衣服分别用 11,000 个多边形和 110 万个多边形渲染,以及每种情况下多边形形状的不同之处。

Asset Transformer是一款工具,当您拥有 CAD 文件或对象文件时,它可以让您轻松地对其进行优化和轻量化。左边的衣服,用肉眼几乎看不出有什么区别。因此, Asset Transformer会尽可能地减轻模型的重量,以便计算机进行渲染,同时将任何可见的差异降到最低。

[06:38]如果你观察底部旋转的立方体,即使旋转的立方体使用相同的代码,白色立方体也会围绕自己的中心旋转,而黄色立方体看起来像是围绕其他点旋转。在 CAD 建模中,这对应于原点的概念。即使你正确地编写了代码,根据原点是设置为我们调用的质心、边界框的中心还是一些随机值,result可能完全不同。因此,这些部分必须进行修正和改进,我们将这个过程称为“仿真就绪”。

[07:26]在Unity,我们使用了Asset Transformer ,并与 KITECH 合作,研究如何进行优化。并非所有任务都完美完成。例如,在梯子上,移动枢轴时,出现了一个问题,即枢轴被压缩成一条直线。在这种情况下,我们使用Unity AI分析了实际的几何原因,然后创建了设置可以应用于整个项目的技能。因此,我们编写了技能标记,并将其应用于 KITECH 的整个工厂场景,将像这样的静态对象转换为可以移动的对象,然后进行了第一轮优化工作。

在Asset Manager中管理版本:627 个源文件缩减至 218 个

[08:25]在我们推进项目的过程中,我们首先向你们展示了点点云数据,然后是将其转换为网格生成的低多边形数据,以及我们刚才展示的经过优化和轻量化的可用于模拟的数据。所以数据共有这三个版本。但说实话,实际版本可能远不止这些。为了避免被各种版本搞糊涂,并在正确的时间提取我们需要的数据,版本控制至关重要。

[08:45]我们使用的工具是Asset Manager。CAD 文件通常不支持预览。CAD有很多优点,但是渲染3D对象很耗资源,而且如果没有预览,很难确定哪个资源才是你需要的。

[09:03]Asset Manager提供每个对象的预览。您可以直接在编辑器中下载它们,或者上传它们并立即使用。它还包括转换为其他格式或自动优化格式的功能。

我们没有简单地逐个上传每个模型文件,而是定义了一设置规则,创建了基于本体的 AAS 数据,然后将其上传到Asset Manager。我们上传的文件格式多种多样,不仅包括通用的FBX,还包括USD以及其他需要的格式。因此,我们最初共有 627 个源文件,应用单一标准后,我们​​将其减少到 218 个文件并上传。

Unity Version Control支持 URP、 HDRP和USD

[10:07]接下来我们研究的是版本控制。对很多人来说,提到版本控制,首先想到的可能是Git 。但是使用Git管理图像或大型文件基本上是非常困难的。

在本例中,我们在 Unity 的 URP渲染管线中运行了该点云端,并且我们还在高保真度的HDRP中运行了它。因此,为了维护两个版本并添加功能,我们使用了Unity Version Control。在 14 周的时间里,我们为 URP、 HDRP和USD分离了分支,保持编辑器处于集成配置管理之下,并根据变更集处理了 77 个版本。

使用Unity AI构建运行时仪表板

[11:18]现在资源准备就绪,版本控制也已到位,是时候进入真正的开发阶段了。

当人们第一次表示想要一个数字孪生体时,他们首先要求的就是一个仪表盘。过去,构建这个仪表盘意味着要引入UI和UX设计师,并将每个功能作为一个类来精心构建,等等。以前就是这么做的。

[11:32]但现在,如果你make一张你想在这个工厂中显示的数据图像,或者make一张概念图, Unity AI内部的技能就会在后台运行,并直接将其转换为交互式UI仪表板。

通常情况下,在现场有很多PLC数据无法直接连接的情况。我们的情况也一样,存在防火墙和安全相关的问题,所以我们与研究人员合作,创建了一种虚拟的 PLCdataset,然后将其连接到Unity内部的仪表板。我们一起完成了整个过程。

磁铁场景的Custom编辑器器工具

[12:21]接下来我们所做的不仅仅是一个视觉上令人信服的模拟,而是一个真正基于事实的项目。在运行时创建仪表板之后,我们还需要在编辑器本身内部创建仪表板或自定义编辑器。

在这家工厂里,第一个场景是磁铁移动并利用磁力拾取物体。为了模拟拾取或不拾取金属块所需的磁力大小,我们没有硬编码每个值,而是直接在编辑器中公开了它们。因此,诸如每辆小车的status、磁铁的status,甚至物理模拟的行为方式等,都是使用Unity AI开发的。

根据概念图创建熔炉效果

[13:21]接下来我要讲的是炉效应。你们中的一些人可能认为需要视觉特效。

Unity AI和 MCP 最强大的功能之一是它们可以捕获Scene View或Game View。在进行项目开发时,就像手机应用颜色校正一样, Unity 编辑器或Game View中的颜色看起来也会有所不同。要想用这些颜色营造出你想要的效果,你需要用到色彩搭配等技巧。过去,那是艺术家们必须自己处理的领域。

[14:01]但现在你可以告诉人工智能,“在场景中Create四个球体,对它们应用熔炉效果,并不断更新它,直到它看起来最接近我给你的概念或概念图像。”Unity AI随后会找到并创建最合适的效果,甚至可以一次性将其应用到实际场景中。

将 URP 转换为HDRP

[14:24]之后,我们创建了 URP 版本,然后将其转换为HDRP。在将 URP 转换为HDRP的过程中,我忙于其他事情,并将我准备好的图形设置、概念和其他细节提供给了 AI。你在这里看到的画面是人工智能随着时间的推移逐步改进,最终与概念图像相匹配的result。

[14:51]起初要么是黑屏,要么是过亮的屏幕。然后它又恢复到原来的状态,亮度稍微提高了位,并自行经历了这些步骤,因此工厂场景不断更新。它逐渐改进,最终,可以说它变成了我心目中完美的HDRP场景。

运行时时USD出口

[15:18]最后我要提的是,我们并没有止步于 URP 和HDRP。我也为其他大型企业处理数字孪生项目,他们最常说的是:“我们公司的Other团队或部门希望在其他工具或其他平台上使用这些组织良好、可用于仿真的数据。”

[15:44]所以我们所做的工作是在运行时启用USD导出。运行时导出是指在running模拟时,您可以对布局进行一定程度的更改,保存更改,并将该状态以USD格式导出。这样,在另一个平台上,纹理、几何形状以及其他所有内容都可以原封不动地保留下来并立即使用。

将双胞胎输入世界模型

[16:18]一旦你拥有了这样的数字孪生体,就不仅仅是连接东西和查看仪表盘那么简单了。我还想谈谈当今最热门的话题:世界模特。

借助 FLUX、Qwen 或NVIDIA Cosmos 3 等世界模型,您可以从Unity中构建的数字孪生体中提取屏幕,输入该屏幕或图像,然后显示诸如工厂老化、蒸汽逸出、模拟到现实的场景,甚至是时间变化等内容。我们获得了这些领域的各种数据集。

项目成果以数字形式呈现

[16:55]用数字来表示我们的结果:该项目从启动到运行了 14 周。我们将 627 项资产精简为 218 项。我们进行了 77 次源代码提交,从点云一直发展到HDRP。在我们拥有的 39 个数据集中,我们对其中 20 个进行了可视化。后来,我们基于 10 多个基于物理的世界模型进行了数据增强。

并排比较和制造领域差距

[17:27]我们制作了最终对比视频。在这里,您可以先看到点云端,然后是中间的 URP,最后是HDRP。之后我们进行了扩散、世界模型模拟和数据增强。

在这个过程中,我想指出一点。基于通用数据训练的模型对制造业领域的数据几乎没有理解能力。因此,我们花了大量时间研究如何弥合制造业领域的数据差距。接下来,博士将解释这部分内容。洪仁元。

我要感谢博士。Hongin Won、研究员 Youngseok Han、研究员 Jaehoon Hwang 以及其他许多与我们一起参与这个项目的人。

KITECH:将数字孪生体转化为人工智能可以学习的环境

[18:47] 博士洪仁元:我是来自韩国工业技术研究院的元洪仁。

此前,管理员朴宇镇(Woojin Park)讲解了如何在Unity中编译版本和扩展工厂数字孪生,特别是针对铸造厂。接下来,我将探讨如何将数字孪生体转化为人工智能可以学习和测试的环境。

今天演讲的题目是“基于Unity数字孪生的制造人工智能合成数据管线” 。既然标题提到了合成数据管线,你可能会想,“那么他们究竟是如何合成数据的呢?”但在此之前,最重要的问题是:“数字孪生体是否真的与真实系统相匹配?”我想更详细地谈谈我们究竟是如何验证这位的。我们将构建与现实相匹配的数字孪生模型的过程称为“接地”,我将从这个透视来解释它。

Team和研究方向

[19:49]我是元洪仁,我是韩国科学院(KITECH)制造人工智能研究中心制造人工智能合作Team的负责人。我的专长领域包括制造人工智能、数字孪生和工业数据基础设施。具体来说,我对数字孪生的兴趣领域在于虚拟化,即如何将现实世界的问题转移到虚拟环境中;生成,即如何在该环境中创建所需的数据;以及验证,即如何将结果带回现实世界进行验证。

[20:18]参与本项目的主要研究人员是我们中心的黄在勋研究员和河承烨研究员。研究员 Jaehoon Hwang 负责测量和纠正将传感器从真实环境转移到双胞胎后剩余的差异,而研究员 Seungyeop Ha 则负责处理人机模拟和运动,以及在各种条件下扩展数据。

[20:48]我们制造数字孪生的研究方向可以归结为一条线:数字孪生服务于人工智能,人工智能服务于数字孪生。这意味着要创造人工智能可以学习和测试的环境,并利用人工智能来重建和更新数字孪生体。我们也在研究基于多智能体系统和LLM的先进数字孪生技术。

[21:09]这里有一个关于我们中心建造的模型的简短视频。该视频介绍了将EV装配线、城市物流、铸造厂等转移到孪生体并将它们连接成单一供应链的模型。我们经常使用Unitysimulator,但在后端,我们也使用更轻量级的模拟来建模场景,然后将这些模拟的输出导入Unity集成管线。这是我们研究的一个主要方向。

[21:48]该视频还介绍了那里开发的仿真和验证技术,包括传感器融合和基于 LLM 的代理规划机器人路径的研究。它还包括一个使用Unity MCP 功能规划机器人路径的示例。

人机协作以及人机协作数据为何稀缺

[22:09]今天的主题是构建人工智能可以学习和测试的环境。本次演讲涵盖的场景是人类和机器人协作的制造现场。人类和机器人在同一空间共同工作的环境称为人机协作,或 HRC。

[22:25]至于演讲的流程,我首先要谈谈为什么这种 HRC 数据在现实世界中如此稀缺,以及为什么我们仍然需要将其完全编译版本到数字孪生模型中。然后我将介绍我们为克服这一问题所采取的方法,以及我们开发的数据合成方法。构建数字孪生模型时,很多部分与现实世界并不完全吻合。换句话说,实际与模拟之间存在差距,我还会解释我们是如何校准和解决这一差距的。

[23:02]让我们先从数据问题开始。众所周知,人工智能通过数据学习。但有些领域有大量数据可供参考,而有些领域则没有。例如,在自动驾驶领域,我们可以轻松获得数百万公里的驾驶记录;对于一般的视觉数据,我们可以从网络或日常生活中提取图像和视频。语言模型还可以使用来自整个互联网的数据进行训练。

但对于制造场所,特别是人机协作的场所,我们需要数据来了解工人靠近机器人、身体某些部位被遮挡,或者人员进出安全区域的情况。这类数据在public数据集中极难找到。

数据匮乏的四个原因

[23:54]我们发现了制造现场数据匮乏的四个原因。

首先是安全问题。人进入机器人危险区域的那一刻,不是你可以反复模拟来收集数据的。

其次是成本。架设实际线路、安装传感器并在不断变化的条件下进行拍摄需要大量的时间和金钱。

第三部分是我们遇到的最大困难:贴标签。对于人工智能训练,需要标注和标签来创建真实标签。但要在同一时刻通过多个传感器对齐人类和机器人的3D位置、距离、关节信息、背景、物体和像素级区域,完全需要人工操作。

[24:36]最后是稀有性。准确来说,是场景罕见性。在制造现场,获取人与机器人碰撞的数据极其困难。碰撞发生前的情况被称为长尾事件。现实中这种情况几乎不会发生,而且我们很难人为地创造这种情况。在一个管理良好的网站上,这类数据出现的频率应该更低,而不是更高。

邻近数据:我们实际需要哪些数据来训练

[25:16]我们想要训练的不仅仅是人是否在场,而是人与机器人之间的距离、方向以及接近的姿态。这类信息我们调用邻近数据。我们需要了解这种关系,以便人类和机器人能够协作并判断安全区域,对于机器人而言,还需要了解这种关系,以便机器人能够监视与人的距离,或者创造可以减速和停止的场景。

[25:43]简单来说,情况是这样的。数据量远远不够。所以如果无法收集到数据,那就生成它。这就是我们设置要做的事情。但是,要生成数据,执行生成操作的模型本身也需要可靠的数据。因此,我们首先以现实世界中测量的值作为参考,并构建了一个Unity数字孪生合成数据管线。

我们为什么选择Unity:四种技术集成于一个运行时

[26:09]我们觉得将四种技术连接在一个运行时中相对容易,所以我们使用了Unity。

首先是物理模拟,其中机器人、人和物体以物理上有效的方式进行交互。其次是HDRP渲染,它将光照、材质等与现实相匹配,以减少领域差距。第三是传感器仿真,它可以虚拟地再现几种类型的传感器。第四,应用技术从孪生体生成数据,这样就可以在无需人工手动标记的情况下进行标注和标记。

[26:48]如果这四个人一直保持分离状态,我们就无法生成用于人工智能训练的数据。通过将它们整合到同一执行环境和同一时间轴上,我们得以生成所需的数据。

工业 HRC-Benchdataset

[27:03]获取训练数据的过程必须遵循构建数据集的专业、可靠的方法。为此,我们引入了制造业领域的专家,并共同设计了真实的人机协作场景。我们在韩国测试实验室的Robot测试与认证中心创建了权威的实验性的环境。

[27:33]result这些实验,我们构建了工业 HRC-Benchdataset。迄今为止收集到的 HRC 场景,已达到可以public发布的关卡,分为两种类型:码垛和生产零件检验。该dataset集共包含 17 集。其中九项实验由人类和机器人共同完成,其余八项实验则由机器人单独完成。

[28:02]这里使用的传感器系统集成了RGB摄像头、激光雷达、360 度视频和运动捕捉系统。这些传感器模式均以 20 Hz 的频率同步,这为我们提供了超过 100,000 帧原始数据。如果按纯时间计算,这相当于 80 多分钟。

对我们来说,重要的不仅是数据的缩放,还有数据的结构。All这些数据都共享同一个时间轴进行观测和标记,这使得准确的比较和有意义的数据生成成为可能。我们计划很快通过 Hugging Face 或外部代码仓库发布Industrial HRC-Benchdataset。

这条管线可以用三个词概括:接地、校准、生成

[28:53]我认为整个流程可以用三个词概括:接地、校准、生成。

第一点不仅仅是创造一个孪生体,而是将现实世界中衡量的价值观锚定到它上面。这就是接地,它使双胞胎与现实保持一致。然后是校准,它可以减少实际与模拟之间的差距。接下来就是数据生成阶段。

接地:环境、传感器、机器人和标签

[29:35] 黄在勋:我是黄在勋,我负责真实场景到仿真场景的实现。在基础阶段,我们从现实中引入了四样东西:环境、传感器、机器人和标签。

环境

[29:49]我们测量了 KTL 测试平台的空间尺寸和主要设备布局,并根据这些数值,在Unity中将设备和工作区域一一匹配。除此之外,我们还应用了HDRP,使材质和光照与真实环境相匹配。为了营造背景,我们利用现场拍摄的 360 度全景图像,构建了一个逼真的3DGaussian溅场景,以减少真实与模拟之间的差距。

我们的最终目标是创建一个参考单元,将相机看到的结构和遮挡情况、物体之间的相对位置以及光线和材料如何影响观察到的事物与现实世界进行并排比较。屏幕上的图像中,左侧是真实场景,右侧是从同一视角得到的数字孪生图像。

传感器装置

[30:34]在实验中,我们使用了RGB和深度相机、激光雷达、360 度相机、运动捕捉以及来自两个机器人的状态数据。在我们构建的虚拟环境中,我们并没有将其简化为单个摄像头。在检查了每个传感器在真实装置中的安装位置及其观测内容后,我们构建了具有相同结构的虚拟传感器。

[30:59]在Unity运行时中,我们构建了自定义传感器组件,以便所有观测结果共享同一个模拟时钟。我们还将机器人状态和人类动作联系起来,使它们在同一时刻同步。这种同步之所以重要,是因为仅凭一张图像无法概括邻近关系。同时,视频、深度、机器人关节和人体姿态都需要同时存在,才能一致地计算距离和安全区域标签。

Robot

[31:27]我们只有一个标准。它必须是符合物理规律的运动,而不是仅仅看起来合理的运动。我们引入了在实际测试平台上记录的关节轨迹,并将其配置为按原始时间顺序逐帧重放。我们使用 Unity 的 Articulation Body 配置了机器人的连杆和关节、自由度和物理结构,然后在此基础上运行了记录的关节状态。由于惯性和接触力是同时计算的,因此我们能够在单一的物理结构中处理机器人运动与周围物体之间的交互。

标签

[32:02]从相同的模拟状态下,同时生成四种类型的真实信息:2D和3D边界框,用于表示人、机器人和部件的位置;语义分割和实例分割,用于在像素关卡分离对象;关节坐标用于姿态估计;深度真实值用作邻近距离的参考。屏幕上显示了一个应用了3D边界框的场景。

这些标签并非由某人手工逐帧标记而成。它们直接来自Unity模拟状态。这样既降低了标注成本,又减少了标注报错。

相机真实与模拟之间的差距

[32:52]Next,我将解释我们在构建数字孪生模型时遇到的现实与仿真之间的差距,以及我们是如何解决的。这些是残余差距,是即使在转移之后仍然存在的现实与虚拟之间的差异。其中,我们确定了两个直接影响邻近值和真实来源的因素。

第一个事件发生在相机里。在构建虚拟环境时,我们对真实环境和虚拟环境都设置了相同的传感器模型和相同的视野。但同一个对象并没有出现在相同的像素上。

[33:20]如果你看一下右侧的边缘叠加层,你会发现同一结构的边界会根据位置略微错位。即使将实际的镜头数据表应用到Unity环境中也无法解决问题。这是因为仅凭产品规格和标准镜头型号无法解释安装角度和每个镜头所造成的差异。

在人权委员会,即使是这么小的分歧也很重要。如果人和机器人之间的边界移动几个像素,模拟中生成的像素标签与真实观察结果之间的对应关系也会变得不稳定。因此,我们决定直接测量安装在该测试平台上的相机的残差。

测量镜头畸变而不是建模。

[34:01]我们最终确定的方法很简单。不要直接对镜头进行建模。测量一下。

这个过程包括三个步骤。首先,利用从多个视角生成的3DGaussian视图,我们获得了真实环境和虚拟环境中的相应场景。然后,我们计算了这些成对图像在像素关卡的差异,并将它们记录为逐像素畸变图。最后,我们将该贴图应用到 Unity 的相机畸变Shader中,以便在图像渲染过程中校正虚拟相机。

[34:35]关键就在于这个循环。我们创建相应的场景,测量剩余的差异,并将该值反馈到Unity运行时。

result如下。左侧是真实传感器的观测结果,中间是修正后的数字孪生图像,右侧是两幅图像的边缘叠加图。看看右侧的边界线,你会发现比以前有了明显的改善。通过应用指定的畸变图,我们能够确认真实图像和虚拟图像之间的像素对齐情况得到了适当的改进。

[35:09]这不是外部后处理,而是在虚拟相机生成图像时运行的组件,因此可以在同一个执行环境中生成校正后的观测值和真实值。

利用IK修复不稳定的人体运动

[35:16]第二个问题出现在人体运动中。屏幕上显示通过动作捕捉技术记录的人体动作,并用标记和骨骼进行回放。这是在拍摄过程中,身体的一部分被机器人和工作台遮挡的部分。请注意观察脚部关节是如何开始抖动的。随着咬合的加深,对隐藏关节的估计变得不稳定,因此脚在地板上滑动,关节移动到物理上不可能的位置。

[35:47]这种震动直接扭曲了人与机器人之间的距离、身体各部位的接近程度以及安全区域标签。因此,我们也对人体运动施加了物理约束。这些指的是地面和关节的活动范围。

这和之前的情况一样。这次只需要注意两件事。脚是否始终贴着地面,关节是否保持自然姿势?

[36:14]首先,利用 Foot IK,我们将脚重新连接到测量的真实地面几何形状上。然后,利用HumanoidIK,我们限制被遮挡的关节在有效的关节范围内移动。IK 根据手或脚的目标位置重新计算中间关节的位置。此项修正旨在减少干扰接近度和安全标签的非物理运动。

场景回放:码垛和零件检验

[36:40] 博士洪仁元:我要感谢研究员黄在勋,他阐述了缩小真实与模拟差距的关键技术,从管线建设到传感器和IK校正。我将简要地向大家展示我们构建的数字模型是如何运行的,然后结束我们的演示。

[37:21]我们构建的两个数字模型场景基于相同的 HRC 环境,但在任务特征上有所不同。第一项是码垛,第二项是表面检查。两者都被设计成在制造现场可能发生的场景。指定的细节我们将在摘要中另行发布。

[37:44]这是托盘堆垛案例。在码垛模型中,我们之前通过关节体从真实机器人记录的信息被集成到这个数字孪生模型中。正如你刚才看到的,两种类型的传感器数据、机器人状态信息、实例掩码和分割掩码都是同步播放的。

[38:10]第二个场景是零件检验。工人与机器人之间的近距离接触情况也进行了建模,并且与仿真和机器人数据同步性非常好,因此我们可以重现所有四个要素都接地的数据。仔细观察,即使人物与某个部分重叠,也能看出分割效果非常好。

[38:41]这条数据管线的价值不仅限于构建一次性dataset。它还可以扩展到许多其他工业场所并进行复制。

使用Unity Perception软件包进行域随机化

[39:15]我们之前展示的与其说是一次性dataset,不如说是一个可以不断扩展数据的生成式数据管线。基于Unity Perception 软件包,我们构建了一个域随机化模型,并定义了光照、材质、摄像机等的参数范围和采样规则,从而围绕这个精确对齐的基线生成了逼真的变化。

System总结和结束

[39:39]我认为我们可以用这个数字来概括一切。这是整个系统的结构。左侧是目标物体、人体运动、机器人轨迹等等。它们是可以随时替换的输入元素,中心是核心。

[39:53]地面模型使用来自实际地点的测量值设定基线,校准模型按任务纠正误差,右侧是自动提取多模态地面真实数据的模型,即生成模型。那是我们建造的三栋楼。

我们展示了如何基于实际测试平台创建孪生模型,并校准关键任务差异,直至生成同步数据。

[40:29]我们今天展示的数据是 HRC,但实际上,我们将其作为应用来证明我们管线的设计原则。在即将到来的AI工厂时代,机器人和人形机器人可以共存,我们相信我们的管线可以作为模拟和数据层。

我们转到感谢 KTLRobot测试和认证中心,他们提供了测试平台环境并与我们一起进行了实验;还要感谢Unity Technologies,他们从一开始就与我们在一起,并给予了我们全力支持。