首页 > 技术

联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准

2026-09-04 16:28:35      西盟科技资讯   


  近日,由因时机器人、上海交通大学和复旦大学等联合完成的HandEdit 数据集与评测基准正式开源。

  该项目研究第一视角人类到机器人灵巧手图像编辑:在尽量保留原始场景、物体、视角和交互内容的前提下,将画面中的人手或手臂替换为指定的机器人构型。围绕这一任务,HandEdit 提供了配对数据、统一评测协议和开源工具,供相关方法训练与比较使用。

  这并不是普通的“换手”视觉特效。编辑结果既要完整移除原人手,又要保持物体状态、接触关系和背景不变;新生成的机器人还需符合目标 URDF 所规定的结构、材质与关节形态。

  数据来源与构成

  目前,机器人灵巧操作数据通常通过遥操作、动作捕捉或真实机器人执行采集。这类数据与具体机器人本体紧密相关,采集和扩展成本相对较高。

  人类第一视角操作视频则记录了抓取、开合、旋拧、剪切和双手协作等过程,包含较丰富的物体与场景信息。但人手与机器人灵巧手在外观、关节结构、尺度和运动方式上存在差异,因此这些视频不能直接对应到指定机器人构型。

  HandEdit 围绕上述差异整理并构建了以下数据资源:

  2 亿余个图像编辑样本;

  30 万余段视频片段;

  汇集 EgoDex、ARCTIC、OakInk2、HOI4D、HO-Cap 五个第一视角操作数据集;

  覆盖 26 种 URDF 构型,其中包括 13 种独立灵巧手和 13 种手臂一体构型;

  覆盖 600 余个场景、1100 余种物体和 400 余类任务。

  13 种独立灵巧手覆盖多个品牌及结构类型,其中包括因时机器人自主研发的RH56DFX系列、RH5DG2系列灵巧手;Hand-Arm 构型中还组合了 JAKA、KUKA、Panda、RM65/75、UR5、xArm 等机械臂平台。

△13 种 Hand-only 与 13 种 Hand-Arm 目标构型

  项目将不同来源、场景和机器人本体的数据整理到同一套处理与评测框架中,以便在一致条件下训练和比较相关方法。

△HandEdit 中的场景、物体与操作类别示例

  数据示例

  下面展示的是 HandEdit 数据处理链路中的同步片段。左右画面使用相同 sequence 与相同帧区间:左侧保留原始人类第一视角操作,右侧展示对应的机器人伪 GT。

  需要说明的是,以下机器人画面属于仿真渲染与图像合成结果,用于数据构建和模型评测,并非真实机器人执行录像。

  Hand-only|独立灵巧手

  在 Hand-only 轨道中,系统需要在保持物体、背景和动作语义不变的前提下,将人手替换为目标灵巧手。

△因时RH56DFX系列灵巧手操作意式咖啡机

  Hand-Arm|灵巧手与机械臂

  Hand-Arm 轨道将可见手臂区域替换为手臂一体构型,需要额外处理腕部位姿、机械臂逆运动学、固定基座、相机关系和前景遮挡。

△因时灵巧手对胶囊咖啡机执行抓取操作

  数据是如何生成的

  为生成与目标机器人构型相对应的参考图像,HandEdit建立了一条结合视觉处理、几何重定向和仿真渲染的数据处理流程。

△从人类第一视角画面到 Hand-only、Hand-Arm 伪 GT 的主要处理环节

  1.分割:默认使用 SAM3 定位人手或手臂区域,覆盖手指、手掌、手腕及可见前臂;

  2.背景修复:移除原前景后,默认使用 ProPainter 恢复被遮挡区域,兼顾连续帧之间的外观一致性;

  3.动作重定向:将 MANO 或三维手部姿态映射到目标 URDF 的关节空间,并结合不同本体的运动链、连杆长度和关节限制进行细化;

  4.机械臂求解:Hand-Arm 数据先完成手部重定向,再设置相机相对虚拟基座,通过逆运动学求解机械臂关节;

  5.同视角渲染与合成:在匹配的第一视角相机下渲染机器人前景,并合成回修复后的场景;

  6.质量筛查:剔除前景残留、背景破损、姿态不合理、严重穿模或合成错误的样本。

  除合成图像外,数据还保留机器人关节状态等结构化信息,用于检查构型和对应关系。

  如何评测编辑结果

  评测不仅考察图像的视觉质量,也需要检查人手是否被完整移除、目标机器人结构与身份是否一致,以及物体交互内容是否得到保留。

  为此,HandEdit 设置了 Hand-only 与 Hand-Arm 两条评测轨道。在论文公开的测试设置中,每条轨道包含1000张图像,并分别对应13种目标构型。评价分为三个层面:

  通用相似度:在整图、编辑区域和背景区域计算 PSNR、SSIM、LPIPS 与 FID;

  视觉语言模型判断:分别评价语义一致性(SC)和感知质量(PQ);

  具身任务指标:检查人手移除、结构一致性、机器人身份一致性和交互保持。

  基准统一测试了 11 种具有代表性的开源与商用图像编辑方法,包括 GPT-Image、Nano Banana、FLUX、Seedream、Qwen-Image-Edit、HunyuanImage、FireRed-Image-Edit 和 OmniGen2 等系列。测试使用固定提示模板,并尽量遵循各模型原有的条件输入方式和默认推理设置。

△Hand-only 与 Hand-Arm 轨道的多维评测结果

  论文报告的结果也呈现出三个值得关注的现象:

  综合表现不能只看一项分数:GPT-Image-2 在通用相似度和具身任务指标上表现较为均衡;

  VLM 高分不等于交互正确:GPT-Image-1.5 的 VLM 评价较高,但结构与交互指标并非最优;

  画面自然不等于任务完成:FireRed-Image-Edit-1.1 的感知质量较高,但目标本体与交互保持仍可能失败。

  这也是 HandEdit 同时保留通用、VLM 和具身任务三类指标的原因:对于机器人图像编辑,手指结构、机器人身份和物体接触关系都需要单独检查。

  使用范围与边界

  HandEdit 的参考结果由重定向、仿真渲染和图像合成流程生成,属于可控、可复现的伪 GT,并非完美或唯一的标准答案。为避免评测退化为单纯的像素对比,HandEdit 同时引入视觉语言模型判断和具身任务指标,使编辑结果在机器人本体正确性、交互一致性或视觉自然度更好时,可以获得高于伪 GT 的评价。

  由因时机器人联合上海交通大学、复旦大学等开发的 HandEdit 数据集与评测基准已正式开源,面向全球研究者与开发者开放。

相关阅读

    无相关信息