ELAI S.r.l.

机器人技术中的人工智能和视觉:识别物体不足以抓住它

从感知到掌握:研究视觉引导机器人操作的数据、校准和证据。

机器人技术中的人工智能和视觉:识别物体不足以抓住它

识别图像中的物体和用机器人抓取它是两种不同的结果。第一个涉及视觉数据的解释;第二个还需要位置、几何形状、抓取、运动和结果验证。正是这种感知与行动之间的联系,让人工智能与机器人的相遇变得有趣。

EL-AI将机器人技术视为一个可能的发展方向来探索。在这里,我们探讨评估视觉引导操作时要提出的问题。我们不展示现有产品EL-AI,也不向客户展示安装:组件容器的案例就是一个研究示例。

描述算法之前的对象

不透明组件、反射组件和透明组件给设计采集的人员带来了不同的问题。在讨论 AI 模型之前,先收集物品到达时的变化、尺寸、颜色、包装和条件。指定它们是排序、重叠还是部分隐藏。

在我们假设的场景中,机器人必须从托盘中拾取组件并将其存放在某个位置。目标不是在屏幕上获得正确的矩形:而是在不损坏工件的情况下完成放置,并识别何时条件不允许您按照项目进行。

区分识别结果与可用于操作的位置

视觉可以提供不同的信息:存在、类别、方向或空间位置。询问哪些是真正能够完成任务的,以及它们可用的不确定性有多大。足以计算照片中物体数量的结果可能不足以将组件插入指定安装位置。

Universal Robots 的 AI 加速器 的文档描述了一组用于集成感知、计算和机器人应用程序的工具。这是开发者平台存在的一个例子;它并不表明每个对象或流程在没有集成活动的情况下已经是可管理的。

了解校准的作用

要在运动中使用视觉观察,系统必须将相机参考链接到机器人的参考。 相机校准手册解释了这种连接,并指出当影响相机位置的条件发生变化时需要重复它。具体过程取决于硬件,并且必须遵循其文档。

对于项目计划,实际问题是如何识别配置不再有效。维护活动或设备更换可能需要经过集成商同意的检查。保留配置版本和更改原因有助于重建测试结果。

建立具有代表性的测试集

收集代表预期工作的图像和条件,包括困难但合理的案例。避免仅使用选定的照片,因为系统可以很好地解释它们。区分用于开发的材料和保留用于验证的材料,以观察处理准备过程中尚未适应的情况的能力。

  • 项目允许的形状、方向和布置的变化。
  • 目标环境的真实光照差异。
  • 物体被部分覆盖或接近容器边缘。
  • 空容器、未知物体和无法使用的图像。
  • 抓取失败,以及需要进一步确认的放置结果。

每个案例都必须有预期的结果以及由设计应用程序的人员定义的管理不确定性的方法。缺乏可靠响应不应隐藏在总体平均值中:应将其记录为要理解的条件。

衡量整个任务

分别存储感知、抓取尝试、放置和所需干预的结果。如果正确识别了部件,但抓取失败,修改模型可能无法解决问题。这种区别使我们能够用不同的技能进行讨论,而不会将每个问题简化为“AI”一词。

可信的测试应说明覆盖了哪些变体、排除了哪些变体。对于EL-AI来说,深入研究这个领域意味着研究软件、数据和物理系统如何协同工作。有用的第一步是提出一个具有可观察标准的范围明确的问题,而不是承诺通用自主能力。

AI辅助准备的内容; 2026 年 9 月 19 日查阅的消息来源。说明性场景,而非客户结果。 AI生成的封面。

封面为 AI 生成的示意图,并非 EL-AI 真实人员、场所或部署的照片。