产品

phantom

版主

phantom Rep
0
0
0
Rep
0
phantom Vouches
Vouches
0
8 MONTHS
8 8 MONTHS OF SERVICE
phantom 获得
0
0
0
获得
0
phantom 凭证
0
0
0
凭证
0
主题
27
点赞
1
HakB
8
在社区成长 8 月
LEVEL 90 100 XP
 

简介​

深度感知是理解3D 物体并判断这些物体有多远的过程。它有助于完成导航、对象操作和场景理解等任务。尽管它很重要,但从单个图像估计深度(称为单目深度估计)对于人工智能(AI)来说是一个具有挑战性的问题。
然而,机器学习,特别是深度学习或人工智能的进步,显着提高了单目深度估计的准确性和可靠性。卷积神经网络(CNN) 和其他深度学习架构在利用大型数据集和强大的计算资源来学习从2D 图像预测深度方面显示出了巨大的前景。这些模型在具有已知深度信息的不同图像上进行训练,使它们能够推广到新的、未见过的场景。
这些技术需要多样化且广泛的训练数据才能在各种场景中发挥作用。然而,收集此类数据需要大量工作。提供详细深度信息的传感器(例如结构光或飞行时间传感器)在范围和条件方面存在限制。激光扫描仪价格昂贵,并且仅在捕获移动物体时提供稀疏的深度测量。另一方面,立体相机显示出前景,但在不同环境中收集足够的立体图像仍然是一个挑战。
因此,研究人员正在探索替代方法,例如使用合成数据、扩充现有数据集以及采用运动结构等技术来创建全面的训练集。
运动结构(SfM)方法已被用来创建训练数据,但它们需要捕获运动物体,并且由于多视图匹配的限制而存在差距。目前,需要多个数据集来训练能够处理现实世界图像中的多样性的模型。我们有几个数据集,每个数据集在某种程度上都有用,但各自存在偏差且不完整。这凸显了需要更全面的数据集来改进单目深度估计模型。
 
顶部