|
|
|
|
|
深度学习在制造与维护领域自动化视觉检测中的应用:开放获取论文综述 | MDPI Applied System Innovation |
|
|
论文标题:深度学习在制造与维护领域自动化视觉检测中的应用:开放获取论文综述
论文链接:https://www.mdpi.com/2571-5577/7/1/11
期刊名: Applied System Innovation
期刊主页:https://www.mdpi.com/journal/asi
一、引言
目前,工业领域的质量评估在很大程度上仍依赖于真人领域专家的目视检测(或由其提供技术支持)。人工检测人员经验丰富,但人工检测成本高昂、难以规模化,且容易出错:研究表明,在复杂检测任务中错误率高达20%–30%,而且疲劳会随着时间的推移进一步降低准确率。自20世纪80年代以来,人们一直在探索基于传统计算机视觉的自动化技术,但其应用主要局限于简单、可控的任务。深度学习的出现改变了这一局面,其模型在图像分类、目标检测和图像分割等任务中的表现已能与人类相当,在具有挑战性的环境条件下,甚至能超越人类水平。已有大量综述针对钢铁生产、道路维护等特定行业领域的深度学习检测应用进行了梳理,但跨领域的整体图景仍然缺失。为此,本综述旨在探讨:深度学习目前在制造与维护领域的自动化视觉检测(AVI)中的应用程度如何?近期学术研究中还存在哪些尚未被充分挖掘的潜力?
二、材料与方法
本研究采用了 Vom Brocke 等人提出的系统性文献综述流程。作者基于 Web of Science 数据库,将两大核心领域的检索词进行了组合:一是基于深度学习的计算机视觉领域(如神经网络、Transformer、目标检测等),二是工业视觉检测领域(如缺陷检测、损伤检测等),并将检索范围限定在2010年及以后。为了确保本综述的透明度与可理解性,我们仅纳入了英文撰写的开源(Open-Access)文献。初始检索共获得6583条记录;在排除不涉及工业背景的学科类别后,剩余808条记录进行全文筛选。我们保留了明确描述基于二维图像数据的工业应用案例,并报告了检测任务、方法、数据和性能的文献,最终得到196篇论文。我们根据应用场景、检测任务、模型架构、数据集特征和学习范式对这些文献进行了分类,并提出了一种简单的指标来量化数据集的类别平衡程度。
三、分析与结果
维护应用案例在语料库中占据主导地位,占比达68.3%,而制造类应用仅占31.7%,两者比例约为2:1。在维护领域,仅土木工程一项就占66.9%,其次是铁路、能源和航空领域的应用;在制造领域,(微)电子、锻造材料、农业、汽车和纺织行业占据最大份额(见图1)。这两类应用场景在检测任务的需求也有所不同:维护类应用中77%的案例依赖定位任务,这是因为需要评估包含众多不同部件的整个系统;而制造类应用则在分类与定位任务之间大致均衡分布。卷积神经网络仍是事实上的标准方法。基于文献报告的性能表现,我们建议在分类任务中采用 EfficientNet 和 ResNet,在目标检测任务中采用 YOLO 或 Mask R-CNN,而在分割任务中,DeepLab、Mask R-CNN 和 UNet 是较为理想的选择。
数据方面的情况则更具挑战性:数据集规模从45张到超过10万张图像不等,中位数约为2000张;97%的文献采用监督学习,仅约三分之一使用了至少一个开放数据集。许多论文对其数据的描述不完整,导致研究结果难以比较和复现。此外,我们观察到,从学术研究中提出新模型到其首次应用于工业自动化视觉检测,通常需要两到三年的时间。视觉 Transformer 模型自2022年起开始出现在自动化视觉检测领域,其性能已跻身相应应用场景的领先水平。

图1 196篇综述文献按检测场景(维护vs制造)、行业领域及视觉检测任务的分布情况
四、讨论
本研究结果表明,基于深度学习的自动化视觉检测已发展成为一个较为成熟的领域,但与学术界的计算机视觉相比仍落后几年。对监督学习的过度依赖与工业界常见的小型标注数据集存在不协调;迁移学习仅在约一半的论文中使用,而自监督方法的探索则十分有限——尽管这类方法正是为应对数据稀缺场景而设计的。我们还发现存在可复现性问题:数据集描述的不完整,以及作者所提供的77个开放数据集重复利用率偏低,使得不同方法之间的比较以及在已有成果基础上的进一步研究变得困难。本文提出的针对具体任务的模型推荐,以及所提出的类别平衡指标,为从业者选择模型架构和评估自身数据提供了一个起点;而本文构建的应用场景分类体系,也为未来研究提供了统一的术语框架。
五、展望与结论
我们预期视觉 Transformer 模型将成为自动化视觉检测领域的标准方法:其性能已处于领先水平,且目前关于高效变体的研究也在不断降低其硬件需求。视觉 Transformer 模型所具备的强大自监督学习能力,对于标注缺陷样本稀缺的工业场景而言尤为重要,然而目前所有被综述的 Transformer 应用仍依赖于监督式微调。因此,未来研究应致力于将自监督预训练方法迁移应用于自动化视觉检测,将该领域从二维图像拓展至三维数据和点云数据,并探索如何缩小研究与实际应用之间的差距。总而言之,本综述通过对196篇开放获取文献的分析,梳理了当前深度学习在制造与维护领域视觉检测中的应用现状、针对不同任务可推荐的模型,以及该领域尚未被充分挖掘的最大潜力所在。
Hütten, N.; Alves Gomes, M.; Hölken, F.; Andricevic, K.; Meyes, R.; Meisen, T. Deep Learning for Automated Visual Inspection in Manufacturing and Maintenance: A Survey of Open- Access Papers. Appl. Syst. Innov. 2024, 7, 11.
期刊介绍
主编:Prof. Dr. Christos Douligeris, University of Piraeus, Greece
Applied System Innovation (ASI, ISSN 2571-5577) 是一个聚焦于集成工程与技术,经同行评审的国际性开放获取期刊。该期刊由国际知识创新和发明学会 (IIKII) 所有,由MDPI以月刊的形式在线出版。目前期刊已被Ei Compendex、Scopus、ESCI (Web of Science) 等重要数据库收录。
期刊致力于发表应用系统创新方面的研究成果,最终目标是发现与未来设计相关的新型学科知识,促进一系列行业技术的发展,提高社会福利水平。期刊欢迎对应用系统创新感兴趣的研究者提交原创性研究论文和综述文章。
2025 Impact Factor:3.4
2025 CiteScore:9.0
Time to First Decision:21.3 Days
Acceptance to Publication:4.5 Days
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。