美光科技术语表

计算机视觉

色彩斑斓的波浪片

计算机视觉 (CV) 是具有变革意义的技术领域,它赋予机器解读和理解视觉数据的能力,以模拟人类的视觉。利用深度学习卷积神经网络 (CNN),计算机视觉使系统能够以高精度识别、分类和分析图像及视频。

这项创新技术已广泛应用于各个行业,让计算机具备更高级的类人能力。从医疗保健、半自动驾驶汽车,到安防系统、零售行业,计算机视觉正在彻底改变机器与视觉世界互动以及解读视觉世界的方式。

什么是计算机视觉?

计算机视觉的定义:计算机视觉是计算机科学的一个分支,旨在训练机器解读和理解图像和视频中的视觉数据。

“计算机视觉”这一术语,体现了其核心目标:让计算机能够“看见”并理解图像与视频,识别其中的物体并对所观察的内容进行分类。该技术的系统运行高度依赖人工智能的支撑。

计算机视觉技术尤为强大,因为它将以往依赖人工操作的视觉信息处理流程实现了自动化。尽管机器具备视觉数据处理能力已有一段时间,但计算机视觉技术显著降低了传统技术所需的人为干预需求。

计算机视觉的工作原理是什么?

计算机视觉的运行主要由两项核心技术驱动。其一为深度学习,作为机器学习的高级形态,它使计算机系统能够基于所提供的数据及执行的任务实现自主发展与学习。其二为卷积神经网络 (CNN),这类神经网络可直接从输入数据中学习,在图像与视频分析任务中展现出尤为突出的效能。

计算机视觉系统接收视觉数据输入后,通过算法对其进行处理,以训练计算机理解内容并实现类人化的解读。CNN 拆解视觉信息,从而使机器具备理解图像与视频的能力。

通过对图像中单个像素及元素赋予标签与标注,计算机系统可对带标注图像的信息进行处理,并利用 CNN 实现对视觉数据的预测与决策。系统通过信息标签完成图像预处理后,借助神经网络对图像内容进行理解并推导结论,最终输出结果。

计算机视觉的发展历程是怎样的?

  • 20 世纪 60 年代,计算机视觉早期探索:20 世纪 60 年代初,计算机图像扫描技术问世并逐步发展。随着计算机处理、数字化和转换图像能力的提升,以及人工智能的兴起,计算机逐步具备了图像理解能力。
  • 20 世纪 70 年代,计算机视觉算法的发展:到了 70 年代,计算机已具备图像处理能力,催生了使其能够视觉理解所接收图像的算法。最初这类算法仅支持计算机进行边缘识别,随后迅速演进至目标识别,最终可实现上下文信息的补充。计算机视觉算法在此期间持续迭代优化。
  • 20 世纪 80 年代至 90 年代,进一步演进:算法复杂度提升,具备了检测曲线、纹理与形状等特定功能。三维图像领域取得了显著进展,到了 20 世纪 90 年代末,计算机视觉已经能够实现基于图像的渲染、图像变形及更为复杂的处理流程。
  • 2000-2010 年,实时应用兴起与标准化:21 世纪最初十年初期,实时计算机视觉应用取得了重大进展。Viola-Jones 人脸检测框架于 2001 年推出,实现了实时人脸检测。这一时期也迎来了视觉数据集的标准化,2009 年 ImageNet 数据集问世,成为训练和评测计算机视觉算法的重要资源。
  • 2010 年至今:深度学习变革及后续发展:21 世纪 10 年代,随着深度学习技术的出现,计算机视觉迎来颠覆性变革。2012 年,基于 CNN 的 AlexNet 模型在 ImageNet 大规模视觉识别挑战赛中夺冠,其性能远超以往算法。这一时期,TensorFlow(2015 年)、PyTorch 等强大框架相继诞生,促进了复杂神经网络的实现。近期进展包括在半自动驾驶汽车、医学成像和增强现实领域应用计算机视觉技术。

近年来,计算机视觉已发展到能够以极低的错误率识别和分类图像中的元素。这一进展得益于深度学习和 CNN 的不断改进,让视觉数据处理变得更加准确和高效。

计算机视觉有哪些主要类型?

计算机视觉增强了机器模仿人类行为的能力。与​自然语言处理类似,计算机视觉体现了人工智能和深度学习如何拓展计算机的能力边界。鉴于这项技术带来的重大进步,计算机视觉拥有丰富且多元的应用场景也就不足为奇了。

  • 图像分类利用计算机视觉技术对图像进行分类。这种应用对于依赖视觉数据的技术(如社交媒体平台和应用程序)非常有用。通过对图像内容进行界定和分类,图像分类技术能够确保向用户呈现合适内容。
  • 计算机视觉模型经过训练,能够识别和辨认图像中的特定规律,人脸识别便是应用之一。随着该技术变得越来越成熟先进,计算机已经能够区分不同的个体面孔。人脸识别在解锁设备方面尤为实用。
  • 目标检测技术基于图像分类原理而来。图像分类技术使计算机能够实现图像识别和分类,而目标检测技术则使其能够精确定位图像和视频中的特定目标。该技术对交通安全至关重要,它能够识别阻挡物(完全阻断通行且需停车避让的物体)、障碍物(部分挡路且需绕行的物体)以及存在安全隐患的闯入者。

计算机视觉是如何应用的?

图像搜索是计算机视觉技术最直观、最易识别的应用之一。虽然利用搜索引擎在互联网上以图搜图并非新兴技术,但在过去几年中,该技术已取得显著创新。最初,机器只能识别已有图像或基本元素,而如今搜索引擎已具备计算机视觉能力,能够根据复杂元素的细微特征进行自适应搜索。

计算机视觉的一个关键用例是各行各业的安防领域。在日常安防场景中,计算机视觉能够识别危险物品和违禁品。通过加快并自动化安保流程,我们可以保障人们的安全,通过计算机视觉技术确保公共场所没有危险物品。

同样,计算机视觉技术也可应用于医疗行业。通过利用机器学习识别医生可能遗漏的症状和因素,计算机视觉能够为诊断过程提供辅助支持。该技术可提升诊断与治疗的准确率和效率。

多年来,美光一直将计算机视觉技术作为其 AI 赋能制造的关键要素,并借助此技术实现了良率、产品质量和产品上市速度大幅提升。通过在晶圆制造全流程部署智能视觉(图像与视频分析)技术,美光能够检测出肉眼无法察觉的微观瑕疵或缺陷。

该技术可实现即时缺陷检测,助力工程师及早拦截并修正存在缺陷的晶圆,从而避免生产出更多有瑕疵的产品。简而言之,人工智能与计算机视觉的融合提升了检测精度和生产效率,助力产品更快上市且产能进一步提升。

计算机视觉还有一项尚未全面普及的创新应用——自动驾驶汽车。自动驾驶汽车依靠技术来识别道路上的危险和障碍物,而计算机视觉在这一过程中至关重要。通过提升这些车辆的安全性,计算机视觉能够推动产品开发,并促进自动驾驶技术的更广泛应用。

常见问答

计算机视觉常见问答

计算机视觉的主要局限性在于其所处理数据的复杂性。描述一台基于单项元素处理图像的计算机看似简单,但图像和视频却是极其复杂的媒介。

要获得可靠的输出结果,需要针对光照、色彩、有机物体、人体特征等因素进行大量训练。根据具体应用场景的不同,要克服计算机视觉技术中的这些复杂难题,可能需要投入大量资源、时间和资金。

计算机视觉和深度学习是密切相关的领域,但二者用途不同、特点各异。计算机视觉是 AI 的一个分支,核心目的是使计算机具备对现实世界中视觉数据(如图像、视频等)的解读与理解能力。

深度学习是机器学习的一个子集,利用具有多层结构的神经网络(“深度”由此得名)来对数据中的复杂规律进行建模。深度学习是计算机视觉(及其他领域)中使用的一种技术,用于对复杂规律建模并提升模型性能。