- English – US
- English – India
- English - Malaysia
- English - Singapore
- 日本語 (Japanese)
- 简体中文 (Simplified Chinese)
- 繁體中文 (Traditional Chinese)
随着全球产业的发展、数字生态的拓展以及海量蕴含宝贵信息的数据不断涌现,数据挖掘的重要性日益凸显。尽管数据具有价值已成为共识,但组织如何挖掘数据以获取可落地的洞察、在问题发生前进行预防,并做出明智的业务决策? 与美光一起了解什么是数据挖掘及其如何应用于各个行业。
什么是数据挖掘?
数据挖掘的定义:数据挖掘是指分析海量数据、识别规律和分类,并利用分析结果理解数据集或生成新数据的过程。
数据挖掘以数据仓库为基础,利用机器学习和数据分类技术从存储的数据中“挖掘”信息。它是数据库中的知识发现 (KDD) 的关键组成部分,侧重于从大型数据集中提取有价值的信息。
数据挖掘通常有两种应用方式:对数据进行分类和描述,或者进行预测。在这两种应用中,数据均会经过系统化的组织、过滤、排序和分析流程。通常,数据会通过机器学习算法来优化这一过程。
数据挖掘的工作原理是什么?
数据挖掘旨在从海量数据中提取信息、进行预测、分析和分类。为此,其利用算法来识别数据中的趋势和规律。借助这些规律,数据可以被分类、分析,甚至用于进行预测。
数据挖掘包含四个核心步骤:
- 数据收集:不同组织和项目在定位和收集待挖掘数据方面存在差异。数据可能来自不同来源,存储在分析系统中,或者可从数据仓库中获取。
- 数据准备:来自不同来源的数据通常需要在格式上保持一致,以便进行一致的分析,同时需开展数据清理和错误修正工作。所有这些清理工作旨在确保数据集的一致性和可用性。
- 数据挖掘:数据科学家通过一种或多种算法对数据进行处理,以挖掘数据集。数据挖掘方法的选择流程取决于预期结果和项目资源。
- 数据分析:对数据挖掘过程的结果进行全面分析,以充分挖掘数据价值。数据科学家可利用分类和分析后的数据展示发现并得出结论。
数据挖掘的发展历程是怎样的?
数据挖掘最初是手动流程,通过人工分析信息获取洞察。作为一种手动流程,其起源早于当前支撑其技术体系的人工智能 (AI) 和机器学习技术。
- 20 世纪 60 年代,自动化:数据挖掘最初为手动流程,后来才开发出自动化流程。20 世纪 60 年代先进计算技术的出现,奠定了数据挖掘的基础。
- 1989 年,KDD:数据库中的知识发现 (KDD) 于 20 世纪 80 年代末出现,推动数据挖掘发展为自动化计算流程。
- 20 世纪 90 年代,数据挖掘的发展:20 世纪 90 年代,随着数据分析技术的出现和机器学习的发展,数据挖掘作为一项技术创新受到关注。
- 20 世纪 90 年代末,学术研究和关注度的发展:1995 年,第一届知识发现和数据挖掘国际会议在蒙特利尔举办,标志着学术界对数据挖掘的关注度有所增长。
- 2010 年以来,对数据挖掘的依赖日益加深:自 21 世纪 10 年代以来,人工智能已迅速成为主要技术的基本组成部分。这一演进也使得数据挖掘变得日益重要。借助分类、分析和存储海量数据的简化、自动化流程,人工智能技术能够更高效、更有效地运行。
数据挖掘有哪些主要类型?
根据数据挖掘项目可能的目标差异,数据挖掘通常可分为描述性挖掘和预测性挖掘。但除此之外,还有其他类型的数据挖掘:
- 异常检测用于识别数据集中的异常数据。
- 关联规则学习用于探索各数据项之间的关系,以更好地理解数据并将其置于上下文中考虑。
- 聚类仅基于数据本身(不考虑上下文)对数据进行分组。
- 分类接收输入标签并将其应用于数据,以对数据进行分类。
- 回归根据从数据中理解到的内容生成标签。
- 摘要将数据精简为核心信息。
数据挖掘是如何应用的?
数据挖掘可应用于各个行业。如今,众多行业都依赖于复杂的全球互联,海量数据已成为各类企业的基础,需要审慎处理和分析。
数据挖掘的一个关键应用场景是利用传感器通过分类来检测异常。当所有数据完成清晰分类后,数据挖掘能够加速、自动化检查过程,并确保检查错误、差错和异常时的准确性。此类异常数据具有显著辨识度,可以轻松识别和/或删除,从而实现数据分析流程的精简与优化。突出显示异常数据有助于发现欺诈数据、识别社交媒体网站上的机器人账号,或精准定位产品缺陷。
数据挖掘还可以构建模型,并识别风险、缺陷和潜在问题。例如,在金融服务行业,数据挖掘工具被用于识别安全风险和检测欺诈行为。同样的原理也可应用于网络安全领域,通过具有代表性的数据可以识别现实中的风险。
在汽车行业,数据挖掘还能发现风险和问题,并推动创新。事实上,它是训练高级驾驶辅助系统 (ADAS) 的关键环节,而 ADAS 是自动驾驶领域中日益受到关注的研究方向。
数据挖掘涉及对数据集进行处理和分析,以实现数据分类,这有助于数据科学家高效识别规律、趋势和异常。通过发现关系、进行预测以及根据行为对客户进行细分,这一过程能够揭示有价值的洞察。
此外,其可通过识别低效环节简化业务流程。这些洞察支持做出数据驱动的决策,提升客户满意度,并带来竞争优势。
数据挖掘需要分析海量数据。但随着数据量的增加,计算机和算法所承受的压力也会随之增大。数据挖掘方法的可扩展性是指其在处理更大型的数据集时,保持性能与准确性不发生显著下降的能力。处理超大型数据集的数据科学家需要更具可扩展性的数据挖掘工具,尤其是适配高级存储解决方案的工具。