MLlib 页面截图
产品页面 点击查看大图

MLlib

MLlib 是 Apache Spark 的可扩展机器学习库,提供 Java、Scala、Python 和 R 的 API。

可扩展机器学习机器学习库
平台
Windows、Linux、macOS、Hadoop YARN、Apache Mesos、Kubernetes、Standalone cluster
语言
多语言
价格
开源软件,采用 Apache License 2.0 许可。
01

Overview

产品概述

MLlib 是 Apache Spark 的机器学习库,致力于让实用的机器学习具备可扩展性和易用性。它提供多种机器学习算法,包括分类、回归、决策树与集成方法、推荐、聚类、主题建模、频繁项集挖掘等,并包含特征变换、ML Pipeline 构建、模型评估与超参数调优、模型和 Pipeline 持久化、分布式线性代数与统计工具。MLlib 的 DataFrame 版 API 是主要 API,RDD 版 API 处于维护模式。MLlib 随 Spark 发布,可在 Java、Scala、Python 和 R 中使用,也支持在本地多核机、Hadoop YARN、Apache Mesos、Kubernetes、独立集群或云端运行。
02

Capabilities

核心能力

01

多语言 API

提供 Java、Scala、Python 和 R 的 API,方便不同语言用户使用机器学习能力。

02

丰富的算法与工作流工具

包含分类、回归、决策树/随机森林/梯度提升树、推荐、聚类、主题建模、频繁项集等算法,以及特征变换、ML Pipeline 构建、模型评估与超参数调优、模型与 Pipeline 持久化等工具。

03

高性能与可扩展执行

利用 Spark 的迭代计算优势,MLlib 可在大规模数据上高效运行,并可在多种集群模式下部署。

03

Use Cases

适用场景

  1. 01

    大规模数据上的模型训练

    从 HDFS、HBase 等数据源读取数据,在 Spark 集群上执行分类、回归、聚类、推荐等机器学习任务。

  2. 02

    构建机器学习流水线

    使用 MLlib 的特征变换、Pipeline 构建、模型评估和超参数调优功能组织可复现的机器学习工作流。

  3. 03

    嵌入 Hadoop 数据处理流程

    借助 HDFS、HBase、Hive、Cassandra 等数据源支持,将机器学习计算集成到既有 Hadoop 工作流中。

04

Integrations

集成能力

01

HDFS

可读取和处理 HDFS 中的数据。

02

Apache HBase

可从 HBase 读取数据用于机器学习。

03

Apache Cassandra

可访问 Cassandra 中的数据。

04

Apache Hive

可访问 Hive 中的数据。

05

NumPy

在 Python 环境下与 NumPy 进行互操作。

06

R 语言库

在 R 环境下与 R 库进行互操作。