Overview
产品概述
Capabilities
核心能力
多语言 API
提供 Java、Scala、Python 和 R 的 API,方便不同语言用户使用机器学习能力。
丰富的算法与工作流工具
包含分类、回归、决策树/随机森林/梯度提升树、推荐、聚类、主题建模、频繁项集等算法,以及特征变换、ML Pipeline 构建、模型评估与超参数调优、模型与 Pipeline 持久化等工具。
高性能与可扩展执行
利用 Spark 的迭代计算优势,MLlib 可在大规模数据上高效运行,并可在多种集群模式下部署。
Use Cases
适用场景
-
01
大规模数据上的模型训练
从 HDFS、HBase 等数据源读取数据,在 Spark 集群上执行分类、回归、聚类、推荐等机器学习任务。
-
02
构建机器学习流水线
使用 MLlib 的特征变换、Pipeline 构建、模型评估和超参数调优功能组织可复现的机器学习工作流。
-
03
嵌入 Hadoop 数据处理流程
借助 HDFS、HBase、Hive、Cassandra 等数据源支持,将机器学习计算集成到既有 Hadoop 工作流中。
Integrations
集成能力
HDFS
可读取和处理 HDFS 中的数据。
Apache HBase
可从 HBase 读取数据用于机器学习。
Apache Cassandra
可访问 Cassandra 中的数据。
Apache Hive
可访问 Hive 中的数据。
NumPy
在 Python 环境下与 NumPy 进行互操作。
R 语言库
在 R 环境下与 R 库进行互操作。