spark on machine learning--基本统计

最新推荐文章于 2023-10-12 16:40:29 发布

原创最新推荐文章于 2023-10-12 16:40:29 发布 · 1.1w 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#spark #汇总统计

machine learning on spark 专栏收录该内容

2 篇文章

订阅专栏

本文介绍如何使用colStats函数对RDD(Vector)进行列汇总统计，包括最大值、最小值、均值、方差等统计信息。

汇总统计

我们提供列汇总统计RDD(Vector),通过colStats函数中可用的统计信息。
colStats()返回一个MultivariateStatisticalSummary实例，包含列的最大值、最小值、均值、方差和非零的数量以及总数量。

import org.apache.spark.mllib.linalg.Vector
import org.apache.spark.mllib.stat.{MultivariateStatisticalSummary, Statistics}

val observations: RDD[Vector] = ... // an RDD of Vectors

// Compute column summary statistics.
val summary: MultivariateStatisticalSummary = Statistics.colStats(observations)
println(summary.mean) // a dense vector containing the mean value for each column
println(summary.variance) // column-wise variance
println(summary.numNonzeros) // number of nonzeros in each column