Spark大数据处理讲课笔记搭建Spark开发环境

最新推荐文章于 2025-05-03 08:23:53 发布

wsltedie

最新推荐文章于 2025-05-03 08:23:53 发布

阅读量164

点赞数

文章标签： spark 大数据 hadoop

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/wsltedie/article/details/130024981

版权

本文介绍了Spark的三种部署模式：Standalone、Mesos和Yarn，并详细讲解了如何搭建Spark单机版环境，包括安装配置JDK、下载安装Spark、解压及配置环境变量，最后通过SparkPi例子展示了Spark的简单使用。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

一、了解Spark的部署模式
（一）Standalone模式
Standalone模式被称为集群单机模式。该模式下，Spark集群架构为主从模式，即一台Master节点与多台Slave节点，Slave节点启动的进程名称为Worker，存在单点故障的问题。
（二）Mesos模式
Mesos模式被称为Spark on Mesos模式。Mesos是一款资源调度管理系统，为Spark提供服务，由于Spark与Mesos存在密切的关系，因此在设计Spark框架时充分考虑到对Mesos的集成。
（三）Yarn模式
Yarn模式被称为Spark on Yarn模式，即把Spark作为一个客户端，将作业提交给Yarn服务。由于在生产环境中，很多时候都要与Hadoop使用同一个集群，因此采用Yarn来管理资源调度，可以提高资源利用率。
三、搭建Spark单机版环境
（一）前提是安装配置好了JDK
查看JDK版本

（二）下载、安装与配置Spark

1、下载Spark安装包

官网下载页面：Downloads | Apache Spark

在这里插入图片描述

下载链接：Apache Downloads 在这里插入图片描述

2、将Spark安装包上传到虚拟机

将Spark安装包上传到ied虚拟机/opt目录

2、将Spark安装包上传到虚拟机

将Spark安装包上传到ied虚拟机/opt目录

3、将Spark安装包解压到指定目录

执行命令：tar -zxvf spark-3.3.2-bin-hadoop3.tgz -C /usr/local
查看解压之后的spark目录
4、配置Spark环境变量
执行vim /etc/profile

存盘退出，执行命令：source /etc/profile，让环境配置生效

在这里插入图片描述

（三）使用Spark单机版环境

1、使用SparkPi来计算Pi的值

执行命令：run-example SparkPi 2 （其中参数2是指两个并行度）

查看计算结果：Pi is roughly 3.1412357061785308

在这里插入图片描述

执行spark-shell命令，相当于执行spark-shell --master local[*]命令，启动Scala版的Spark-Shell

在这里插入图片描述

博客等级

码龄3年

24
原创

3
点赞

4
收藏

1
粉丝

关注

私信

热门文章

最新评论

大数据讲课笔记1.2 Linux用户操作
优快云-Ada助手: 如果一个服务部署在一组容器上运行，出现问题时，运维会做哪些快速诊断？
安装配置CentOS
优快云-Ada助手: 哇, 你的文章质量真不错，值得学习！不过这么高质量的文章, 还值得进一步提升, 以下的改进点你可以参考下: (1)使用更多的站内链接；(2)使用标准目录。
Hadoop部署模式
优快云-Ada助手: 时序数据在哪些场景下需要处理，对于一个互联网应用来说，它的典型数据是时序数据么？
Hadoop安装准备
wsltedie: 数据的多少取决于你自己的定义
Hadoop安装准备
优快云-Ada助手: 多大的数据才算大数据？

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。