Hadoop运行模式01-优快云博客

文章详细介绍了Hadoop的三种运行模式：本地模式、伪分布式和完全分布式，并提供了官方WordCount示例的执行步骤。在完全分布式模式下，重点讲述了集群的配置，包括服务器准备、环境变量设置、SSH无密登录的配置，以及使用rsync和自定义xsync脚本进行集群文件分发。

Hadoop 运行模式

Hadoop 运行模式包括：本地模式、伪分布式模式以及完全分布式模式。

本地模式：单机运行，只是用来演示一下官方案例。生产环境不用。
伪分布式模式：也是单机运行，但是具备 Hadoop 集群的所有功能，一台服务器模
拟一个分布式的环境。个别缺钱的公司用来测试，生产环境不用。
完全分布式模式：多台服务器组成分布式环境。生产环境使用。

3.1 本地运行模式（官方 WordCount）

1）创建在 hadoop-3.1.3 文件下面创建一个 wcinput 文件夹

[atguigu@hadoop102 hadoop-3.1.3]$ mkdir wcinput

2）在 wcinput 文件下创建一个 word.txt 文件

[atguigu@hadoop102 hadoop-3.1.3]$ cd wcinput

3）编辑 word.txt 文件

[atguigu@hadoop102 wcinput]$ vim word.txt

在文件中输入如下内容：
hadoop yarn
hadoop mapreduce
atguigu
atguigu
➢
保存退出：:wq
4）回到 Hadoop 目录/opt/module/hadoop-3.1.3
5）执行程序

[atguigu@hadoop102
hadoop-3.1.3]$
hadoop
jar
share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.3.jar
wordcount wcinput wcoutput

6）查看结果

[atguigu@hadoop102 hadoop-3.1.3]$ cat wcoutput/part-r-00000

看到如下结果：
atguigu 2
hadoop 2
mapreduce 1
yarn 1

3.2 完全分布式运行模式（开发重点）

分析：
1）准备 3 台客户机（关闭防火墙、静态 IP、主机名称）
2）安装 JDK
3）配置环境变量
4）安装 Hadoop
5）配置环境变量
6）配置集群
7）单点启动
8）配置 ssh
9）群起并测试集群

3.2.1 虚拟机准备

已学过。

3.2.2 编写集群分发脚本 xsync

1）scp（secure copy）安全拷贝
（1）scp 定义
scp 可以实现服务器与服务器之间的数据拷贝。（from server1 to server2）
（2）基本语法

scp -r $pdir/$fname $user@$host:$pdir/$fname

依次对应：
命令递归要拷贝的文件路径/名称目的地用户@主机:目的地路径/名称
（3）案例实操

前提：在 hadoop102、hadoop103、hadoop104 都已经创建好的/opt/module、
/opt/software 两个目录，并且已经把这两个目录修改为 atguigu:atguigu

[atguigu@hadoop102 ~]$ sudo chown atguigu:atguigu -R
/opt/module

（a）在 hadoop102 上，将 hadoop102 中/opt/module/jdk1.8.0_212 目录拷贝到hadoop103 上。

[atguigu@hadoop102 ~]$ scp -r /opt/module/jdk1.8.0_212
atguigu@hadoop103:/opt/module

（b）在 hadoop103 上，将 hadoop102 中/opt/module/hadoop-3.1.3 目录拷贝到hadoop103 上。

[atguigu@hadoop103~]$scp-r
atguigu@hadoop102:/opt/module/hadoop-3.1.3 /opt/module/

（c）在 hadoop103 上操作，将 hadoop102 中/opt/module 目录下所有目录拷贝到hadoop104 上。

[atguigu@hadoop103opt]$scp-r
atguigu@hadoop102:/opt/module/*
atguigu@hadoop104:/opt/module

2）rsync 远程同步工具
rsync 主要用于备份和镜像。具有速度快、避免复制相同内容和支持符号链接的优点。
rsync 和 scp 区别：用 rsync 做文件的复制要比 scp 的速度快，rsync 只对差异文件做更新。scp 是把所有文件都复制过去。

（1）基本语法
rsync -av $p d i r /$ fname $u ser @$ host: $p d i r /$ fname
命令选项参数要拷贝的文件路径/名称目的地用户@主机:目的地路径/名称
选项参数说明
-a
归档拷贝

-v
显示复制过程
（2）案例实操
（a）删除 hadoop103 中/opt/module/hadoop-3.1.3/wcinput

[atguigu@hadoop103 hadoop-3.1.3]$ rm -rf wcinput/

（b）同步 hadoop102 中的/opt/module/hadoop-3.1.3 到hadoop103

[atguigu@hadoop102module]$rsync-avhadoop-3.1.3/
atguigu@hadoop103:/opt/module/hadoop-3.1.3/

3）xsync 集群分发脚本
（1）需求：循环复制文件到所有节点的相同目录下
（2）需求分析：
（a）rsync 命令原始拷贝：

rsync -av /opt/module
atguigu@hadoop103:/opt/

（b）期望脚本：

xsync 要同步的文件名称

（c）期望脚本在任何路径都能使用（脚本放在声明了全局环境变量的路径）

[atguigu@hadoop102 ~]$ echo $PATH
/usr/local/bin:/usr/bin:/usr/local/sbin:/usr/sbin:/home/atgu
igu/.local/bin:/home/atguigu/bin:/opt/module/jdk1.8.0_212/bi
n

（3）脚本实现
（a）在/home/atguigu/bin 目录下创建 xsync 文件

[atguigu@hadoop102 opt]$ cd /home/atguigu
[atguigu@hadoop102 ~]$ mkdir bin
[atguigu@hadoop102 ~]$ cd bin
[atguigu@hadoop102 bin]$ vim xsync

在该文件中编写如下代码

#!/bin/bash
#1. 判断参数个数
if [ $# -lt 1 ]
then
echo Not Enough Arguement!
exit;
fi

#2. 遍历集群所有机器
for host in hadoop102 hadoop103 hadoop104
do
echo ==================== $host ====================
#3. 遍历所有目录，挨个发送
for file in $@
do
#4. 判断文件是否存在
if [ -e $file ]
then
#5. 获取父目录
pdir=$(cd -P $(dirname $file); pwd)
#6. 获取当前文件的名称
fname=$(basename $file)
ssh $host "mkdir -p $pdir"
rsync -av $pdir/$fname $host:$pdir
else
echo $file does not exists!
fi
done
done

（b）修改脚本 xsync 具有执行权限

[atguigu@hadoop102 bin]$ chmod +x xsync

（c）测试脚本

[atguigu@hadoop102 ~]$ xsync /home/atguigu/bin

（d）将脚本复制到/bin 中，以便全局调用

[atguigu@hadoop102 bin]$ sudo cp xsync /bin/

（e）同步环境变量配置（root 所有者）

[atguigu@hadoop102 ~]$ sudo ./bin/xsync
/etc/profile.d/my_env.sh

注意：如果用了 sudo，那么 xsync 一定要给它的路径补全。让环境变量生效

[atguigu@hadoop103 bin]$ source /etc/profile
[atguigu@hadoop104 opt]$ source /etc/profile

3.2.3 SSH 无密登录配置

1）配置 ssh
（1）基本语法
ssh 另一台电脑的 IP 地址
（2）ssh 连接时出现 Host key verification failed 的解决方法

[atguigu@hadoop102 ~]$ ssh hadoop103

➢
如果出现如下内容

Are you sure you want to continue connecting (yes/no)?

➢
输入 yes，并回车
（3）退回到 hadoop102

[atguigu@hadoop103 ~]$ exit

2）无密钥配置
（1）免密登录原理
（2）生成公钥和私钥

[atguigu@hadoop102 .ssh]$ pwd
/home/atguigu/.ssh
[atguigu@hadoop102 .ssh]$ ssh-keygen -t rsa

然后敲（三个回车），就会生成两个文件 id_rsa（私钥）、id_rsa.pub（公钥）
（3）将公钥拷贝到要免密登录的目标机器上

[atguigu@hadoop102 .ssh]$ ssh-copy-id hadoop102
[atguigu@hadoop102 .ssh]$ ssh-copy-id hadoop103
[atguigu@hadoop102 .ssh]$ ssh-copy-id hadoop104

注意：

还需要在 hadoop103 上采用 atguigu 账号配置一下无密登录到 hadoop102、hadoop103、
hadoop104 服务器上。
还需要在 hadoop104 上采用 atguigu 账号配置一下无密登录到 hadoop102、hadoop103、
hadoop104 服务器上。
还需要在 hadoop102 上采用 root 账号，配置一下无密登录到 hadoop102、hadoop103、
hadoop104；
3）.ssh 文件夹下（~/.ssh）的文件功能解释
known_hosts
记录 ssh 访问过计算机的公钥（public key）

id_rsa
生成的私钥

id_rsa.pub
生成的公钥

authorized_keys
存放授权过的无密登录服务器公钥