两集群拷贝 hdfs数据

最新推荐文章于 2024-12-23 14:29:46 发布

原创最新推荐文章于 2024-12-23 14:29:46 发布 · 281 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#hdfs

hadoop 专栏收录该内容

5 篇文章

订阅专栏

本文介绍了如何将A集群的HDFS数据高效地拷贝到B集群，同时补充了一些在操作过程中常用的参数。

将 a集群的数据拷贝到b集群

hadoop distcp hdfs://10.30.7.8:8020/master/basis_report_data/ hdfs://10.30.7.2/hive_log/

一些常用参数补充

标识及描述	备注
-p[rbugp]	修改次数不会被保留。并且当指定 -update 时，更新的状态不会被同步，除非文件大小不同（比如文件被重新创建）。
-i 忽略失败	就像在附录中提到的，这个选项会比默认情况提供关于拷贝的更精确的统计，同时它还将保留失败拷贝操作的日志，这些日志信息可以用于调试。最后，如果一个map失败了，但并没完成所有分块任务的尝试，这不会导致整个作业的失败。

-log 记录日志到	DistCp为每个文件的每次尝试拷贝操作都记录日志，并把日志作为map的输出。如果一个map失败了，当重新执行时这个日志不会被保留。

-m <num_maps> 同时拷贝的最大数目	指定了拷贝数据时map的数目。请注意并不是map数越多吞吐量越大。

-overwrite 覆盖目标	如果一个map失败并且没有使用-i选项，不仅仅那些拷贝失败的文件，这个分块任务中的所有文件都会被重新拷贝。就像下面提到的，它会改变生成目标路径的语义，所以用户要小心使用这个选项。

-update 如果源和目标的大小不一样则进行覆盖	像之前提到的，这不是"同步"操作。执行覆盖的唯一标准是源文件和目标文件大小是否相同；如果不同，则源文件替换目标文件。像下面提到的，它也改变生成目标路径的语义，用户使用要小心。

-f <urilist_uri> 使用<urilist_uri> 作为源文件列表	这等价于把所有文件名列在命令行中。 urilist_uri 列表应该是完整合法的URI。