1、评估磁盘空间大小、调整副本数、设置heapsize大小
2、distcp -i -skipcrccheck 源端到目标端,迁移
3、元数据迁移,建表,替换location地址,或者导出db
4、表分区修复
5、配置增量T-1迁移或者T-2
6、校验历史分区脚本,表结构,大小,文件数
7、根据ditcp不对的,进行补数脚本,删分区,重拉
8、任务校验,客户跑完任务后,校验指定分区的count数和内容的md5
9、任务改造,如果md5不一样,说明此表需要做任务改造
10、任务改造,找到md5不同的那一条,对比原表和目标表的值,看哪个字段值不一样
11、二次校验任务
12、校验成功后,切任务,跑当天的数据。
注意如果删除了数据,需要删除分区,可以最后,去Hive源数据库关联每个表的分区和内容与源端比对,然后删除对应的分区,在整体Msck修复一下。