sqoop|（转）使用Sqoop，最终导入到hive中的数据和原数据库中数据不一致解决办法 sqoop|Sqoop

【转载原文：https://www.cnblogs.com/zdfjf/p/5277597.html】
Sqoop是一款开源的工具，主要用于在Hadoop(Hive)与传统的数据库(mysql、postgresql...)间进行数据的传递，可以将一个关系型数据库（例如： MySQL ,Oracle ,Postgres等）中的数据导进到Hadoop的HDFS中，也可以将HDFS的数据导进到关系型数据库中。
1.问题背景使用Sqoop把oracle数据库中的一张表，这里假定为student，当中的数据导入到hdfs中，然后再创建hive的external表，location到刚才保存到hdfs中数据的位置。最后发现对hive中表特定条件进行count时结果和oracle中结果不一致。
1.1 导入数据到hdfs中/user/hadoop/student路径下sqoop import --connect "jdbc:oracle:thin:@//localhost:1521/student" --password "***" --username "***" --query "select * from student where name='zhangsan' and class_id='003' and \$CONDITIONS" --target-dir "/user/hadoop/student" --verbose -m 1
这个时候hdfs上/user/hadoop/student下就保存了从oracle上导入的表数据。
表数据在hdfs上是如何存储的呢？注意这一点，造成了最后产生结果不一致的错误。
我们来看一看在hdfs上数据是如何存储的。我们运行hadoop fs -cat /user/hadoop/student/part-m-00000,可以看到原来字段与字段之间都用‘，’分隔开，这是sqoop默认的，这时候，如果一个字段值当中包含‘，’，再向hive中插入数据时分隔就会出错。因为hive也是用‘，’分隔的。

2.分析问题对hive中表select count(*) from student的结果和oracle中select count(*) from studeng的结果进行比较，发现条数是一样的，说明没有少load数据。那为什么对特定条件结果就会不一致，而且hive中条数比oracle中少。也就是同时运行select count(*) from student where class_id='003'
最后，发现hive用逗号分隔数据时，有几条数据字段内值包含有逗号，所以字段与值对应起来就乱套了，所以得不到正确结果。
我们建议用‘\001'来进行sqoop 导入数据时的分割。也就是--fields-terminated-by 参数。参考：http://sqoop.apache.org/docs/1.4.2/SqoopUserGuide.html#_large_objects
最后优化后的sqoop语句为：
sqoop import --connect "jdbc:oracle:thin:@//localhost:1521/student" --password "***" --username "***" --query "select * from student where name='zhangsan' and class_id='003' and \$CONDITIONS" --target-dir "/user/hadoop/student" --fields-terminated-by "\001" --verbose -m 1
【sqoop|（转）使用Sqoop，最终导入到hive中的数据和原数据库中数据不一致解决办法】
一张网页，要经历怎样的过程，才能抵达用户面前？一位新人，要经历怎样的历练，才能站在技术之巅？

sqoop|（转）使用Sqoop，最终导入到hive中的数据和原数据库中数据不一致解决办法

推荐阅读

什么是职场？

百日练，一百天读一百本书，打卡第9天，《你只是看上去很努力》35分钟，理解50%，2000/分钟

空调主机跟遥控器显示温度不同步是怎么回事新科柜机空调不制冷调节温度显示不同步

等闲识得东风面中的东风是什么意思等闲识得东风面释义

redis 集合的底层实现 redis集合存bean

Java中关于Collections集合工具类的详细介绍

福州贵安水世界好玩吗 2023福州贵安水世界门票多少钱一张

蜗居背景音乐歌词蜗居背景音乐歌词翻译

甘肃所有大学名单甘肃省大学排名

雷殿生名字打分99分雷王姓取名

python|python 的生产者和消费者模式

quiet怎么读 quiet怎么造句

龙眼肉罐头做法新鲜的龙眼肉怎么做罐头

海藻面膜敷多长时间好

mysql my.cnf配置模板参考

苹果扣费怎么退 iPhone扣费怎么退款

你认为孤独的根源是什么？

减肥期间,有哪些做起来简单又好吃的减肥食谱？

创维55寸4k智能电视多少钱一台哪个电视牌子好

二甲双胍|糖尿病天天吃二甲双胍，请花5分钟弄清这6个注意事项，很重要