问题描述
- Hive进行数据比对问题,求帮助
-
最近项目中需要在Hadoop平台中做对账的工作,采用hive开做,容易上手,AB双方数据做数据比对的时候,准备用表连接方式来处理,这样存在问题,表连接的时候left join会存在多对多的情况,会出现A方中多条数据和B方一条数据比对成功的情况,需求如下:
1、以A方数据为主查找B方与之匹配的数据,
2、获取到多条时,取第一条,
3、且此条数据不再与A方其他数据进行比对之前处理的方式是在db2中用存储过程来实现的,用游标遍历A放数据逐条从B方查找来处理的,现在用Hive来做的话就遇到这样的难处了
解决方案
采用循环,类似于db2的存储过程代码来进行比对
解决方案二:
可以参考这个
http://blog.csdn.net/chenyi8888/article/details/7269854
时间: 2025-01-20 14:40:32