1. 问题描述
DataX将MySQL数据同步到HDFS中时,空值(NULL)存到HDFS中时,默认是存储为空字符串(‘’)。
2. 原因分析
HFDS Writer并未提供nullFormat参数:也就是用户并不能自定义null值写到HFDS文件中的存储格式。默认情况下,HFDS Writer会将null值存储为空字符串(‘’),而Hive默认的null值存储格式为\N。所以后期将DataX同步的文件导入Hive表就会出现问题。
3. 解决方案
处理方案有2个:
- 修改源码。修改DataX HDFS Writer的源码,增加自定义null值存储格式的逻辑,将空字符串存储为\N,这样hive在建表时就不用指定格式了。
以上已orc文件写入为例,同理可以应用到textfile格式的处理。
以上左边你可以对其写死,所有的NULL均转为\N ,或者像我这边传进来nullFormat使得NULL作为空还是空字符串取决于你这边设置值。
可参考记Datax3.0解决MySQL抽数到HDFSNULL变为空字符的问题_datax nullformat_谭正强的博客-CSDN博客
- 在Hive中建表时指定null值存储格式为空字符串(''),添加: NULL DEFINED AS ‘’
例如:
DROP TABLE IF EXISTS base_province;
CREATE EXTERNAL TABLE base_province
(
`id` STRING COMMENT '编号',
`name` STRING COMMENT '省份名称',
`region_id` STRING COMMENT '地区ID',
`area_code` STRING COMMENT '地区编码',
`iso_code` STRING COMMENT '旧版ISO-3166-2编码,供可视化使用',
`iso_3166_2` STRING COMMENT '新版IOS-3166-2编码,供可视化使用'
) COMMENT '省份表'
ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'
NULL DEFINED AS ''
LOCATION '/base_province/';
4. 运行结果
5. 参考文章
- http://t.csdn.cn/WmEEW
- hive 空值的处理
- DataX使用、同步MySQL数据到HDFS案例_datax mysql同步到hdfs_Redamancy_06的博客-CSDN博客
版权归原作者 青云游子 所有, 如有侵权,请联系我们删除。