0


DataX将MySQL数据同步到HDFS中时,空值不处理可以吗

1. 问题描述

DataX将MySQL数据同步到HDFS中时,空值(NULL)存到HDFS中时,默认是存储为空字符串(‘’)。

2. 原因分析

HFDS Writer并未提供nullFormat参数:也就是用户并不能自定义null值写到HFDS文件中的存储格式。默认情况下,HFDS Writer会将null值存储为空字符串(‘’),而Hive默认的null值存储格式为\N。所以后期将DataX同步的文件导入Hive表就会出现问题。

3. 解决方案

处理方案有2个:

  1. 修改源码。修改DataX HDFS Writer的源码,增加自定义null值存储格式的逻辑,将空字符串存储为\N,这样hive在建表时就不用指定格式了。

以上已orc文件写入为例,同理可以应用到textfile格式的处理。

以上左边你可以对其写死,所有的NULL均转为\N ,或者像我这边传进来nullFormat使得NULL作为空还是空字符串取决于你这边设置值。

可参考记Datax3.0解决MySQL抽数到HDFSNULL变为空字符的问题_datax nullformat_谭正强的博客-CSDN博客

  1. 在Hive中建表时指定null值存储格式为空字符串(''),添加: NULL DEFINED AS ‘’

例如:

DROP TABLE IF EXISTS base_province;
CREATE EXTERNAL TABLE base_province
(
    `id`         STRING COMMENT '编号',
    `name`       STRING COMMENT '省份名称',
    `region_id`  STRING COMMENT '地区ID',
    `area_code`  STRING COMMENT '地区编码',
    `iso_code`   STRING COMMENT '旧版ISO-3166-2编码,供可视化使用',
    `iso_3166_2` STRING COMMENT '新版IOS-3166-2编码,供可视化使用'
) COMMENT '省份表'
    ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'
    NULL DEFINED AS ''
    LOCATION '/base_province/';

4. 运行结果

在这里插入图片描述

5. 参考文章

  1. http://t.csdn.cn/WmEEW
  2. hive 空值的处理
  3. DataX使用、同步MySQL数据到HDFS案例_datax mysql同步到hdfs_Redamancy_06的博客-CSDN博客
标签: mysql hdfs datax

本文转载自: https://blog.csdn.net/qq_40382400/article/details/131994378
版权归原作者 青云游子 所有, 如有侵权,请联系我们删除。

“DataX将MySQL数据同步到HDFS中时,空值不处理可以吗”的评论:

还没有评论