大数据 Hive - overfit.cn

Hive的存储格式

Hive支持的存储数的格式主要有：TEXTFILE(默认格式) 、SEQUENCEFILE、RCFILE、ORCFILE、PARQUET。textfile为默认格式，建表时没有指定文件格式，则使用TEXTFILE，导入数据时会直接把数据文件拷贝到hdfs上不进行处理;sequencefile，rcf

overfit同步小助手 2024-11-06 08:03:45 0 收藏

Hive环境的搭建【详细教程】

Hive是一个基于Hadoop的数据仓库工具，可以将结构化的数据文件映射为类似于数据库中的表，并提供类似于SQL的查询语言（HiveQL）来进行数据查询、分析和管理。Hive的主要优点是可以处理大量的数据，并且可以通过扩展集群来提高处理能力。

overfit同步小助手 2024-11-05 06:03:40 0 收藏

Pyspark中pyspark.sql.functions常用方法（1）

是 PySpark 中用于定义用户自定义函数（UDF）的工具。UDF允许你在Spark DataFrame中使用Python函数处理数据。UDF的性能通常不如内置的Spark函数，因为它们会引入额外的Python虚拟机开销。只有当没有其他选项时才应该使用UDF。# 自定义函数df2.show()#

overfit同步小助手 2024-11-04 04:04:27 0 收藏

大数据面试题整理——Hive

Hive是一个构建在Hadoop上的数据仓库软件，它提供了类似SQL的查询语言，使得用户可以用SQL来查询存放在Hadoop上的数据。Hive是一种结构化数据的存储和查询机制，它可以将SQL语句转换为MapReduce任务在Hadoop上执行。Hive可以自定义单行函数、聚合函数、炸裂函数。定义单行

overfit同步小助手 2024-11-03 03:03:36 0 收藏

Hive3：表性能优化-分区与分桶

Hive

overfit同步小助手 2024-11-02 16:03:49 0 收藏

Hive Metastore 查分区大小批量建表语句

concat(‘)’,(case when t.PARAM_VALUE is null then ’ ’ else concat(’ comment ‘,’‘’‘,t.PARAM_VALUE,’‘’ ‘) end),concat(case when t.PARTITIONED is null the

overfit同步小助手 2024-11-02 14:03:49 0 收藏

Hive和Hbase的区别

特性HiveHBase数据模型类似 RDBMS，使用表结构NoSQL，基于列的稀疏表存储方式基于 HDFS，数据以文件存储基于 HDFS，列存储查询语言Java API，支持 SQL-like 查询适用场景批处理、大规模数据分析实时数据访问、随机读写数据更新不支持频繁更新，只适合批处理支持频繁读写和

overfit同步小助手 2024-11-01 21:03:53 0 收藏

大数据Hive安装与配置

Hive 是一个构建在 Hadoop 之上的数据仓库工具，用于数据的提取、转换和加载（ETL），并提供了一种类 SQL 的查询语言（HiveQL），使用户能够轻松查询和分析大规模数据集。

overfit同步小助手 2024-11-01 19:03:22 0 收藏

Kettle报错：使用mysql向hive中插入数据只能插入两条的错误

我们在用kettle，使用mysql向hive中插入数据的时候，创建好了一个转换，里面的操作也全部完成了之后，在执行时爆出一下错误例如我这里写入的表输入为：表输出为：看起来是一点问题也没有，但是一执行就会报上述错误，这时只需要在我们的/opt/installs/hive/conf下创建一个 .hiv

overfit同步小助手 2024-11-01 13:03:56 0 收藏

【DBeaver】连接带kerberos的hive[Apache|HDP]

配置C:\ProgramData\MIT\Kerberos5\krb5.ini文件，将KDC Server服务器上/etc/krb5.conf文件中的部分内容，拷贝到krb5.ini中，如果直接将krb5.conf文件更名为krb5.ini并替换krb5.ini，会出现文件格式问题导致MIT Ker

overfit同步小助手 2024-11-01 08:03:20 0 收藏

Hive笔记

hive、hadoop、大数据、ods、app层、数据建模类型

overfit同步小助手 2024-11-01 07:03:46 0 收藏

Python——脚本实现datax全量同步mysql到hive

在我们构建离线数仓时或者迁移数据时，通常选用sqoop和datax等工具进行操作，sqoop和datax各有优点，datax优点也很明显，基于内存，所以速度上很快，那么在进行全量同步时编写json文件是一项很繁琐的事，是否可以编写脚本来把繁琐事来简单化，接下来我将分享这样一个mysql全量同步到hi

overfit同步小助手 2024-10-30 21:03:39 0 收藏

Hive优化:Hive的执行计划、分桶、MapJoin、数据倾斜

overfit同步小助手 2024-10-30 08:04:19 0 收藏

Hive 中的 Sort By、Order By、Cluster By 和 Distribute By 的详细解析

在 Hive 中，理解SORT BYORDER BYCLUSTER BY和的不同之处对于实现高效的数据处理至关重要。每个关键字都有其特定的应用场景和性能特点。在使用时，根据数据集的大小、需要的排序方式和处理逻辑选择合适的关键字，可以显著提高查询的效率和准确性。希望这篇文章能帮助你更好地理解 Hive

overfit同步小助手 2024-10-30 08:04:10 0 收藏

Spark连接访问Hive数据

Spark访问Hive数据

overfit同步小助手 2024-10-29 17:03:20 0 收藏

windows下hadoop+hive+spark环境搭建

windows下搭建hadoop+hive+spark环境

overfit同步小助手 2024-10-28 23:03:40 0 收藏

【JavaWeb】HttpServletRequest

细品，URL打印出来的是完整的URL，包含自己的IP和端口号，但如果将这个项目部署到一个测试环境中，或者其他的服务器上，那这个IP和端口号有可能是会发生变化的，但是后面的资源路径是不变的，否则前端请求的资源可能会出现问题。由于是获得请求参数，我们可以准备一个form表单，然后由form表单向serv

overfit同步小助手 2024-10-26 15:03:43 0 收藏

hive如何删除分区

在Hive中，删除分区是一个常见的操作。你可以使用ALTER TABLE DROP PARTITION语句来删除一个或多个分区。

overfit同步小助手 2024-10-25 10:03:47 0 收藏

【大数据】一篇认识Hive

文章目录一、数据仓库1.1、数据仓库概念1.2、数据仓库核心特征1.3、数据库和数据仓库的区别1.4、数据仓库分层架构[**重要**]1.5、ETL和ELT二、Apache Hive2.1、Hive的概念2.2、Hive的架构组件(非常重要)2.3、Hive和Mysql的区别三、Hive安装3.1、

overfit同步小助手 2024-10-25 02:03:53 0 收藏

基于Hive的网络电视剧收视率分析系统大数据Hadoop

本系统基于 Java 与 Spring Boot 技术，并结合 Hive 来实现对网络电视剧收视率的深入分析。它能够广泛收集来自多个渠道的相关数据，包括各网络平台上电视剧的播放量、观看时长、观众地域分布、年龄层次、观看设备类型以及观众的互动数据（如评论、点赞、分享等）。这些数据被整合存储到 Hive

overfit同步小助手 2024-10-24 23:03:23 0 收藏