Apache Hive

Apache Hive

Apache Hive:以 SQL 分析海量数据Apache Hive enables analytics at a massive scale through a distributed, fault-tolerant data warehouse system. It supports reading, writing, and managing petabytes of data in distributed storage with familiar SQL syntax, and serves as a foundation for modern data lake architectures.

Apache Hive 页面快照
18+
年开发与优化
1000+
企业部署
PB级
每日处理的数据规模
4.2.0
页面公布的最新版本
核心能力

面向现代数据分析与数据湖的能力

Apache Hive 提供 SQL 分析、集中式元数据管理、并发访问、事务处理、存储优化、开放表格式支持及企业级安全能力。

SQL 大规模分析

使用熟悉的 SQL 语法,在 S3、ADLS、Google Cloud Storage 等分布式存储上读取、写入和管理海量数据。

Hive Metastore 元数据管理

Hive Metastore Server 为表和分区提供集中式元数据仓库,并通过服务 API 向 Hive、Impala 和 Spark 等客户端提供访问。

HiveServer2 多客户端接入

HiveServer2 支持多客户端并发与身份认证,并兼容 JDBC、ODBC 等开放接口,便于连接商业智能工具和应用。

事务与数据一致性

为 ORC 表提供完整 ACID 支持,并为其他格式提供仅插入事务能力,以保障并发环境中的数据一致性。

Iceberg 与数据压缩

原生支持 Apache Iceberg 表,并提供基于查询和 MapReduce 的数据压缩能力,帮助优化存储效率与查询性能。

安全与可观测性

支持 Kerberos 身份认证,并可与 Apache Ranger 和 Apache Atlas 集成,实现授权、数据血缘与治理。

最新动态

Apache Hive 4.2.0 已发布

官方页面公布了 Apache Hive 4.2.0,带来 JDK 21 支持、增强的 Apache Iceberg v3 能力、内置自动压缩、REST Catalog 客户端支持及性能改进。

Apache Hive 4.2.0 发布

该版本新增 JDK 21 支持,增强 Apache Iceberg v3 集成,包含删除向量、列默认值、Z-ordering、Variant 类型、内置自动压缩、REST Catalog 客户端支持及 HMS REST Catalog,并改进性能。

官方资源

文档、快速入门与开发资料

通过官方文档、语言手册、Docker 快速入门、源代码和社区资源了解 Apache Hive 的使用与开发。

Apache Hive

从这里开始使用Apache Hive。