SQL 大规模分析
使用熟悉的 SQL 语法,在 S3、ADLS、Google Cloud Storage 等分布式存储上读取、写入和管理海量数据。
Apache Hive
Apache Hive:以 SQL 分析海量数据Apache Hive enables analytics at a massive scale through a distributed, fault-tolerant data warehouse system. It supports reading, writing, and managing petabytes of data in distributed storage with familiar SQL syntax, and serves as a foundation for modern data lake architectures.
Apache Hive 提供 SQL 分析、集中式元数据管理、并发访问、事务处理、存储优化、开放表格式支持及企业级安全能力。
使用熟悉的 SQL 语法,在 S3、ADLS、Google Cloud Storage 等分布式存储上读取、写入和管理海量数据。
Hive Metastore Server 为表和分区提供集中式元数据仓库,并通过服务 API 向 Hive、Impala 和 Spark 等客户端提供访问。
HiveServer2 支持多客户端并发与身份认证,并兼容 JDBC、ODBC 等开放接口,便于连接商业智能工具和应用。
为 ORC 表提供完整 ACID 支持,并为其他格式提供仅插入事务能力,以保障并发环境中的数据一致性。
原生支持 Apache Iceberg 表,并提供基于查询和 MapReduce 的数据压缩能力,帮助优化存储效率与查询性能。
支持 Kerberos 身份认证,并可与 Apache Ranger 和 Apache Atlas 集成,实现授权、数据血缘与治理。
官方页面公布了 Apache Hive 4.2.0,带来 JDK 21 支持、增强的 Apache Iceberg v3 能力、内置自动压缩、REST Catalog 客户端支持及性能改进。
该版本新增 JDK 21 支持,增强 Apache Iceberg v3 集成,包含删除向量、列默认值、Z-ordering、Variant 类型、内置自动压缩、REST Catalog 客户端支持及 HMS REST Catalog,并改进性能。
通过官方文档、语言手册、Docker 快速入门、源代码和社区资源了解 Apache Hive 的使用与开发。