Apache Impala 中的高效元数据缓存
Csaba Ringhofer, Noémi Pap-Takács
英文演讲 2026-08-07 15:00 GMT+8 (ROOM : 百望山会议室) #olap如何在内存中缓存足够的信息,以便对超过 100 万个文件的表进行查询规划?我们的演讲将介绍 Apache Impala 的元数据缓存方案,它能够高效地应对海量的 Iceberg 和 Hive 表。
缓存表与文件元数据是实现高查询吞吐的关键,因为它让查询规划无需再去访问其他服务。对于巨型表(例如超过 100 万个文件),元数据缓存会变成内存大户,维护成本高昂。Impala 现有的细粒度缓存与失效机制对 Hive 表很有效,但并不能完全套用到 Iceberg 的架构上。本次演讲的重点,是面向 Iceberg 表的一套全新、更简洁也更高效的缓存方案。
听众可以了解到:
- SQL 引擎中的元数据缓存问题
- 经典 Hive 表与 Iceberg 表在缓存上的差异与特性
- 文件系统的影响:在 Hadoop 与对象存储中缓存的成本差异
- 在 Java 中尽量减小内存占用
- 对更新缓存的开销进行基准测试
讲师:

Csaba Ringhofer:Cloudera 软件工程师
Csaba Ringhofer 自 2017 年起在 Cloudera 从事 Apache Impala 相关工作。他是 Apache Impala PMC 的成员。他毕业于布达佩斯技术与经济大学(Budapest University of Technology and Economics)。

Noémi Pap-Takács:Apache Impala Committer
Noémi Pap-Takács 是 Cloudera 的软件工程师,也是 Apache Impala 项目的 committer。她的专长在于性能优化以及将 Apache Iceberg 集成到 Impala 中。