Apache Impala 中的高效元数据缓存

Csaba Ringhofer, Noémi Pap-Takács

英文演讲 2026-08-07 15:00 GMT+8  (ROOM : 百望山会议室) #olap

如何在内存中缓存足够的信息,以便对超过 100 万个文件的表进行查询规划?我们的演讲将介绍 Apache Impala 的元数据缓存方案,它能够高效地应对海量的 Iceberg 和 Hive 表。

缓存表与文件元数据是实现高查询吞吐的关键,因为它让查询规划无需再去访问其他服务。对于巨型表(例如超过 100 万个文件),元数据缓存会变成内存大户,维护成本高昂。Impala 现有的细粒度缓存与失效机制对 Hive 表很有效,但并不能完全套用到 Iceberg 的架构上。本次演讲的重点,是面向 Iceberg 表的一套全新、更简洁也更高效的缓存方案。

听众可以了解到:

  • SQL 引擎中的元数据缓存问题
  • 经典 Hive 表与 Iceberg 表在缓存上的差异与特性
  • 文件系统的影响:在 Hadoop 与对象存储中缓存的成本差异
  • 在 Java 中尽量减小内存占用
  • 对更新缓存的开销进行基准测试

讲师:


Csaba Ringhofer:Cloudera 软件工程师

Csaba Ringhofer 自 2017 年起在 Cloudera 从事 Apache Impala 相关工作。他是 Apache Impala PMC 的成员。他毕业于布达佩斯技术与经济大学(Budapest University of Technology and Economics)。


Noémi Pap-Takács:Apache Impala Committer

Noémi Pap-Takács 是 Cloudera 的软件工程师,也是 Apache Impala 项目的 committer。她的专长在于性能优化以及将 Apache Iceberg 集成到 Impala 中。