跨越 Apache 数据栈,打造 AI 驱动的 Spark 诊断助手

Tianhang Li

中文演讲 2026-08-07 16:45 GMT+8  (ROOM : 静明厅) #dataai

现代 Spark 平台会产生海量的运行信号,但诊断性能瓶颈、资源浪费和反复出现的生产问题,仍然高度依赖专家经验。在本次演讲中,我们将分享如何构建一个 AI 驱动的诊断助手,它打通了 Gravitino、Spark History Server、YARN ResourceManager、Celeborn 和 Ranger 等多个 Apache 大数据组件,为 Spark 工作负载提供智能分析与可落地的建议。

该助手帮助工程师排查失败或缓慢的 Spark 作业、识别优化机会,并在性能、资源使用、存储效率和运维稳定性等维度给出治理洞察。通过整合元数据、运行时指标、调度信号、Shuffle 行为与访问控制上下文,系统能够针对 SQL 调优、资源规格配置、倾斜治理、Shuffle 优化、数据治理以及日常值班排障生成切实可行的建议。

我们将介绍整体架构、数据采集与推理流水线、真实诊断场景,以及对计算成本、存储成本和工程效率的可量化影响。本次演讲面向数据平台工程师、Spark 实践者,以及关注如何将 AI 应用于 Apache 生态中可观测性、运维与优化的开源用户。

讲师:


Tianhang Li:“哔哩哔哩大数据开发工程师 | Apache Gravitino 贡献者 | 元数据管理与 Spark 优化专家”

Li Tianhang 是哔哩哔哩(Bilibili)的大数据开发工程师,专注于大规模数据场景下的元数据管理与 Spark 计算引擎优化。