从湖仓到多模态数据湖:重新思考面向 AI 的数据基础设施

Zheng Yubin, Lili Ma

中文演讲 2026-08-07 14:00 GMT+8  (ROOM : 静明厅) #dataai

生成式 AI 与机器学习工作负载的快速兴起,正在从根本上改变数据平台的设计方式。传统数据湖与湖仓架构——围绕大规模扫描与结构化分析而构建——正日益受到向量检索、多模态数据处理以及特征工程流水线等新需求的挑战。

在本次演讲中,我们将探讨数据基础设施在 AI 时代如何演进。Apache Iceberg 等现代湖仓表格式已使模式演进(schema evolution)成为已被妥善解决的问题。但 AI 工作流带来了一个全新挑战——数据演进(Data Evolution):如何高效地回填嵌入(embedding)、重新计算特征、添加多模态编码,而无需对整张表进行重写。

我们还将讨论多模态数据管理的新兴方法,包括 Lance 等建立在 Apache Arrow 类型系统之上的新表格式——它专为 AI 工作负载设计,能在单一系统中统一管理结构化数据、嵌入、图像、音频与视频。

最后,我们将考察 Netflix 媒体数据湖(Media Data Lake)等真实架构模式,并探讨开放生态如何催生新一代 AI 原生的数据平台。

讲师:


Zheng Yubin:AWS 高级开发者布道师

Zheng Yubin 在 ICT 行业与数字化转型领域拥有超过 20 年经验。目前在 AWS 担任高级开发者布道师,专注于云原生、云安全与生成式 AI。作为 AWS 中国首位女性技术布道师,积极参与开发者社区。作为拥有 18 年经验的架构师,曾为金融、教育、制造和高科技行业提供数据中心建设、软件定义数据中心等解决方案的咨询与技术落地。依托行业专长,为开发者提供技术指导,寻求共赢。


Lili Ma:AWS 高级数据专家解决方案架构师

Lili Ma 是 Amazon Web Services 的数据专家解决方案架构师,在数据基础设施研究与产品创新方面拥有十余年经验。她在学生时代即接触 Hadoop 与 Hive,此后历经 IBM DB2、MPP 数据仓库 Greenplum、存算分离的 Apache HAWQ,以及云原生数据库 Amazon Aurora 与 ElastiCache。她是 Apache HAWQ 项目的 PMC 成员,也是 Greenplum 团队的早期成员。她曾在 SIGMOD、GCC、SKG、PDCAT 等国际会议上发表多篇学术论文,并拥有多项国际专利。她曾在 ApacheCon、DTCC、KCD 及 Greenplum 社区活动中发表演讲,主题涵盖从分布式数据库可扩展性到云原生架构等多个方向。