向量湖仓(Vector Lakebase):重新思考面向 AI 原生应用的数据基础设施

刘力
  • 📅周六, 8月 8
  • 🕐16:15GMT+8
  • 📍静明厅
  • 🎤中文演讲
  • #Data + AI

描述 随着 AI 应用从原型走向生产,传统数据基础设施的局限性开始显现。为分析或事务设计的系统,难以支撑现代 AI 工作负载——尤其是大规模的向量检索、混合过滤与多模态数据。

在本次演讲中,我们将介绍 Milvus 以及"向量湖仓"(Vector Lakebase)的概念——这是一个 AI 原生的数据平台,将向量检索与湖仓存储统一起来。Vector Lakebase 不再是构建又一个独立的向量数据库,而是把索引与检索能力直接带到 Iceberg、Paimon 等数据湖之上。

我们将深入 Milvus 背后的架构与关键设计决策,包括:

如何在不复制数据的前提下,直接在 Iceberg/Paimon 表上实现高效向量检索 零拷贝数据访问:分离计算与存储,同时避免代价高昂的数据搬运 快照对齐的索引:让向量索引与湖仓元数据保持一致 应对多租户、过滤、冷启动性能等生产级挑战

我们还会分享该架构最能发挥价值的一些真实场景:

需要一致、高召回率检索的 Agentic 检索系统 跨越大型异构数据集的数据发现 大规模场景下的数据去重与基于相似度的数据管理

最后,我们将讨论 AI 原生数据基础设施的演进方向——以及为何"将向量检索融入数据湖"而非构建孤立系统,正在成为主导范式。

讲师:


刘力:工程总监

刘力现任 Zilliz 工程总监兼 Milvus 技术负责人。他在数据库和大数据处理领域拥有多年经验,目前负责 Zilliz 核心数据库系统的开发与维护。此前,他曾任 Meta 高级工程师,设计并构建了该公司面向广告业务的流式数据框架。刘力拥有卡内基梅隆大学信息技术硕士学位。