小米 HDFS 云迁移实践:打造面向 Data + AI 的统一存储
朝晖 王
中文演讲 2026-08-08 15:00 GMT+8 (ROOM : 静明厅) #dataai随着小米业务需求的快速发展,尤其是生成式 AI、自动驾驶等场景的持续推进,底层技术栈不断向大数据和云原生方向演进。这种演进对存储系统提出了多重诉求:大容量、高性能、低成本,以及多协议访问。与此同时,业务数据常常需要在对象存储、高性能文件存储、HDFS 和本地磁盘等多个系统之间流转,由此带来流水线复杂、迁移与运维成本高企、资源利用不均等问题。为应对这些挑战,我们逐步在生产环境中落地了一套统一文件存储方案,以支撑各类场景下的数据访问、管理与分发。该实践目前覆盖 40 个集群,支撑千亿级文件的管理与数百 PB 级的存储规模。 本次演讲将围绕这一方案展开,详细讲解以下关键方面: 统一架构设计:客户端、控制面与数据面之间的整体分工,以及由容量层、缓存层和性能层构成的分层设计;客户端支持 POSIX、HDFS、S3、CSI Driver 和 Python SDK 等多种访问方式。 面向 AI 全流水线的存储实践:如何满足原始数据、训练数据和模型文件分发等不同阶段的需求,并通过缓存机制优化"读多写少"的场景。 Apache 大数据生态的云迁移实践:如何基于 Apache Hadoop/HDFS 兼容性实现云迁移所需的存算分离,支持 Apache Hive 表向 Apache Iceberg 转换,并借助 Apache Paimon 等技术实现数据湖仓场景。 热数据缓存与云原生实践:如何通过热点表的自动缓存提升计算效率,通过 CSI 挂载为云迁移业务实现存算分离,并通过共享数据与缓存分发降低磁盘冗余、加速模型加载。 通过这些实践,我们希望分享在 Data + AI 环境下落地统一存储的洞察,以及如何在迁移复杂度、系统可扩展性、访问性能与总体成本之间取得平衡。
讲师:

朝晖 王:小米软件研发工程师
HDFS/Ozone/JuiceFS 贡献者