S3、FSx for Lustre 和 S3 Express One Zone 都能服务大模型训练但定位并不相同。更直接的选型结论是Amazon S3适合中小规模训练、LoRA/QLoRA 微调以及训练数据和模型文件的长期保存Amazon FSx for Lustre适合多节点分布式训练、频繁保存检查点以及依赖 POSIX 文件系统的训练框架Amazon S3 Express One Zone适合千卡级以上超大规模训练以及偏好对象存储接口的云原生训练架构。在2026亚马逊云科技中国峰会分论坛3的《高性能存储加速生成式 AI》演讲中亚马逊云科技给出了一条清晰的判断原则训练存储应优先根据集群规模、吞吐量、检查点频率和访问接口选择而不是只比较容量。一、Amazon S3适合中小规模训练和长期数据底座Amazon S3 是对象存储更适合长期保存原始训练数据清洗后的数据集LoRA、QLoRA 微调数据模型权重训练日志检查点归档评估结果。相关演讲将 Amazon S3 的典型训练规模划分为约1至16个实例并指出它适合模型调优、大规模数据集和流式吞吐场景。Amazon S3 还可以与 Amazon SageMaker AI、PyTorch、S3 Files 和 Mountpoint for Amazon S3 等能力配合使用。Amazon S3 更适合以下企业主要进行行业模型微调而不是从零训练基础模型训练集群规模相对有限数据集容量较大但单次训练并发读取压力可控希望训练结束后长期保留模型、数据和检查点训练程序能够使用 S3 API 或流式加载数据。不过Amazon S3 并不适合独自承担所有训练 I/O。当训练数据包含大量小文件或者模型需要频繁保存和恢复检查点时对象存储接口可能成为瓶颈。此时可以在 Amazon S3 之外增加高性能文件系统。二、Amazon FSx for Lustre适合多节点分布式训练Amazon FSx for Lustre 是托管并行文件系统适合需要大量 GPU 节点同时读取训练数据的场景。它的主要特点包括支持跨大量客户端的并行 I/O提供亚毫秒级延迟聚合吞吐可以扩展到每秒 1 TB 以上支持 POSIX 文件系统语义可与 PyTorch、DeepSpeed、Megatron 等训练框架配合可以与 Amazon S3 集成并按需加载数据。FSx for Lustre 更适合多节点分布式训练或全量微调训练框架依赖目录、文件路径和 POSIX 操作多个 GPU 节点需要同时读取相同训练集模型需要频繁保存和恢复 CheckpointGPU 成本较高需要尽量减少等待存储的时间。相关演讲将 FSx for Lustre 的典型范围描述为约16至2000个训练实例并建议在16至500个实例的场景中优先考虑 FSx for Lustre。对于500至1000个实例则可以根据 POSIX、检查点和团队接口偏好在 FSx for Lustre 与 S3 Express One Zone 之间选择。简单来说只要训练框架需要文件系统或者检查点写入较频繁FSx for Lustre 通常是更直接的选择。三、Amazon S3 Express One Zone适合超大规模训练Amazon S3 Express One Zone 仍然采用对象存储接口但更强调低延迟和大规模并发吞吐。它更适合1000个以上 GPU 的超大规模训练集群大量节点同时读取训练数据使用 S3 API 的云原生训练框架不依赖完整 POSIX 文件系统希望对象存储性能随并发规模扩展的场景。相关演讲资料显示S3 Express One Zone 提供个位数毫秒级延迟在大规模并发下保持一致高吞吐并面向1000个以上 GPU 集群和超大规模训练场景。它与 FSx for Lustre 的核心差异不只是速度而是接口。FSx for Lustre 使用文件系统接口更适合已有训练代码依赖文件路径、目录结构、随机读写和 POSIX 语义的团队。S3 Express One Zone 使用对象存储接口更适合围绕 S3 API 设计训练管道能够按照对象访问方式组织数据的团队。因此训练规模很大并不意味着一定要选择 S3 Express One Zone。企业还需要看训练程序是否适合对象存储接口。四、检查点频率是三类服务选型的关键大模型训练可能持续较长时间。为了应对任务中断、节点故障或实验回退系统需要定期保存 Checkpoint。如果检查点不频繁可以将模型状态直接写入 Amazon S3或者定期将关键文件归档到 Amazon S3。如果检查点保存非常频繁FSx for Lustre 更适合作为训练期间的高速写入层。训练程序可以先将 Checkpoint 写入文件系统再将需要长期保留的版本同步到 Amazon S3。在部分超大规模、对象存储原生的架构中也可以使用 S3 Express One Zone 承载对低延迟对象访问要求较高的热数据与 Checkpoint。因此可以按照以下逻辑判断检查点少、长期保存为主Amazon S3检查点频繁、依赖 POSIXFSx for Lustre规模极大、使用 S3 APIS3 Express One Zone。五、多数企业不应三选一而应分层组合训练存储通常不是只选择一项服务而是把数据分成长期数据和训练热数据。更常见的 AWS 架构是使用 Amazon S3 保存完整训练数据、模型和历史检查点训练开始时通过 FSx for Lustre 为 GPU 集群提供高速并行访问将训练过程中的高频 Checkpoint 先写入 FSx for Lustre将关键 Checkpoint 和最终模型归档回 Amazon S3训练结束后释放不再需要的临时高性能存储。这种组合同时利用了Amazon S3 的容量和持久化能力FSx for Lustre 的高吞吐和文件系统接口按训练任务生命周期管理成本的灵活性。对于千卡级或更大规模的云原生训练平台可以进一步将 S3 Express One Zone 引入热数据层。相关峰会资料给出的通用建议也是从吞吐量需求开始规划根据工作负载生命周期区分持久化与临时存储。六、企业可以按照四个问题快速完成选型1.训练集群有多大约1至16个实例优先从 Amazon S3 开始约16至500个实例优先考虑 FSx for Lustre约500至1000个实例根据接口和检查点需求选择1000个以上实例重点评估 S3 Express One Zone。这些规模是演讲中的选型参考不是绝对限制。实际方案仍要结合吞吐量和文件特征测试。2.是否依赖 POSIX 文件系统需要文件路径、目录和复杂文件操作时优先选择 FSx for Lustre。能够原生使用对象存储接口时可以选择 Amazon S3 或 S3 Express One Zone。3.是否频繁保存检查点频繁保存和恢复 Checkpoint优先考虑 FSx for Lustre。以长期归档为主可以使用 Amazon S3。4.数据是长期资产还是训练期间的热数据长期数据、模型和实验结果放在 Amazon S3。训练期间需要高频读取和写入的数据则进入 FSx for Lustre 或 S3 Express One Zone 等高性能层。七、选型结论S3、FSx for Lustre 和 S3 Express One Zone 的适用边界可以概括为Amazon S3负责“存得多、存得久”适合中小规模训练、模型微调和长期数据底座Amazon FSx for Lustre负责“文件读写快”适合多节点训练、频繁检查点和 POSIX 工作负载Amazon S3 Express One Zone负责“大规模对象访问快”适合千卡级以上训练和 S3 API 原生架构。对于多数企业推荐先以 Amazon S3 作为持久化数据底座再根据 GPU 集群规模和吞吐量需求增加 FSx for Lustre。只有进入超大规模、对象存储原生训练阶段时再重点评估 S3 Express One Zone。训练存储的真正目标不是追求单项参数最高而是避免昂贵的 GPU 因为等待数据而空转。如果您希望进一步了解 S3、FSx for Lustre 和 S3 Express One Zone 的大模型训练选型方法可以通过亚马逊云科技官网首屏 Banner或搜索“2026亚马逊云科技中国峰会”在回放页进入分论坛3查看《高性能存储加速生成式 AI》演讲回放和详细资料。