新云 vs 传统超大规模云:人工智能时代云服务管理差异几何?
新云:人工智能时代的云服务新势力
专注于人工智能的云服务提供商能提供诱人的成本效益和稀缺的 GPU 算力,但其管理方式与亚马逊云科技(AWS)、微软 Azure 或谷歌云不同。企业正密切关注新云(neoclouds),这是一类专门围绕人工智能基础设施构建的云服务提供商,尤其侧重于 GPU、高速网络以及用于模型训练和推理的大规模计算集群。与传统超大规模云服务提供商提供适用于几乎所有企业工作负载的广泛平台不同,新云往往更专注于加速计算。CoreWeave、Lambda、Crusoe Cloud 等都与这个新兴的人工智能基础设施市场密切相关。
企业青睐新云的原因
企业对新云感兴趣不难理解。它们面临着将生成式人工智能、机器学习和高级分析项目从实验室推向实际应用的压力,与此同时,获取大量 GPU 算力变得昂贵且受限,在某些情况下,从主要超大规模云服务提供商处获取也变得困难。许多企业发现,新云能提供更好的成本效益、更快的算力获取速度,或者提供更贴合人工智能工作负载的配置。
传统超大规模云不会被取代
但这并不意味着 AWS、微软 Azure 和谷歌云会被取代。它们仍然是大多数企业云部署的默认运行环境。这些超大规模云服务提供商提供成熟的管理平台、安全工具、合规框架、全球覆盖范围、托管服务和运营生态系统,企业已经花费多年时间学习如何使用这些资源。
人工智能改变基础设施格局
然而,人工智能改变了基础设施的格局。企业不再过于关注采用哪种标准化云服务,而是更关注在需要时以合理的成本获得所需的人工智能算力。这就引出了客户经常问的一个问题:“维护这些远程人工智能云系统与在 AWS、Azure 或谷歌云上的操作有多大不同?”回答是,云运营的基本原理仍然适用,但管理模式在一些重要方面有所改变。新云并非只是更便宜的超大规模云服务提供商,它们是专门的基础设施环境,而专业化总会带来权衡。最大的管理差异体现在三个方面:安全、性能以及业务连续性/灾难恢复。
安全体系尚不完善
超大规模云服务提供商的安全体系成熟,因为其管理生态系统已经发展成熟。AWS、微软和谷歌花费多年时间构建了深度集成的身份系统、密钥管理服务、日志记录工具、策略引擎、合规计划、网络控制、漏洞管理功能和安全监控服务。尽管企业仍会时常错误配置这些服务,但这些基础组件已广为人知且被广泛理解。对于新云,安全管理可能需要企业更多地直接参与。一些提供商具备强大的安全能力和成熟的运营实践,而另一些仍在构建大型组织期望从超大规模云服务提供商处获得的企业级控制措施。这意味着管理员不能想当然地认为身份联合、特权访问控制、审计日志、加密、网络分段和合规报告等功能会与以往一样运行。这一点很重要,因为人工智能工作负载通常涉及企业最有价值的数据。训练集、微调数据、提示、嵌入、模型权重、向量数据库和推理输出可能包含知识产权、客户数据、受监管信息或机密业务逻辑。如果企业使用专有运营数据来微调模型,那么管理的风险就不仅仅是启动远程计算那么简单。共享责任模型仍然适用,但必须针对每个提供商进行审查。企业需要了解谁控制加密密钥、如何授予和撤销管理访问权限、如何将日志导出到安全运营中心、如何在租户之间隔离数据以及如何管理提供商人员的访问权限。这些不是纸上谈兵的问题,而是运营模式的问题。
需进行手动性能管理
第二个差异在于性能。传统云管理让企业习惯于抽象思考。管理员选择实例类型、存储类别、托管数据库、自动扩展策略和可观测性仪表盘。底层硬件固然重要,但通常隐藏在服务模型之后。而人工智能改变了这一点。在新云中,性能管理往往更贴近物理基础设施。GPU 类型、GPU 内存、互连设计、存储吞吐量、集群拓扑、作业调度、数据局部性和网络延迟等因素都可能直接影响人工智能工作负载的性能和成本效益。GPU 的成本效益很敏感,闲置或未充分利用的 GPU 会带来巨大的财务问题。如果数据管道无法及时为加速器提供数据、分布式训练配置错误或存储吞吐量成为瓶颈,企业可能很快就会失去最初选择新云的成本优势。因此,管理员需要了解的不仅仅是基本的云操作。他们需要了解人工智能工作负载在大规模运行时的表现,理解训练作业如何消耗存储和网络资源、推理需求如何波动、集群如何分配以及如何衡量加速器的实际利用率。这需要云运营、人工智能工程、数据工程、平台工程和财务等部门更紧密地协作。容量规划也有所不同。超大规模云服务提供商让人们期望近乎无限的弹性扩展,尽管这种期望一直有些夸张。在人工智能市场中,这种弹性更不可靠。新云可能能更好地提供 GPU 算力,但这些算力可能需要通过预订、固定集群、特定硬件承诺或合同期限来获取。管理员需要将训练计划、实验周期、推理增长和预算控制与提供商的实际容量模型相匹配。新云中的性能管理不仅仅是查看仪表盘,而是在基础设施层面管理工作负载的成本效益。
需要详细的灾难恢复计划
第三个差异是业务连续性和灾难恢复。太多企业仍然认为,只要在云端运行,就具备了弹性恢复能力。这种假设在任何云环境中都很危险,在处理专门的人工智能基础设施时更是如此。超大规模云服务提供商拥有广泛的全球覆盖范围、多个区域、可用区、复制服务、备份工具、托管故障转移选项和详细记录的弹性恢复模式。新云可能无法提供同样广泛的地理覆盖范围或原生的连续性服务。管理员必须更明确地制定恢复目标、故障转移设计、复制和恢复程序。人工智能工作负载使情况更加复杂。恢复人工智能系统与恢复传统应用服务器不同。企业需要保护数据集、训练检查点、模型工件、特征存储、向量数据库、编排管道、容器镜像、配置文件和推理端点。如果新云环境不可用,企业能否从检查点重新开始训练?推理能否转移到其他环境?同一模型能否在不同的加速器、驱动程序、框架和网络假设下运行?这些问题需要在故障发生前得到解答,而不是在故障发生时。一些人工智能工作负载可以容忍延迟。训练作业可以暂停并稍后重新启动,而不会对业务造成重大影响。其他工作负载,特别是嵌入在面向客户流程中的生产推理系统,可能需要更积极的恢复目标。
企业评估新云需抱现实期望
企业在评估新云时应抱有现实的期望。成本效益可能会打开大门,算力需求可能会使决策变得紧迫。然而,新云采用的长期成功将取决于企业如何应对这些管理差异。
