全球云计算市场正因人工智能(AI)的爆发式发展面临新一轮资源重构。作为全球市场份额最大的云服务提供商,亚马逊AWS近期要求工程师团队全面排查并关闭闲置的云服务器,以应对算力资源持续紧张的局面。这一举措直指其内部长期存在的资源利用率低下问题。
内部监测数据显示,AWS核心产品EC2实例中约65%存在显著资源闲置现象。在为期30天的跟踪观测中,这些服务器的平均CPU负载率不足20%,部分虚拟机甚至出现网络流量趋近于零的情况。这种资源浪费与当前AI产业对GPU算力的疯狂争夺形成鲜明对比——训练千亿参数大模型需要数千块GPU持续运行数周,而推理阶段对算力的瞬时需求更呈指数级增长。
为提升资源调度效率,AWS对计算优化器进行重大升级。新系统通过采集14天内的服务器运行数据,运用机器学习算法建立资源使用模型,能够精准识别出CPU峰值利用率低于15%且网络传输量异常的虚拟机实例。这些被标记的服务器将自动进入待回收列表,由工程师团队进行二次确认后实施关停。
基础设施层面的扩张仍在持续。过去12个月里,AWS新增电力容量达3.8吉瓦,相当于为280万户家庭提供全年用电。但这种物理资源的扩充速度仍难以匹配AI算力需求的增长曲线。市场研究机构Synergy Research指出,2023年全球云基础设施支出中,有超过40%流向支持AI训练的GPU集群,这个比例在2022年仅为18%。
行业观察家认为,云计算巨头正从"规模优先"转向"效率优先"的发展模式。当AI模型参数规模突破万亿门槛,单次训练成本已超过千万美元,如何优化现有算力资源的使用效率,将成为决定云服务商竞争力的关键因素。亚马逊此次的内部整顿,预示着全球云计算市场即将进入资源精细化运营的新阶段。