AWS 宣布,在《The Forrester Wave: AI Infrastructure Solutions, Q4 2025》评估中被列为领导者。在这项涵盖 13 家供应商的评估里,AWS 在 Strategy(战略)类别获得最高分。
这条消息的价值不只在于“排名靠前”。对于正在建设训练平台、推理服务或企业级 AI 工程体系的团队来说,AI 基础设施的竞争已经从单一硬件性能,扩展到产品路线、服务组合、生态协作以及长期落地能力。
这项认可说明了什么
Forrester 的评估聚焦 AI Infrastructure Solutions,覆盖的是支撑 AI 工作负载的整体能力,而不是某一个 GPU 型号或单次模型推理成绩。摘要明确提到,AWS 在 13 家供应商中被评为 Leader,并在 Strategy 类别取得最高分。
Strategy 得分高,通常更值得从长期建设角度理解:企业会关注供应商是否有清晰的 AI 基础设施方向,能否持续投入相关产品,以及服务能否适配不同规模、不同成熟度的客户。对开发团队而言,这意味着评估云平台时不能只比较每小时实例价格,还要观察以下问题:
- 训练、微调、批量推理和在线推理是否能使用一致的基础设施治理方式。
- GPU、网络、存储、编排和监控能力是否能够组合成可运营的平台。
- 团队是否能从实验环境平滑迁移到生产环境。
- 供应商的产品路线是否足以支撑未来几年的模型规模增长。
这并不等于 AWS 在所有具体场景中都一定是最优选择。Forrester 的行业评估不能替代团队自己的成本、延迟、数据驻留和模型兼容性测试。
从“买算力”转向建设 AI 平台
AI 项目早期常见的做法是申请几台 GPU 实例,安装依赖,然后把训练脚本跑起来。这种方式能快速验证想法,却很快会遇到资源排队、环境不一致、成本不可见和模型版本难以追踪等问题。
更成熟的建设路径,是把 AI 基础设施拆成几个可治理的层次:
- 计算层:根据训练、推理和批处理任务选择 CPU、GPU 或其他加速资源。
- 数据层:管理训练数据、特征、模型制品和访问权限。
- 编排层:处理任务提交、队列、扩缩容、失败重试和作业优先级。
- 工程层:提供镜像、依赖、实验记录、模型注册和发布流程。
- 运营层:跟踪利用率、成本、延迟、吞吐量和安全审计信息。
AWS 获得 Strategy 类别最高分这一信息,可以作为企业评估长期平台能力时的一个信号。但真正的技术决策仍应落到可验证的工程指标上:一个训练作业启动需要多久,一次推理请求的 P95 延迟是多少,GPU 利用率是否足够高,以及每个模型版本的成本是否可追踪。
可以这样做:先盘点 AI 资源,再建立成本和治理标签
下面的命令示例假设团队已经为 AI 相关资源统一添加了 Workload=ai 和 Environment 标签。它使用 AWS Resource Groups Tagging API 查询资源,适合作为平台建设的起点。运行前请确认 AWS CLI 已配置凭证,并根据实际区域修改 AWS_REGION。
#!/usr/bin/env bash
set -euo pipefail
AWS_REGION="us-east-1"
aws resourcegroupstaggingapi get-resources \
--region "$AWS_REGION" \
--tag-filters Key=Workload,Values=ai \
--resources-per-page 100 \
--query 'ResourceTagMappingList[].{Resource:ResourceARN,Tags:Tags}' \
--output table
这段命令不会自动完成完整的平台治理,但可以帮助团队回答几个基础问题:哪些资源属于 AI 工作负载,资源分布在哪些区域,以及标签是否足以支撑后续的成本归集和责任划分。
在此基础上,可以为训练和推理任务约定更细的标签,例如:
# 示例约定,字段名称可按团队的 IaC 或调度系统调整
ai_workload:
tags:
Workload: ai
Environment: staging
Owner: ml-platform
CostCenter: research
ModelFamily: example-model
controls:
require_region_allowlist: true
require_budget_alert: true
record_model_version: true
这里的 YAML 是治理约定示例,不代表 AWS 某个服务的固定配置格式。落地时可以把这些字段映射到 Terraform、CloudFormation、Kubernetes 工作负载或内部作业平台中。关键是让资源、模型版本、业务团队和成本中心能够关联起来。
采用建议:把行业排名当作输入,而不是结论
AWS 在此次评估中获得 Leader 认可,并在 Strategy 类别取得最高分,对计划扩大 AI 基础设施投入的企业具有参考价值。尤其是已经使用 AWS,或希望通过统一云平台承载多种 AI 工作负载的团队,可以把它纳入供应商和架构评估清单。
正式采用前,建议完成一轮小规模验证:
- 选择真实的训练或推理工作负载,而不是只测试空载实例。
- 对比端到端成本,包括存储、网络、日志、空闲资源和数据传输。
- 测量启动时间、吞吐量、P95 延迟和失败恢复时间。
- 验证数据权限、区域限制、审计和模型制品管理流程。
- 明确退出机制,避免模型、数据和作业编排被单一服务深度绑定。
行业评估可以帮助团队缩小选择范围,但 AI 基础设施最终要靠可重复的实验和持续运营来证明价值。对 AWS 的这项认可,最适合被理解为一个战略能力信号:它提示企业关注平台未来能否承载不断增长的 AI 工作负载,而不只是今天能否启动一台 GPU 实例。