2025 年 6 月,首届 KubeCon + CloudNativeCon Japan 在东京举行。此后,日本的云原生技能学习明显升温,相关培训与考试活动出现约 250% 的增长。这不只是 Kubernetes 社区规模扩大的信号,也反映出 AI 产业正在重新定义基础设施人才:企业需要的不再只是会调用模型 API 的开发者,还需要能够部署、扩缩容、监控并治理 AI 工作负载的工程师。
AI 落地把 Kubernetes 从平台技能变成基础能力
训练和推理系统通常同时涉及 GPU 调度、容器镜像、模型文件、数据管道、服务发现、弹性伸缩与可观测性。模型开发完成后,团队仍然需要回答一组工程问题:
- 推理服务如何发布,失败后如何恢复?
- GPU 节点怎样隔离,普通应用能否误占昂贵资源?
- 流量增长时怎样扩容,低峰期又怎样控制成本?
- 模型版本、配置和容器镜像如何一起回滚?
- 延迟、吞吐量、GPU 利用率和错误率由谁监控?
这些问题正好落在 Kubernetes 及其云原生生态的能力范围内。因此,考试和培训量上升不能只理解为“更多人想拿证”。更实际的解释是,日本企业正在扩大能够把 AI 原型转化为稳定服务的人才池。
这种变化也会影响岗位边界。机器学习工程师需要理解容器和资源声明,平台工程师需要认识 GPU、模型服务与批处理任务,SRE 则要为推理延迟、模型加载失败和容量不足建立新的服务目标。云原生与 AI 的人才体系开始汇合。
一场大会如何形成技能增长的放大器
大型技术会议的价值不只在演讲内容。它把企业需求、开源项目、培训机构、认证路径和本地社区集中到同一时间窗口,降低开发者判断学习方向的成本。
首届日本站大会提供了一个明确坐标:Kubernetes 已经不是海外团队才使用的基础设施,而是本地开发者可以参与、企业愿意投入、职业路径能够验证的技术体系。大会结束后,用户组活动、企业内部培训和认证备考更容易形成连续链条。
认证在这里承担的是技能基线,而不是能力终点。它可以检验候选人是否理解 Pod、Deployment、Service、存储、调度和故障排查,但不能自动证明其具备生产环境设计能力。企业若只统计证书数量,可能得到一个漂亮却失真的人才指标;更可靠的做法是把认证与实验环境、值班演练和真实项目结合起来。
可以这样实践:部署一个可观测的模拟推理服务
下面的示例不依赖 GPU,也不代表来源中披露的具体课程内容。它是一个可以改造的练习:使用 Kubernetes 部署模拟 AI 推理服务,配置健康检查和资源边界,再观察扩缩容行为。
运行前需要准备一个可用的 Kubernetes 集群,并安装 kubectl。本地可以使用 kind 或 minikube。
kind create cluster --name ai-lab
kubectl cluster-info --context kind-ai-lab
创建 ai-inference.yaml:
apiVersion: apps/v1
kind: Deployment
metadata:
name: ai-inference
spec:
replicas: 2
selector:
matchLabels:
app: ai-inference
template:
metadata:
labels:
app: ai-inference
spec:
containers:
- name: server
image: registry.k8s.io/echoserver:1.10
ports:
- containerPort: 8080
resources:
requests:
cpu: 100m
memory: 64Mi
limits:
cpu: 500m
memory: 128Mi
readinessProbe:
httpGet:
path: /
port: 8080
initialDelaySeconds: 3
periodSeconds: 5
livenessProbe:
httpGet:
path: /
port: 8080
initialDelaySeconds: 10
periodSeconds: 10
---
apiVersion: v1
kind: Service
metadata:
name: ai-inference
spec:
selector:
app: ai-inference
ports:
- port: 80
targetPort: 8080
部署并验证:
kubectl apply -f ai-inference.yaml
kubectl rollout status deployment/ai-inference
kubectl get pods,service
kubectl port-forward service/ai-inference 8080:80
另开一个终端发送请求:
curl http://127.0.0.1:8080/
完成基础练习后,可以把镜像替换为团队自己的模型服务,并逐步加入以下能力:
- 使用节点标签、污点和容忍度约束 GPU 工作负载;
- 用 ConfigMap 管理非敏感模型配置,用 Secret 管理凭据;
- 安装 Metrics Server 后配置 HorizontalPodAutoscaler;
- 接入 Prometheus,记录请求延迟、错误率和模型加载时间;
- 通过滚动发布或金丝雀发布控制模型版本切换风险。
例如,集群存在标记为 accelerator=nvidia 的 GPU 节点时,可以在 Pod 模板中加入以下片段。资源名称需要根据设备插件和集群配置调整:
spec:
nodeSelector:
accelerator: nvidia
containers:
- name: model-server
image: your-registry.example.com/model-server:1.0.0
resources:
limits:
nvidia.com/gpu: 1
从培训热度转化为生产能力
250% 的增长说明学习需求正在迅速释放,但人才建设不能停在考试报名量。团队可以用四项检查来判断培训是否真正产生价值:
- 学员能否从零部署服务,并解释每项资源声明的作用;
- 学员能否定位 Pending Pod、镜像拉取失败和探针异常;
- 团队是否建立 GPU 成本、容量和利用率指标;
- AI 服务是否具备回滚、限流、监控和故障演练方案。
对个人而言,认证适合用来建立系统化知识框架,但应配合一个可运行的项目和故障排查记录。对企业而言,更合理的路径是“培训、实验、生产陪跑、复盘”四步闭环。日本市场的快速增长提供了一个清晰信号:下一阶段的全球 AI 人才竞争,不只取决于谁能训练模型,也取决于谁能把模型稳定、经济且可治理地运行起来。