标签

Kubernetes

Google Cloud 本月 AI 动向:从行业智能体到可控的 AI 成本

来源: cloud.google.com 34
Google Cloud 本月的 AI 更新,重点已经从“模型还能做什么”转向“企业如何把 AI 真正部署起来”。主题很明确:让智能体进入金融服务和法律等专业工作流,同时用更灵活的计费方式、预算控制和工程化指南,解决 AI 成本、治理与生产落地问题。 本月公布的 Gemini Enterprise for Financial Services,面向资本...

BREEZE COMET:从社工入侵到巴西支付系统欺诈的攻击链拆解

来源: cloud.google.com 48
BREEZE COMET(此前由 Mandiant 以 UNC5669 跟踪)针对巴西金融服务、零售、电商、金融科技和银行软件提供商发动了持续入侵。它的目标并非单纯窃取终端数据,而是夺取能够操作 Pix、STR、Boleto 等支付系统的身份、证书和网络路径,最终直接发起欺诈转账。 这类活动值得重视的地方,在于攻击者把社会工程、被攻陷的政府网站、定制化...

Kubernetes v1.37:Storage Version Migration 默认启用后,CRD 升级更稳了

来源: kubernetes.io 44
Kubernetes v1.37 中,Storage Version Migration(SVM)正式达到 GA,并在所有 v1.37 集群中默认启用。它解决了一个容易被忽略但会直接影响 API 兼容性的运维问题:API 版本已经升级,etcd 中却可能仍然保存着旧版本序列化的数据。 对于 CRD 作者、集群管理员以及负责加密密钥轮换的团队来说,SVM...

OpenTelemetry 正式毕业之后,团队下一步该做什么?

来源: cncf.io 37
OpenTelemetry(OTel)正式成为 CNCF 毕业项目,和 Kubernetes、Prometheus 等成熟开源项目站在了同一行列。这不是“所有团队明天都必须迁移”的信号,而是一个更清晰的判断依据:OTel 的标准、生态和治理已经足够成熟,值得被纳入长期可观测性规划。 真正的问题因此从“要不要关注 OTel”变成了“如何把它落到现有服务、...

Kubernetes 可观测性:别只收集指标,要还原一次请求发生了什么

来源: cncf.io 29
Kubernetes 让基础设施更容易编排、扩缩容和自愈,却也改变了故障的形态:Pod 会漂移,副本会频繁替换,服务依赖持续增长,一次用户请求可能依次穿过 Ingress、多个 Service、消息队列、存储系统和后台任务。此时,单张 CPU 曲线只能告诉你“某处变忙了”,无法解释用户为什么超时。 真正有用的可观测性,不是把更多数据塞进仪表盘,而是把指...

Istio 1.31.0 发布:从 Ambient 灰度到区域感知流量治理

来源: istio.io 30
Istio 1.31.0 已正式发布。这个版本的重点不只是新增几个 API,而是把生产环境里最容易出问题的几类操作做得更可控:Ambient 模式支持 waypoint 金丝雀流量分配,多集群稳定性得到改进,Envoy 可以进行可用区感知负载均衡,同时还补上了外部域名动态转发、FIPS 140-3 合规和更灵活的指标采集能力。 升级前需要注意两件事:I...

Istio 1.31.0:从 Gateway API 诊断到 Ambient Waypoint 灰度的关键变化

来源: istio.io 24
Istio 1.31.0 的变化集中在几个运维痛点:旧版 Gateway API CRD 不再悄悄影响流量处理,ambient 模式的 XDS 推送范围更精准,waypoint 支持按权重进行金丝雀发布,同时补齐了多集群、CNI、TLS、负载均衡和安全配置中的一批边界问题。升级时,不能只替换控制面镜像,还应同步检查 CRD、节点 nftables、远程...

别等流量打爆 GPU:Kubernetes 预测式自动扩缩容实践

来源: cncf.io 29
GPU 工作负载的扩容,往往不是把副本数从 2 调到 10 那么简单。节点启动、GPU 资源调度、镜像拉取和模型加载都需要时间。如果等队列已经堆积、GPU 利用率已经飙高,扩容动作可能已经来不及了。 一次生产事故很能说明问题:服务不是逐渐变慢,而是在流量上升后直接崩溃;大量 Pod 处于 Pending,用户错误率达到 15%~20%。这类事故的关键通...