标签

Kubernetes

Istio 1.29.6 修复 Ambient 连接排空、ZDS 死锁与跨网络 RBAC 问题

来源: istio.io 35
Istio 1.29.6 是一个以稳健性为核心的补丁版本。它没有引入需要重新设计流量模型的新能力,而是集中修复 Ambient 模式、非 Kubernetes 工作负载、Istiod 内存管理以及跨网络授权路径中的几个关键问题。对于正在使用 waypoint、ztunnel、east-west gateway 或自动注册 WorkloadEntry 的...

从队列深度到自动扩缩容:为 Kubernetes 编写自定义指标 Exporter

来源: kubernetes.io 42
Kubernetes 原生理解 CPU 和内存,但真实业务压力往往来自另一组信号:消息队列里积压了多少任务、最近一次批处理耗时多久、每个 Pod 维持了多少 WebSocket 连接。自定义指标 Exporter 的作用,就是把这些应用状态转换成 Prometheus 能抓取的时间序列,为查询、告警以及后续的 HPA 自动扩缩容提供数据基础。 Expo...

把 Claude 跑进企业生产环境:Google Cloud 上的端点、安全与成本设计

来源: cloud.google.com 20
把大模型接入原型只需要一次 API 调用,但把它稳定地服务给全球用户,还要处理算力调度、尾延迟、区域故障、数据驻留、访问控制和成本波动。Claude 在 Google Cloud Agent Platform 上以托管模型服务提供,把这些问题纳入企业已经使用的 IAM、VPC Service Controls、Cloud Logging 和 Cloud...

AI Agent 应该独占一个 Kubernetes Pod 吗?

来源: cncf.io 39
在 kagent 的早期架构里,Agent 并没有各自占用一个 Pod、Service 和 ServiceAccount,而是直接运行在统一的 kagent runtime 中。这种设计实现快、资源开销小,但随着 Agent 的权限、资源需求和生命周期逐渐分化,一个关键问题就浮出水面:Pod 究竟是不是 Agent 合适的部署单元? 答案通常不是简单的...

把 Kubeflow 故障现场带回 Kubernetes:用 Headlamp 插件直查 CRD 与 Pod

来源: kubernetes.io 29
Kubernetes 已经承载了越来越多的 AI/ML 工作负载:Notebook、分布式训练、超参数搜索、流水线和 Spark 作业最终都会落到 Pod、存储卷、调度器与自定义资源上。Kubeflow 用 CRD 描述这些能力,但面向数据科学家的专用控制台往往隐藏了底层 Kubernetes 状态。Headlamp Kubeflow 插件补上了这层视...

用 k8s-aibom 盘点 Kubernetes 中真实运行的 AI 资产

来源: cloud.google.com 23
AI 供应链管理有一个长期盲区:构建系统知道团队计划部署什么,安全平台却未必知道集群此刻真正运行着什么。开发者直接部署的 vLLM、Triton、LangChain 或向量数据库,可能没有登记到资产台账,也可能绕过只扫描制品仓库的传统工具。 开源的 k8s-aibom 试图补上运行时这一层。它以非特权 Kubernetes 控制器运行,通过观察集群 A...

用 Stardog 与 Amazon Bedrock AgentCore 构建无 ETL 的客户 360 语义层

来源: aws.amazon.com 38
企业数据很少整齐地待在一个系统里:客户主数据和交易记录可能位于 Amazon Aurora,分析结果、行为指标又沉淀在 Amazon Redshift。传统客户 360 项目通常先复制数据、统一字段,再交给应用查询;这篇方案展示了另一条路径:让 Stardog 在两个数据源之上提供统一语义层,再由运行在 Amazon Bedrock AgentCore...

把 Unsloth 量化模型部署到 AWS:EC2、SageMaker、EKS 与 ECS 四种路径

来源: aws.amazon.com 40
模型完成量化,只解决了显存占用和推理成本的一部分问题。真正进入生产环境时,还要决定由谁管理实例、如何扩缩容、怎样接入现有容器平台,以及如何监控冷启动、显存和请求延迟。对于已经通过 Unsloth 量化的模型,可以根据团队现有基础设施,在 Amazon EC2、Amazon SageMaker AI 推理端点、Amazon EKS 和 Amazon EC...

ingress-nginx 退役倒计时:把入口控制器迁移当成一次生产变更来做

来源: cncf.io 23
Kubernetes SIG Network 的 ingress-nginx controller 将在 2026 年 3 月退役。这个变化的重点不是“项目不再时髦”,而是它会直接改变生产集群的风险模型:继续停留在退役控制器上,意味着后续 CVE 可能没有补丁,新特性也会停止进入这条路线。对负责平台和业务稳定性的团队来说,现在该把入口层迁移放进路线图,...