标签

云原生

SRE 的“四体问题”:自治运维为什么绕不开上下文

来源: cncf.io 33
一屋子资深 SRE 讨论自治运维时,最容易达成共识的不是“AI 能不能执行命令”,而是“我们凭什么信它现在该执行这个命令”。真正的缺口不在动作本身,而在上下文:服务拓扑、变更历史、告警质量、业务影响、值班规则,这些信息缺一块,自治系统就会从“助手”滑向“高权限猜谜机器”。 传统自动化通常处理确定问题:磁盘满了清日志,Pod 卡住了重启,证书快过期了发通...

AI 原生工作负载正在改写平台工程的边界

来源: cncf.io 44
Platform Engineering 1.0 已经证明了自己的价值:Golden Path 让部署更快,内部开发者平台降低了认知负担,自助式基础设施把开发者从工单队列里解放出来,标准流水线也让交付变得可复制。现在变化来了:AI 原生工作负载把平台从“帮应用上线”推向“帮模型、数据、推理和实验稳定运行”。 过去的平台工程主要围绕服务交付:创建仓库、申...

ingress-nginx 退场倒计时下,如何评估 F5 NGINX Ingress Controller 5.3.0

来源: my.oschina.net 26
F5 NGINX Ingress Controller 5.3.0 的发布赶上了一个很现实的时间点:Kubernetes 社区已经宣布,社区维护的 ingress-nginx 项目将在 2026 年 3 月停用。对很多集群来说,Ingress 不是边缘组件,而是生产流量进入服务的第一道门。现在需要做的不是临时换个镜像,而是重新盘点 ingress 策略...

IntelliJ IDEA 2026.1.4:一次面向 Git、Docker Compose 与 WSL Gradle 的修补更新

来源: oschina.net 30
IntelliJ IDEA 2026.1.4 已发布。这不是一个堆满新功能的大版本,而是一次更贴近日常开发摩擦点的修补更新:Git 活动分支显示、Docker Compose 中 PHP 解释器创建、以及 WSL 环境下 Gradle 同步状态,都得到修复。 这类 IDE 小版本最有价值的地方,往往不是新增一个菜单,而是让已有工作流少出错。 本次更新提...

用 pgEdge Cloud API 搭一个贴着 Postgres 跑的 RAG 服务

来源: postgr.es 39
RAG 系统最容易失控的地方,不是“大模型会不会回答”,而是数据、切块、向量、检索、服务部署这几段胶水谁来维护。pgEdge Cloud 的思路很直接:把内容放进 Postgres,让数据库侧完成切块和向量化,再把 RAG 服务挂到数据库旁边。UI 里点几下就能完成,但用 API 做一遍,更适合自动化、复现和团队交付。 这篇文章按一个真实路径拆开:本地...

数据主权正在把云原生架构从“选区域”推向“控权限”

来源: cncf.io 36
数据主权过去常被简化成一个下拉框:把工作负载部署到某个国家或地区的云区域,数据就算“留在本地”。但真正的问题并不只是服务器摆在哪里,而是谁有法律、运营或技术能力被要求交出数据。这个变化正在重塑云原生基础设施设计:架构师需要同时考虑地理位置、控制平面、加密密钥、运维权限、审计链路和跨境依赖。 传统云原生设计喜欢把“区域”当作合规边界:数据库在本国区域,备...

kpt 回到视野:用包的方式管理 Kubernetes 配置

来源: cncf.io 35
kpt 的定位很明确:它不是另一个只会 的包装器,而是一套以“包”为中心的基础设施自动化工具链。它面向 Kubernetes 平台和 KRM,也就是 Kubernetes Resource Model 驱动的配置,把配置编写、自动化处理和交付流程放进同一个工作流里。 对于已经在用 YAML、Kustomize、GitOps 或平台工程流水线的团队来说,...

PostgreSQL 16.8 Checkpointer 卡死:一次由 fsync 队列触发的生产事故

来源: postgr.es 36
一次 PostgreSQL 16.8 生产库事故,最初看起来像内存问题:日志里出现了 。直觉上,很多人会先怀疑物理内存不足,或者某处发生了内存损坏。但真正的根因更隐蔽:checkpointer 进程遇到了一个已知缺陷,被困在 fsync 请求队列的无限重试循环里。 这类问题危险的地方在于,它不会立刻把数据库打挂,而是让 checkpoint 长时间无法...

AI Agent 需要隔离:把不确定性关进沙盒

来源: docker.com 36
AI Agent 不再只是“生成一段文本”。它会读文件、调用 API、运行脚本、安装依赖,甚至修改仓库。能力越接近真实开发者,风险也越接近真实开发者:误删文件、泄露密钥、执行不可信代码、污染宿主环境。Docker Captain Karan Verma 讨论的核心问题正是这一点:AI 工作流需要隔离,而 Docker SBX 和 Sandbox Kit...

Kubernetes DRA GA:GPU 不再只是一个整数资源

来源: cncf.io 32
Kubernetes v1.35 中,Dynamic Resource Allocation(DRA)进入 GA。这个变化的意义不只是“又多了一个 API”,而是 Kubernetes 开始用更细粒度的方式描述和分配设备资源:GPU、网卡、加速卡、带拓扑约束的硬件,都可以从简单的 走向“我要哪类设备、带什么属性、如何绑定给 Pod”。 同时,NVIDI...