标签

云原生

AI 让 Kubernetes 再次令人畏惧:复杂的不是容器,而是工作负载

来源: cncf.io 49
Kubernetes 已经不是新技术。它的核心对象、调度机制和运维模式相当成熟,也逐渐成为生产软件与 AI 工作负载的重要基础设施。但对许多团队来说,引入 Kubernetes 仍像一次高风险迁移;当 GPU、模型文件、推理延迟和成本控制叠加进来,这种压力会进一步放大。 真正需要回答的问题不是“AI 项目要不要上 Kubernetes”,而是“哪些运行...

Kubernetes 1.37 DRA:用原生资源请求平滑接管 GPU、网卡与拓扑设备

来源: kubernetes.io 42
Kubernetes 1.37 中,动态资源分配(Dynamic Resource Allocation,DRA)已经不再只是 ResourceClaim 的新接口。DRA Extended Resource 支持进入 GA 后,现有工作负载仍可通过 这类传统扩展资源申请设备,而集群底层可以改由 DRA 驱动完成发现、筛选和分配。这给生产集群提供了一条...

YOLO 模式不是免确认按钮:如何给自主 AI Agent 划定安全边界

来源: docker.com 45
YOLO mode 让 AI Agent 在执行命令、修改文件或调用外部服务时不再逐次请求许可。它能明显减少交互中断,但也会把“错误建议”升级成“已经发生的操作”。真正的问题不是 Agent 能否自主运行,而是它获得了哪些权限、影响范围有多大,以及失败后能否恢复。 普通 Agent 工作流通常把高风险动作停在审批点,例如执行 shell 命令、删除文件...

PostgreSQL 19 上线前准备:用 Beta 3 提前排查兼容性问题

来源: postgr.es 37
PostgreSQL 19 Beta 3 已于 2026 年 8 月 13 日发布,发行说明也在持续完善。正式版日期尚未公布,但按照 PostgreSQL 项目通常在 9 月或 10 月发布的节奏,现在已经进入升级准备窗口。 这时最有价值的工作不是背诵新功能列表,而是把真实数据库、扩展和应用查询放到 PG 19 上跑一遍。发行说明仍可能变化,Beta ...

零停机迁移:把关键 Kubernetes 工作负载移出 default 命名空间

来源: cncf.io 43
很多集群里都存在这样的历史遗留:一个关键 Deployment 长期运行在 命名空间。直接修改 YAML 中的 并不能完成迁移,因为命名空间属于 Kubernetes 对象身份的一部分;所谓“迁移”,本质上是在目标命名空间重建资源、切换流量,再删除旧资源。 要做到业务无中断,核心不是某条神奇的 命令,而是让新旧两套实例并行运行,并把部署、依赖和流量切换...

用 Go、Redis 与 PostgreSQL 搭建隐私优先的自托管短链接服务

来源: oschina.net 46
短链接服务看似只是一次重定向,真正上线后却会同时面对链接查询、身份认证、访问记录、缓存一致性和数据隐私等问题。shrl.io 的架构把这些职责拆成四个 Go 微服务,并用 PostgreSQL、Redis、分析 worker 与 SvelteKit 前端组合成一套可以通过容器启动的自托管系统。 这类设计的价值不只是“自己部署一个短网址”,而是让链接数据...

Google Cloud 的智能体时代底座:从 AI 全栈协同到动态基础设施与数字主权

来源: cloud.google.com 23
Google 表示,Gartner 已连续第九年将其列入战略云平台服务魔力象限的领导者,并在“愿景完整性”维度上处于最远位置。比排名更值得工程团队关注的,是 Google Cloud 对下一阶段云基础设施的判断:企业需要把模型、智能体、应用、数据和算力放进同一个可调度、可治理的平台,同时控制性能、成本与合规边界。 这套思路可以归纳为三个设计原则:软硬件...

从基础镜像到运行时:构建更难被攻破的 Java 容器

来源: spring.io 33
容器安全不只是上线前执行一次漏洞扫描。BellSoft 的 Catherine Edelveis 围绕加固运行时镜像与容器安全展开的讨论,指向了一个更实际的问题:进入生产环境的 Java 容器究竟包含什么、以什么权限运行,以及出现新漏洞后能否快速重建和替换。 真正有效的加固通常不是增加更多安全工具,而是减少镜像中的组件、收紧进程权限,并让构建结果可以重...

Kubernetes v1.37:让 HPA 真正把工作负载缩容到零

来源: kubernetes.io 29
Kubernetes v1.37 将 HPA 缩容到零副本推进到 Beta,并默认启用。对于队列消费者、批处理器这类并非持续接收 HTTP 请求的工作负载,空闲时可以不保留任何 Pod,有任务到来时再自动拉起。 这项能力减少了空闲资源消耗,尤其适合预留专用 CPU 或 GPU 的 Pod。但它也带来明确代价:从零恢复需要重新读取指标、调度 Pod、启动...