标签

云原生

Kubernetes 1.37 默认启用原生直方图:更准的延迟分位数,更少的时序

来源: kubernetes.io 37
Kubernetes v1.37 将原生直方图(Native Histograms)提升到 Beta,并默认启用。这个变化直接影响 API Server 延迟、调度耗时、容器运行时操作等指标:Prometheus 可以用更少的时序覆盖更宽的数值范围,同时更准确地计算 P95、P99 等分位数。 升级 Kubernetes 并不等于监控系统已经完成迁移。...

NVIDIA PAIR:把局域网里的多台电脑变成个人 AI 推理池

来源: infoq.com 40
NVIDIA Personal AI Router(PAIR)现已进入 Beta 阶段。它的目标不是让某一张 GPU 突然拥有更多显存,而是把局域网中多台电脑的推理能力组织起来,自动将 AI 请求分发到合适的节点。对于会同时触发多个模型调用的本地多智能体系统,这种调度方式尤其有价值:规划、检索、编码和审查任务不必再排队挤占同一张 GPU。 理解 PAI...

NVIDIA PAIR:把局域网里的多台电脑变成 AI 推理资源池

来源: infoq.com 32
本地 AI 的瓶颈不总是模型太大,也可能是请求太多。单个智能体运行顺畅,并不代表研究、编码、检索等多个智能体同时工作时,一张 GPU 还能稳定响应。处于 Beta 阶段的 NVIDIA Personal AI Router(PAIR)试图解决这个问题:汇集局域网内多台计算机的推理能力,并自动把 AI 请求分配给它们。 PAIR 最适合多个相互独立的模型...

PostgreSQL 逻辑复制为何吃满磁盘:从 pg_replslot 泄漏到 streaming 调优

来源: postgr.es 30
PostgreSQL 的逻辑复制通常安静得让人忘记它的存在,直到发布端的 目录突然出现成千上万个文件,磁盘告警随之响起。更棘手的是,这些文件可能在大事务提交后立即消失,只留下一个恢复正常的目录和几项累计统计。 问题往往不是复制槽失效,也不一定是订阅端落后,而是逻辑解码正在为尚未提交的大事务暂存数据。订阅越多,同一份 WAL 就会被重复解码和暂存越多次。...

从“能申请 GPU”到真正可靠:分布式 AI 训练的云原生基础

来源: cncf.io 35
当 AI 训练从单机 GPU 扩展到多个节点时,平台团队面对的问题就不再只是“有没有足够的显卡”。节点之间的网络、数据读取、任务调度、故障恢复、可观测性和资源隔离,都会直接影响训练是否能稳定完成。 因此,给集群装上 GPU 驱动只是起点。真正的 AI-ready 平台,需要把一次分布式训练当成一个完整的云原生工作负载来设计。 单节点训练失败时,排查范围...

AI 写的 PostgreSQL 索引都能用,为什么还是会拖慢写入

来源: postgr.es 32
现在的编码代理已经很会写 PostgreSQL:GIN、GiST、部分索引、表达式索引、,以及以租户 ID 开头的复合索引,通常都能写对。真正的问题不再是索引无效,而是每个索引单独看都合理,叠到同一张高频更新表上却形成了昂贵的写放大。 一组针对 30 份模型生成 schema 的实验加载并检查了 838 个索引。只有 10 个找不到明确需求,其余大多具...

你的 AI Agent 可以自己关掉数据库的“熔断开关”

来源: postgr.es 34
给 AI Agent 配一个专用 PostgreSQL 角色时,很多团队会执行两条熟悉的加固命令:限制单条语句的执行时间,并让事务默认只读。 从管理员视角看,角色配置已经被限制:查询最多运行两秒,事务默认不能写入。但这份安全感有一个关键前提:客户端不能在连接建立时覆盖这些参数。 写入的是会话启动时的默认值,不是数据库层面的强制约束。连接创建后,会话本身...

让 SageMaker HyperPod 的推理冷启动从分钟级降到秒级:模型缓存实践

来源: aws.amazon.com 32
在大模型推理集群里,真正拖慢扩容的往往不是容器启动,而是模型权重和容器镜像的下载。Amazon SageMaker HyperPod 现在支持面向推理的模型缓存:提前把模型权重与容器镜像放到集群节点的本地 NVMe 存储中,Pod 启动时直接从本地读取,而不是重新通过网络下载。 这会把原本可能需要几十分钟的冷启动,压缩到秒级范围内。对于弹性扩容、故障替...

从 AKS 到混合云:用 Azure 构建可扩展的容器管理体系

来源: azure.microsoft.com 25
Microsoft 被评为 2026 年 Gartner® 容器管理魔力象限™领导者。这个消息的重点不只是一个市场评价,更在于企业如何把容器平台用于 AI、混合云和大规模应用交付:在 Azure 上运行 Kubernetes 工作负载,在本地或其他云环境中保持一致的治理能力,并为不需要直接管理 Kubernetes 的团队提供更简单的容器运行方式。 A...

Kubernetes 1.37:让高优先级 Pod 的原地扩容主动抢占资源

来源: kubernetes.io 20
Kubernetes 1.35 已将 Pod 原地调整资源能力推进到 GA:运行中的容器可以修改 CPU 和内存请求,而不必通过重建 Pod 才能生效。但这只解决了“如何调整”,没有完全解决“节点空间不足时怎么办”。 Kubernetes 1.37 引入 Alpha 特性 。当高优先级 Pod 的原地扩容因节点容量不足而进入 状态时,调度器可以抢占同一...