标签

云原生

PostgreSQL 如何跨过 2038:真正危险的是数据库外的旧时间链路

来源: postgr.es 30
2038 年问题不是一个遥远的日期提醒,而是一场整数溢出测试。登录会话、令牌过期、证书校验、定时任务、备份保留和审计记录都依赖时间戳;只要链路中的某一层仍使用 32 位有符号整数表示 Unix 时间,它就可能在 之后把系统时间错误地解释到 1901 年附近。 PostgreSQL 本身已经越过这道边界。真正需要排查的,通常是数据库驱动、应用运行时、旧中...

Cloud Run 多区域高可用升级:用就绪探针实现秒级自动故障转移

来源: cloud.google.com 34
Cloud Run 的多区域部署正在从“复制几份服务”走向真正可自动恢复的高可用架构。新的就绪探针与服务健康状态能力,可以把容器实例的检查结果汇总到区域级服务健康状态,并通过 Serverless NEG 暴露给应用负载均衡器。当某个区域无法正常提供服务时,负载均衡器可以在数秒内停止向该区域发送流量。 这项变化解决了一个关键问题:部署到多个区域并不等于...

DoorDash 如何用 Envoy 与 Valkey 构建 150 万 RPS 的透明代理缓存

来源: infoq.com 23
在微服务系统中,同一份实体数据往往会被多个服务反复读取。即使单次 RPC 很快,重复请求叠加后仍会消耗网络、连接池和下游计算资源。DoorDash 为此构建了 Entity Cache:一个运行在服务网格中的透明代理缓存平台,以 Envoy 承接服务间流量,以 Valkey 保存缓存数据,并通过事件驱动失效、故障处理和性能优化,将整体规模推进到每秒超过...

一次 13 小时生产事故之后:如何用 Docker 沙箱约束 AI 编码代理

来源: docker.com 29
AI 编码代理不再只是补全几行代码。它可以打开终端、修改文件、执行部署命令,甚至使用云端凭据。来源案例中的代理误删了生产环境,最终造成长达 13 小时的中断。真正值得关注的并不是代理为什么会犯错,而是一个更基础的工程问题:为什么开发工具拥有足以摧毁生产环境的权限? Docker 沙箱的价值正在这里。隔离执行环境、限定挂载目录,再为每次任务分配作用域明确...

评测 LLM 推理服务时,为什么有效吞吐量比吞吐量更重要

来源: cncf.io 23
评测大语言模型服务时,最常见的数字是吞吐量:系统每秒处理多少请求,或者每秒生成多少 token。这个指标容易采集,也方便横向比较,但它可能掩盖真正影响用户体验的问题。一个服务即使吞吐量很高,如果大量请求超时、首 token 等待过久,或者在高负载下频繁失败,这些工作对用户并没有实际价值。 因此,生产环境更值得关注的是 goodput(有效吞吐量):在给...

在 AWS 上理解 Eclipse Dataspace Components:从数据空间协议到控制面与数据面

来源: aws.amazon.com 38
企业之间共享数据,难点通常不在“把文件传过去”,而在于谁能发现数据、依据什么条款使用、如何建立信任,以及传输后怎样保留审计记录。Eclipse Dataspace Components(EDC)试图解决的正是这组跨组织问题:参与方保留各自的数据控制权,通过标准协议协商合同,再按约定完成数据传输。 这套系列内容分三部分,从 IDSA、Dataspace ...

从原型到治理:用 Gemini Enterprise Agent Platform 构建企业级智能体

来源: cloud.google.com 35
Gemini Enterprise Agent Platform 展示的 13 个动手演示,不只是 13 个彼此独立的样例,而是一条完整的工程路径:用 ADK 编写智能体,通过 MCP 和 A2A 接入工具与其他智能体,部署到托管运行时,再补齐持久状态、安全治理、可观测性和持续评估。 真正值得关注的变化,是智能体开发开始从“写一个能回答问题的提示词”转...

Google Cloud 近期更新解读:AI Agent 正从原型走向可治理的生产系统

来源: cloud.google.com 43
Google Cloud 近期发布的信息覆盖 Cloud Run、Apigee、MCP、TPU、GKE、Firestore 和成本管理,但主线相当清晰:企业关注点已经从“模型能否完成任务”转向“Agent 能否被隔离、观测、治理并稳定扩缩容”。这意味着 AI 应用不再只是一个调用模型的 Web 服务,而是一套包含提示词构建、工具授权、代码沙箱、流量治理...