标签

架构设计

面向智能体企业的平台工程:统一管理应用、资源与 AI Agent

来源: cncf.io 45
云原生时代的平台工程,最初解决的是 Kubernetes、微服务、GitOps 和分布式架构带来的交付复杂度。随着 AI Agent 进入企业应用,平台面对的对象不再只有容器、数据库和流水线,还包括模型、提示词、工具权限、知识源与运行时策略。平台工程正在从“提供基础设施自助服务”演变为“管理应用、资源和智能体的统一控制面”。 传统内部开发者平台通常围绕...

从年度演进到云原生架构:Postgres Summit US 2026 值得关注什么

来源: postgr.es 53
Postgres Summit US 2026 将于 9 月 30 日至 10 月 2 日在纽约 Convene 举行。这项活动此前名为 PGConf NYC,EDB 将以金牌赞助商身份参会,并由 PostgreSQL 专家、核心贡献者和技术创新者带来一系列通过 Call for Papers 入选的分享。已披露的议题跨度很大,从云原生转型、战略与架构...

PostgreSQL 如何跨过 2038:真正危险的是数据库外的旧时间链路

来源: postgr.es 44
2038 年问题不是一个遥远的日期提醒,而是一场整数溢出测试。登录会话、令牌过期、证书校验、定时任务、备份保留和审计记录都依赖时间戳;只要链路中的某一层仍使用 32 位有符号整数表示 Unix 时间,它就可能在 之后把系统时间错误地解释到 1901 年附近。 PostgreSQL 本身已经越过这道边界。真正需要排查的,通常是数据库驱动、应用运行时、旧中...

高可用不等于少故障:用指标、冗余与恢复机制设计分布式系统

来源: my.oschina.net 35
分布式系统讨论“稳定性”时,经常把高可用与高可靠混在一起。两者确实共享不少指标和工程手段,但关注点并不相同:可用性强调系统有多少时间能够提供服务,可靠性更关注故障发生得是否频繁。一个系统可能每小时故障一次,却能在一秒内恢复,因此可用率看起来很高,但用户仍会持续遇到请求失败。 可用性通常可以近似表示为: 其中: 是平均无故障时间,即两次故障之间平均运行多...

Solon TeamAgent 协作协议:不改成员,切换流水线与主管制

来源: oschina.net 57
单个智能体解决的是“谁擅长做什么”,多智能体团队还必须回答三个更棘手的问题:下一步轮到谁、谁有权退回结果、满足什么条件才能停止。Solon AI 的 TeamAgent 将这些调度规则抽象为一等公民 ,使团队成员与协作方式分离。同一批 Agent 可以采用 组成线性流水线,也可以切换到 ,由主管分派、审核和决定是否继续。 把多个 Agent 依次写进一...

从 TQuel 看 PostgreSQL 时态代数:为什么保留 valid-time 会破坏优化规则

来源: postgr.es 50
随着 PostgreSQL 可能在 19 版本加入 ,时态数据支持正在从单个语法功能走向更完整的查询模型。真正棘手的问题并不是“如何保存历史”,而是:时态关系运算能否像普通关系运算一样被查询优化器安全地重排? Paul Jungwirth 阅读 Richard Snodgrass 的 TQuel 论文后,重新审视了时态关系代数中的几个关键假设,尤其是笛...

Capella iQ 的多模型架构:Couchbase 如何用 Amazon Bedrock 接入 Claude

来源: aws.amazon.com 48
Couchbase 为 Capella iQ 引入 Amazon Bedrock,并使用 Anthropic Claude 系列模型提供生成式 AI 能力。值得关注的不只是“调用了哪个模型”,而是它在生产环境中采用了多模型架构:应用不再与单一模型紧密绑定,而是在统一入口后面完成模型选择、请求治理和运行监控。 这类设计适合需要持续迭代的 AI 产品。模型...

从内容摄取到视频播放:播客可靠性事故该如何拆解

来源: engineering.atspotify.com 49
过去两个月,Spotify 的播客创作者连续遭遇可靠性问题,涉及内容摄取与播客视频。来源摘要没有披露具体故障时间线、根因或修复细节,因此不能据此判断是哪一个服务失效。不过,这类事故暴露了一个普遍难题:创作者看到的是“节目没有正常上线”,平台内部经历的却可能是接收、解析、转码、发布和播放等多个阶段的局部失败。 内容摄取系统通常不是一次请求完成全部工作。一...

把汽车座舱搬进云端:C4A-metal 与 vSkipGen 如何加速 AAOS 验证

来源: cloud.google.com 51
软件定义汽车正在改变座舱软件的交付方式。过去,团队往往要等座舱域控制器(CDC)样机到位,才能联调 Android Automotive OS、图形界面、传感器和车载网络。Panasonic Automotive 的 vSkipGen 已在 Google Cloud C4A-metal 上完成验证,目标是把这套高度依赖硬件的流程迁移到可扩展的云端数字孪...

Cloud Run 多区域高可用升级:用就绪探针实现秒级自动故障转移

来源: cloud.google.com 44
Cloud Run 的多区域部署正在从“复制几份服务”走向真正可自动恢复的高可用架构。新的就绪探针与服务健康状态能力,可以把容器实例的检查结果汇总到区域级服务健康状态,并通过 Serverless NEG 暴露给应用负载均衡器。当某个区域无法正常提供服务时,负载均衡器可以在数秒内停止向该区域发送流量。 这项变化解决了一个关键问题:部署到多个区域并不等于...