标签

架构设计

让智能体做可审计的决定:用 DMN、Agent Skills 与 Guardrails 约束非确定性

来源: infoq.com 19
企业把大语言模型接入审批、风控、客服升级和运营流程后,真正棘手的问题通常不是“模型能不能给出答案”,而是“这次答案为什么是这样、谁能负责、下次能否稳定复现”。在高风险场景中,非确定性输出和缺少责任边界会直接削弱系统的可信度。 一种更稳妥的架构是:让 LLM 或智能体负责理解非结构化输入,让 DMN(Decision Model and Notation...

Rustls 十年演进:从草根项目到面向未来的 TLS 基础设施

来源: infoq.com 28
Rustls 走过了十年发展历程:它从一个由社区推动的 Rust TLS 库,逐渐成长为获得组织资金支持的开源项目。持续的维护投入让 Rustls 不再只是“用 Rust 重写 TLS”的实验,而成为许多系统可以认真评估的安全基础设施。 这段演进的价值不只体现在性能基准上。Rustls 同时关注密码学能力、API 架构、会话处理和长期维护模型。后量子密...

从容器镜像到依赖树:SBOM、来源证明与 Attestation 的实践教训

来源: postgr.es 37
当一个 PostgreSQL 扩展项目从“能构建”走向“值得被依赖”,真正棘手的问题往往不再是 Dockerfile 能否跑通,而是:镜像里到底有什么?这些文件来自哪里?依赖是否完整?漏洞扫描器能否看见它们?未来出现新的供应链事件时,谁负责重建和发布? 围绕 CNPG-Extensions 的实践说明,SBOM、provenance 和 attesta...

Kubernetes 1.37 默认启用原生直方图:更准的延迟分位数,更少的时序

来源: kubernetes.io 36
Kubernetes v1.37 将原生直方图(Native Histograms)提升到 Beta,并默认启用。这个变化直接影响 API Server 延迟、调度耗时、容器运行时操作等指标:Prometheus 可以用更少的时序覆盖更宽的数值范围,同时更准确地计算 P95、P99 等分位数。 升级 Kubernetes 并不等于监控系统已经完成迁移。...

从零样本预测到采购订单:用 Amazon Bedrock AgentCore 编排需求决策

来源: aws.amazon.com 38
需求预测真正难的地方,通常不是生成一个数字,而是把这个数字变成一张可解释、可校验、可追溯的采购订单。将 Amazon Chronos2 的零样本预测能力与 Amazon Bedrock AgentCore 的多智能体编排结合起来,可以搭建一条从历史销量到采购建议的自动化链路:不必为每个商品单独训练模型,同时把库存策略、供应商约束、审批规则和审计记录放进...

PostgreSQL 逻辑复制为何吃满磁盘:从 pg_replslot 泄漏到 streaming 调优

来源: postgr.es 25
PostgreSQL 的逻辑复制通常安静得让人忘记它的存在,直到发布端的 目录突然出现成千上万个文件,磁盘告警随之响起。更棘手的是,这些文件可能在大事务提交后立即消失,只留下一个恢复正常的目录和几项累计统计。 问题往往不是复制槽失效,也不一定是订阅端落后,而是逻辑解码正在为尚未提交的大事务暂存数据。订阅越多,同一份 WAL 就会被重复解码和暂存越多次。...

从“能申请 GPU”到真正可靠:分布式 AI 训练的云原生基础

来源: cncf.io 33
当 AI 训练从单机 GPU 扩展到多个节点时,平台团队面对的问题就不再只是“有没有足够的显卡”。节点之间的网络、数据读取、任务调度、故障恢复、可观测性和资源隔离,都会直接影响训练是否能稳定完成。 因此,给集群装上 GPU 驱动只是起点。真正的 AI-ready 平台,需要把一次分布式训练当成一个完整的云原生工作负载来设计。 单节点训练失败时,排查范围...

从 Python 库到全球存储平台:Habitat 如何支撑 10 亿 ChatGPT 用户

来源: openai.com 38
当一个存储组件只服务少量应用时,Python API、单区域部署和简单的对象读写通常已经足够。但随着 ChatGPT 用户规模扩大到 10 亿、请求峰值达到每秒 2200 万次,存储系统面对的就不再只是“能不能保存数据”,而是全球流量、容量增长、故障隔离和开发效率的综合考验。 OpenAI 分享的 Habitat 演进路径,核心变化是:它从一个 Pyt...

Kubernetes 1.37:让高优先级 Pod 的原地扩容主动抢占资源

来源: kubernetes.io 18
Kubernetes 1.35 已将 Pod 原地调整资源能力推进到 GA:运行中的容器可以修改 CPU 和内存请求,而不必通过重建 Pod 才能生效。但这只解决了“如何调整”,没有完全解决“节点空间不足时怎么办”。 Kubernetes 1.37 引入 Alpha 特性 。当高优先级 Pod 的原地扩容因节点容量不足而进入 状态时,调度器可以抢占同一...