标签

架构设计

Dataflow 批处理可暂停恢复,并用 Blackwell GPU 加速大模型推理

来源: cloud.google.com 19
长时间运行的数据流水线最怕两件事:任务接近完成时失败,只能从头重算;昂贵的 GPU 被低优先级作业占用,紧急推理任务却排队等待。Dataflow 新增的两项正式可用能力正面解决了这两个问题:批处理作业支持 Pause/Resume,并支持搭载 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 的 G4 虚...

让智能体做可审计的决定:用 DMN、Agent Skills 与 Guardrails 约束非确定性

来源: infoq.com 21
企业把大语言模型接入审批、风控、客服升级和运营流程后,真正棘手的问题通常不是“模型能不能给出答案”,而是“这次答案为什么是这样、谁能负责、下次能否稳定复现”。在高风险场景中,非确定性输出和缺少责任边界会直接削弱系统的可信度。 一种更稳妥的架构是:让 LLM 或智能体负责理解非结构化输入,让 DMN(Decision Model and Notation...

别只测 SSD 峰值:用 PostgreSQL 基准测试找到真正的系统瓶颈

来源: postgr.es 20
在 PG Summit 2026 上,Richard Yen 将分享如何使用 PostgreSQL 进行硬件与系统基准测试。这个主题的关键并不是证明某块 SSD 能达到产品页面上的峰值,而是回答一个更接近生产的问题:某个数据库工作负载能否在这套系统上稳定运行?它还能扩展多少?最先撞上的瓶颈是什么? 如果问题是“这块磁盘的顺序读写能力是多少”, 是合适的...

Rustls 十年演进:从草根项目到面向未来的 TLS 基础设施

来源: infoq.com 29
Rustls 走过了十年发展历程:它从一个由社区推动的 Rust TLS 库,逐渐成长为获得组织资金支持的开源项目。持续的维护投入让 Rustls 不再只是“用 Rust 重写 TLS”的实验,而成为许多系统可以认真评估的安全基础设施。 这段演进的价值不只体现在性能基准上。Rustls 同时关注密码学能力、API 架构、会话处理和长期维护模型。后量子密...

从容器镜像到依赖树:SBOM、来源证明与 Attestation 的实践教训

来源: postgr.es 37
当一个 PostgreSQL 扩展项目从“能构建”走向“值得被依赖”,真正棘手的问题往往不再是 Dockerfile 能否跑通,而是:镜像里到底有什么?这些文件来自哪里?依赖是否完整?漏洞扫描器能否看见它们?未来出现新的供应链事件时,谁负责重建和发布? 围绕 CNPG-Extensions 的实践说明,SBOM、provenance 和 attesta...

Kubernetes 1.37 默认启用原生直方图:更准的延迟分位数,更少的时序

来源: kubernetes.io 36
Kubernetes v1.37 将原生直方图(Native Histograms)提升到 Beta,并默认启用。这个变化直接影响 API Server 延迟、调度耗时、容器运行时操作等指标:Prometheus 可以用更少的时序覆盖更宽的数值范围,同时更准确地计算 P95、P99 等分位数。 升级 Kubernetes 并不等于监控系统已经完成迁移。...

从零样本预测到采购订单:用 Amazon Bedrock AgentCore 编排需求决策

来源: aws.amazon.com 38
需求预测真正难的地方,通常不是生成一个数字,而是把这个数字变成一张可解释、可校验、可追溯的采购订单。将 Amazon Chronos2 的零样本预测能力与 Amazon Bedrock AgentCore 的多智能体编排结合起来,可以搭建一条从历史销量到采购建议的自动化链路:不必为每个商品单独训练模型,同时把库存策略、供应商约束、审批规则和审计记录放进...

PostgreSQL 逻辑复制为何吃满磁盘:从 pg_replslot 泄漏到 streaming 调优

来源: postgr.es 25
PostgreSQL 的逻辑复制通常安静得让人忘记它的存在,直到发布端的 目录突然出现成千上万个文件,磁盘告警随之响起。更棘手的是,这些文件可能在大事务提交后立即消失,只留下一个恢复正常的目录和几项累计统计。 问题往往不是复制槽失效,也不一定是订阅端落后,而是逻辑解码正在为尚未提交的大事务暂存数据。订阅越多,同一份 WAL 就会被重复解码和暂存越多次。...