标签

可观测性

Agoda 如何用 DragonflyDB 重构 1.5 TB 酒店价格缓存

来源: infoq.com 20
当酒店价格缓存同时承受更高的读取量和写入量时,继续横向增加关系型数据库分片并不总是最好的答案。Agoda 将约 1.5 TB 的 Price Cache 从 72 个 SQL Server 分片迁移到 DragonflyDB,并通过分阶段双读、数据一致性校验、渐进式流量切换和去中心化故障发现完成迁移。Agoda 报告称,迁移后读路径的 P99 延迟约降...

微软单月修复 974 个漏洞:面对史上最大补丁批次,企业该如何安全落地

来源: oschina.net 25
微软 9 月补丁星期二一次修复至少 974 个安全漏洞,超过此前 7 月创下的 570 个纪录。数量固然醒目,更值得运维和安全团队关注的是:其中 113 个被列为严重级别,另有两个 Windows 本地权限提升零日漏洞已经遭到积极利用。 面对这种规模的更新,正确动作不是简单地“全部立即重启”,也不是等业务空闲后再处理,而是根据漏洞利用状态、资产暴露面和...

伏羲智能决策 v0.1.1:从验证码加固看高风险接口的安全边界

来源: oschina.net 37
伏羲智能决策 v0.1.1 将重点放在验证码系统的安全加固上。此次版本修复了内存泄漏、竞态条件和时钟攻击等 3 个高危安全问题,并加入三重频率限制防护。对任何包含登录、验证码或管理操作的系统来说,这些变化都比单纯增加业务功能更值得关注:攻击者往往会优先寻找认证链路中最容易被自动化利用的接口。 从公开的版本摘要看,本次更新主要处理了三类问题。 验证码通常...

Casdoor v4:从控制台重写到 MCP Server 与 Agent 身份边界

来源: oschina.net 22
Casdoor 在 2026 年 9 月 1 日发布 v4.0,并于 9 月 9 日迭代至 v4.3。这次升级不只是界面换皮:控制台全面重写,同时加入内置 MCP Server 与 Agent 鉴权能力。对正在把大模型 Agent 接入内部系统的团队来说,这意味着身份平台开始覆盖一种新的主体,即不直接操作浏览器、却会持续调用工具和数据的 AI Agen...

在 Apple Silicon 上虚拟化完整 iOS 27:vphone-cli 的技术意义与实践边界

来源: infoq.com 40
开源项目 vphone-cli 将完整的 iOS 27 系统带到了 Apple Silicon Mac 的虚拟机环境中。它依赖 Apple 自己的 ,而不是传统意义上的指令集模拟,因此重点不只是“能启动 iOS”,还包括更接近真实设备的系统隔离、调试和自动化测试能力。 传统 iOS Simulator 通常运行经过调整的系统组件,并不等同于一台完整的 ...

用 pdb 系统排查 Python 问题:变量、单步执行与条件断点

来源: realpython.com 31
当 Python 程序出现异常时,直接添加 往往只能看到零散的中间结果。 是 Python 内置调试器,可以暂停程序、检查变量、逐行执行代码、设置条件断点,并结合调用栈定位问题。掌握这些基本操作后,调试过程会从“猜哪里错了”变成“观察程序正在做什么”。 下面的程序计算购物车总价,并根据折扣规则生成最终金额。示例故意保留一个容易观察的调试位置:折扣被应用...

从容器镜像到依赖树:SBOM、来源证明与 Attestation 的实践教训

来源: postgr.es 37
当一个 PostgreSQL 扩展项目从“能构建”走向“值得被依赖”,真正棘手的问题往往不再是 Dockerfile 能否跑通,而是:镜像里到底有什么?这些文件来自哪里?依赖是否完整?漏洞扫描器能否看见它们?未来出现新的供应链事件时,谁负责重建和发布? 围绕 CNPG-Extensions 的实践说明,SBOM、provenance 和 attesta...

Kubernetes 1.37 默认启用原生直方图:更准的延迟分位数,更少的时序

来源: kubernetes.io 36
Kubernetes v1.37 将原生直方图(Native Histograms)提升到 Beta,并默认启用。这个变化直接影响 API Server 延迟、调度耗时、容器运行时操作等指标:Prometheus 可以用更少的时序覆盖更宽的数值范围,同时更准确地计算 P95、P99 等分位数。 升级 Kubernetes 并不等于监控系统已经完成迁移。...

生产环境中的 Agent 生命周期监控:用 AgentCore Evaluations 与 AWS DevOps Agent 构建双层闭环

来源: aws.amazon.com 34
多 Agent 系统上线后,故障通常不只是“服务是否存活”。一个航空订票系统可能返回了 HTTP 200,却把乘客引导到错误的航班;某个 Agent 可能因为工具调用延迟变高而反复重试,最终拖慢整个预订流程。传统的 CPU、内存和错误率监控,很难回答这些问题。 这类系统需要两层监控:一层持续衡量 Agent 的回答质量和行为表现,另一层负责调查承载 A...