标签

Cloudflare

ClickHouse 分区变更后计费任务卡死:一次隐藏锁竞争的排查与修复

来源: blog.cloudflare.com 40
Petabyte 级 ClickHouse 集群上做了一次看似合理的分区调整,结果核心计费任务集体卡死。监控面板一片绿,错误日志寥寥无几——问题不在数据量,不在磁盘 IO,而是藏在查询规划器里的一把锁。 故事的开头很典型:团队为了优化查询性能,调整了一张大表的分区键。变更上线后,写入和日常查询看起来一切正常,但每天凌晨跑的计费聚合任务突然从 30 分钟...

Browser Run 迁移到 Cloudflare Containers:更快、更稳、更弹性

来源: blog.cloudflare.com 49
在云端跑浏览器从来不是一件轻松的事。无头浏览器吃内存、占 CPU、冷启动慢,规模一大就容易成为整个系统的瓶颈。Browser Run 这次把底层从原来的运行环境整体迁移到 Cloudflare Containers,不只是换了宿主机——调度模型、资源上限、发布节奏都跟着变了。 Browser Run 的核心场景是:在服务器端启动一个真实浏览器实例,执行...

当"空闲"并不空闲:一个 Linux 内核优化如何变成 QUIC 性能陷阱

来源: blog.cloudflare.com 31
你用 QUIC 搭了一个高吞吐服务,压测时吞吐量看起来正常,但一旦进入稳态长连接——比如持续推送视频帧或批量数据——吞吐量突然跌到地板。抓包看没有丢包,RTT 也稳定,但 CUBIC 的拥塞窗口(cwnd)死死卡在最小值,怎么也涨不起来。 这不是网络问题,也不是你的应用逻辑有 bug。问题出在内核对"空闲"的判定逻辑上:它把 RTT 等待时间误判成了应...