标签

InfoQ

OpenAI 如何用“流行病学”思路定位 GNU libunwind 的 18 年老竞态

来源: infoq.com 41
一次看似普通的崩溃排查,最后拆成了两个完全无关的问题:一台 Azure 主机上的静默硬件损坏,以及 GNU libunwind 中 函数一个存在 18 年的竞态条件。真正的转折点不是某个神奇调试器,而是 OpenAI 把视角从“盯着单个 core dump”切换到“观察崩溃人群的分布”。 这件事对基础设施团队很有参考价值:当系统规模足够大时,偶发崩溃不...

把崩溃当成流行病看:OpenAI 如何拆开 libunwind 老 Bug 和硬件静默损坏

来源: infoq.com 30
OpenAI 在 ChatGPT 数据基础设施里追一个崩溃问题时,最后发现它不是“一个诡异 Bug”,而是两个互不相关的问题叠在了一起:一台 Azure 主机上的静默硬件损坏,以及 GNU libunwind 里一个存在了 18 年的竞态条件。真正打开局面的,不是继续盯着单个 core dump,而是把崩溃当成一组群体事件来分析。 这件事对基础设施工程...

用虚拟分片做移动端节拍对齐音频播放

来源: infoq.com 34
移动端实时音频播放最难的地方,不只是“把流播出来”。当播放必须按节拍对齐,还要根据用户做个性化选择、支持页面无缝切换,并同时跑在 iOS 和 Android 上,普通的 HTTP 音频流和 JavaScript 定时器很快会露出边界。来源文章讨论的是一个 React Native 移动端系统:用虚拟分片和原生播放能力,在严格的移动网络与设备约束下实现低...

AlloyDB 把一部分 LLM 调用搬进了数据库本地推理

来源: infoq.com 31
Google 将 AlloyDB AI functions 推到 GA,并引入了一种值得关注的 proxy model 架构:先用 LLM 的输出训练一个轻量本地模型,再把后续推理放在数据库内部执行。它瞄准的不是“让数据库变成通用大模型”,而是把某些高频、结构稳定、可被近似学习的 LLM 判断,从外部 API 调用变成数据库速度的本地计算。 这件事重要...

AlloyDB 把部分 LLM 调用搬回数据库:代理模型适合哪些查询

来源: infoq.com 26
Google 将 AlloyDB AI functions 推到 GA,同时引入了一种很实用的代理模型架构:先用 LLM 输出训练一个轻量本地模型,再把后续推理放在数据库内部执行。这个变化的重点不是“数据库也能聊 AI”,而是把一类高频、结构化、可近似的 LLM 判断,从外部 API 调用变成接近数据库速度的本地推理。 传统做法里,应用或数据库函数每处...

Kubernetes 给 AI 辅助维护立规矩:效率可以交给工具,责任必须留给人

来源: infoq.com 25
Kubernetes 社区正在把 AI 引入开源维护流程,但它没有把“自动化”当成免责任通行证。新的框架强调:AI 可以帮助维护者整理信息、加速检查、辅助生成草稿,但代码质量、合并判断和项目治理责任仍然落在人类维护者身上。 这件事对所有开源项目都有参考价值。越是核心基础设施,越不能只问“AI 能不能做”,还要问“出了问题谁负责、如何审计、如何让贡献者说...

Airbnb 如何用 Sitar-agent 给 Kubernetes Pod 动态下发配置

来源: infoq.com 42
Airbnb 披露了 Sitar-agent 的架构:它是运行在 Kubernetes 服务旁边的 sidecar,用来把动态配置稳定地下发到数以万计的 Pod。这个系统每分钟要处理多次配置更新,核心挑战不是“能不能推送配置”,而是当规模、启动风暴、网络抖动和存储故障同时出现时,应用还能不能拿到可用配置。 这次重构的几个关键词很明确:Java 重写、用...

从 PostgreSQL 换到 ClickHouse:高吞吐缓存查询的现实取舍

来源: infoq.com 29
Momentic 为 AI 驱动的软件测试平台重构了缓存系统:规模达到每天超过 200 万次查询、总计约 200 亿条记录,同时把平均响应延迟维持在约 250 ms。关键变化不是给 PostgreSQL 再加一层补丁,而是把缓存查询负载迁移到列式数据库 ClickHouse。 这类迁移值得后端团队关注,因为它不是“数据库谁更强”的抽象争论,而是一个典型...

用 ClickHouse 扛住 200 万次/天缓存查询:从 PostgreSQL 迁移的工程取舍

来源: infoq.com 37
Momentic 在重构其 AI 软件测试平台的缓存系统时,把存储层从 PostgreSQL 迁到列式数据库 ClickHouse,用来支撑每天超过 200 万次查询、总量约 200 亿条缓存记录,并把平均响应延迟维持在约 250 ms。这个案例值得关注,不是因为“PostgreSQL 不行”,而是因为缓存查询的形态一旦变成大规模读、宽表扫描、按条件过...

AWS DevOps Agent 加入 AI 发布管理:让代码进生产前先过一遍“自动审查”

来源: infoq.com 43
AWS 扩展了 AWS DevOps Agent,新增面向发布管理的能力:在代码进入生产环境之前,评估代码变更,并自主执行软件测试。这件事的重点不只是“又多了一个 AI 助手”,而是发布流程里最容易靠经验、手工检查和临时会议兜底的环节,开始被更系统地自动化。 传统 CI/CD 管道擅长做确定性工作:拉代码、跑测试、构建镜像、发布到环境。它的问题也很明显...