标签

云平台

OpenAI 如何用“流行病学”思路定位 GNU libunwind 的 18 年老竞态

来源: infoq.com 41
一次看似普通的崩溃排查,最后拆成了两个完全无关的问题:一台 Azure 主机上的静默硬件损坏,以及 GNU libunwind 中 函数一个存在 18 年的竞态条件。真正的转折点不是某个神奇调试器,而是 OpenAI 把视角从“盯着单个 core dump”切换到“观察崩溃人群的分布”。 这件事对基础设施团队很有参考价值:当系统规模足够大时,偶发崩溃不...

把崩溃当成流行病看:OpenAI 如何拆开 libunwind 老 Bug 和硬件静默损坏

来源: infoq.com 30
OpenAI 在 ChatGPT 数据基础设施里追一个崩溃问题时,最后发现它不是“一个诡异 Bug”,而是两个互不相关的问题叠在了一起:一台 Azure 主机上的静默硬件损坏,以及 GNU libunwind 里一个存在了 18 年的竞态条件。真正打开局面的,不是继续盯着单个 core dump,而是把崩溃当成一组群体事件来分析。 这件事对基础设施工程...

把知识图谱带进 RAG:GraphRAG 如何服务药物研发

来源: aws.amazon.com 37
药物研发里的问题很少是“找一段文字”这么简单。研究人员更常问:某个靶点和疾病有什么证据链?候选化合物影响哪些通路?这篇来源文章讨论的核心变化是:把图数据库、生成式 AI 和 BYOKG(Bring Your Own Knowledge Graph,自带知识图谱)结合起来,用 GraphRAG 加速科学发现,同时尽量不牺牲科学完整性。 传统 RAG 通常...

用 Amazon Bedrock 给邮箱自动分拣和排序

来源: aws.amazon.com 22
公共部门组织的邮箱常常不是“沟通工具”,而是事实上的业务入口:居民咨询、内部审批、供应商文件、紧急事件通报都会先进入共享邮箱。来源文章展示了一种用 Amazon Bedrock 驱动的生成式 AI 方案,把邮件自动分类、提取关键信息并按优先级排序,减少人工扫信箱的时间。 传统规则引擎适合处理明确模式,例如主题包含“发票”就打上财务标签,发件人来自某个域...

Azure 韧性演进给云上系统的一堂工程课

来源: azure.microsoft.com 41
云韧性不是一句“高可用”的口号,而是系统在真实约束下继续工作的能力:硬件会坏,网络会抖,区域会遇到容量压力,依赖服务会变慢。Microsoft Azure 关于韧性演进的讨论,核心并不只是“云平台越来越可靠”,更重要的是云上应用也要被设计成能适应、恢复、降级并持续提供服务的系统。 很多团队第一次谈 resiliency,会把注意力放在 SLA、可用区、...

用 AWS WAF 守住 Amazon Bedrock AgentCore Runtime 的入口

来源: aws.amazon.com 34
Amazon Bedrock AgentCore Runtime 作为托管运行时,真正上线时绕不开一个问题:公网请求怎样进来,安全控制又怎样不被绕过?这篇方案的核心变化很明确:把入口收束到 internet-facing ALB,并在 ALB 前挂 AWS WAF,再通过 VPC Interface Endpoint 把流量送到 AgentCore R...

用 Jamf AI Governance 和 Amazon Bedrock 管住 Mac 上的 AI 应用配置

来源: aws.amazon.com 26
企业里的 AI 应用已经从“员工自己试一试”变成了“终端上真实运行的生产工具”。这篇来源内容关注的是一个很具体的场景:用 Jamf 的 AI Governance 配合 Amazon Bedrock,在一批 Mac 设备上配置、下发并验证 AI 应用的受管设置。重点不只是“能不能装”,而是配置是否统一、策略是否落地、设备端是否可审计。 Mac 机群里的...

Meerkat:Cloudflare 在全球共识上的一次新实验

来源: blog.cloudflare.com 33
Cloudflare Research 正在构建一个名为 Meerkat 的全球共识服务,并为它设计了新的共识算法 QuePaxa。这个方向值得关注:一旦全球共识能以可用的延迟、故障模型和运维复杂度落地,它就不只是论文里的复制状态机,而会变成强一致键值存储、跨区域控制面、配置分发和协调服务的基础设施。 来源摘要里提到,Meerkat 的目标之一是构建强...