标签

Azure

用 Azure Files 承载现代 Linux 工作负载:共享文件不再只是挂载点

来源: azure.microsoft.com 36
Linux 工作负载里,文件共享一直是一个朴素但关键的需求:多个节点读写同一批文件、应用迁移时保留 POSIX 风格路径、批处理和服务之间交换数据。Azure Files 的价值在于把这种熟悉的文件访问模型,和云上的性能能力、数据保护、安全控制以及 Azure 服务集成放到一起,减少团队自己维护文件服务器的负担。 不是所有状态都适合塞进对象存储或数据库...

灾难恢复不是买工具,而是把恢复练成肌肉记忆

来源: postgr.es 39
很多团队并不缺备份、复制、监控或云服务,真正缺的是在压力下把它们用对的能力。灾难恢复,简称 DR,最容易被误解成一套工具清单:有备份、有只读副本、有对象存储、有告警,就算准备好了。但真正出事时,决定 RTO 的往往不是你买了什么,而是谁来指挥、命令是否还能跑、权限是否还有效、团队有没有练过。 这篇文章讨论的是 DR 的后半段:如何把恢复能力从文档变成流...

Azure APIM 统一模型 API:用一个接口打通 Anthropic、Vertex AI 等多家后端

来源: infoq.com 46
多模型接入正在成为企业 AI 平台的标配,但每加一家供应商就要适配一套请求格式、一套鉴权方式、一套 token 计量逻辑——运维成本随供应商数量线性增长。Build 2026 上,Azure API Management(APIM)一次性交付了三个针对性能力:统一模型 API 让客户端只写一种格式、内容安全策略覆盖 MCP 工具调用和 Agent-to...

文件描述符耗尽:那个把 PostgreSQL 拉垮的内核限制

来源: postgr.es 81
大多数被归咎于"数据库挂了"的 PostgreSQL 宕机,真正的故障点在更底层——内核的文件描述符(file descriptor)用完了,PostgreSQL 只是第一个倒下的进程。这篇文章拆解整个故障链路:从连接数膨胀到 FD 耗尽,从日志特征到诊断命令,再到根治方案和临时止血手段。 Linux 内核把几乎所有 I/O 对象都抽象为文件描述符:T...

当 tmpfs 遇上硬亲和力:Spark 在 Kubernetes 上的 OOM 连环杀

来源: infoq.com 49
把 Spark 作业从传统集群搬上 Kubernetes,看起来只是换了个运行环境——实际上底层资源模型的差异远比想象中大。Pranav Bhasker 在将 Spark 管道迁移到 Azure Kubernetes Service(AKS)后,遇到了一种标准诊断手段几乎无法捕捉的 OOM 故障:作业反复被杀,日志里没有明显的内存溢出线索,Spark ...