2026-06-29
来源: azure.microsoft.com
36
Linux 工作负载里,文件共享一直是一个朴素但关键的需求:多个节点读写同一批文件、应用迁移时保留 POSIX 风格路径、批处理和服务之间交换数据。Azure Files 的价值在于把这种熟悉的文件访问模型,和云上的性能能力、数据保护、安全控制以及 Azure 服务集成放到一起,减少团队自己维护文件服务器的负担。 不是所有状态都适合塞进对象存储或数据库...
2026-06-29
来源: postgr.es
39
很多团队并不缺备份、复制、监控或云服务,真正缺的是在压力下把它们用对的能力。灾难恢复,简称 DR,最容易被误解成一套工具清单:有备份、有只读副本、有对象存储、有告警,就算准备好了。但真正出事时,决定 RTO 的往往不是你买了什么,而是谁来指挥、命令是否还能跑、权限是否还有效、团队有没有练过。 这篇文章讨论的是 DR 的后半段:如何把恢复能力从文档变成流...
2026-06-11
来源: infoq.com
66
一个月前 OpenAI 调整了与 Azure 的独家排他协议,紧接着 GPT-5.5、GPT-5.4 和 Codex 就在 Amazon Bedrock 上正式 GA 了。节奏之快,说明 OpenAI 在分发渠道上不再只押一家——对已经在 AWS 上跑基础设施的团队来说,这意味着不用再跨云调 OpenAI API,模型调用直接纳入 Bedrock 的统...
2026-06-11
来源: infoq.com
61
OpenAI 与 Azure 的独家绑定关系在一个月前被打破,如今效果已经落地——GPT-5.5、GPT-5.4 以及 Codex 正式在 Amazon Bedrock 上达到 GA(General Availability)。对于已经在 AWS 上有投入的团队来说,这意味着 OpenAI 模型终于可以纳入现有的云预算和合规框架,而不必另开一条 Azu...
2026-06-10
来源: infoq.com
46
多模型接入正在成为企业 AI 平台的标配,但每加一家供应商就要适配一套请求格式、一套鉴权方式、一套 token 计量逻辑——运维成本随供应商数量线性增长。Build 2026 上,Azure API Management(APIM)一次性交付了三个针对性能力:统一模型 API 让客户端只写一种格式、内容安全策略覆盖 MCP 工具调用和 Agent-to...
2026-06-10
来源: infoq.com
40
当你的应用需要同时调用 Anthropic Claude、Google Vertex AI 上的 Gemini、以及 Azure OpenAI 的 GPT 系列,每家 API 的请求格式、鉴权方式、错误码都不一样。路由层越写越厚,维护成本随模型数量线性增长。Build 2026 上,Azure API Management 正式发布了 Unified ...
2026-06-10
来源: azure.microsoft.com
59
Anthropic 最新前沿模型 Claude Fable 5 今天正式上线 Microsoft Foundry,同时成为 GitHub Copilot 和 Foundry Agent Service 的底层驱动力。这意味着开发者不再需要绕道第三方 API,直接在 Azure 生态内就能调用 Anthropic 最强的推理能力来构建自主 Agent。 ...
2026-06-10
来源: azure.microsoft.com
45
Anthropic 的最新前沿模型 Claude Fable 5 正式上线 Microsoft Foundry,同时为 GitHub Copilot 和 Foundry Agent Service 提供推理能力。这意味着开发者可以在 Azure 生态内直接调用 Anthropic 最强的模型来构建自主代理,不再需要跨平台对接。 过去要在 Azure 上...
2026-06-04
来源: postgr.es
81
大多数被归咎于"数据库挂了"的 PostgreSQL 宕机,真正的故障点在更底层——内核的文件描述符(file descriptor)用完了,PostgreSQL 只是第一个倒下的进程。这篇文章拆解整个故障链路:从连接数膨胀到 FD 耗尽,从日志特征到诊断命令,再到根治方案和临时止血手段。 Linux 内核把几乎所有 I/O 对象都抽象为文件描述符:T...
2026-06-03
来源: infoq.com
49
把 Spark 作业从传统集群搬上 Kubernetes,看起来只是换了个运行环境——实际上底层资源模型的差异远比想象中大。Pranav Bhasker 在将 Spark 管道迁移到 Azure Kubernetes Service(AKS)后,遇到了一种标准诊断手段几乎无法捕捉的 OOM 故障:作业反复被杀,日志里没有明显的内存溢出线索,Spark ...