2026-06-04
来源: infoq.com
40
数据中心网络架构十几年来几乎没变过——胖树(fat-tree)是默认选项。AWS 最近公开了一项已经落地的大改动:他们用基于准随机图理论的扁平网络架构替代了胖树,新架构叫 Resilient Network Graphs,已经成为大多数新建数据中心的默认方案。路由器数量直接砍掉 69%,吞吐量提升 33%,网络功耗降低 40%。这不是论文里的设想,是已...
2026-06-04
来源: aws.amazon.com
37
大规模运行 Bedrock 上的生成式 AI 应用时,运维团队很快会遇到一个棘手问题:告警太多、阈值太死、工单重复创建,SRE 散落在各处的通知缺乏上下文。Amazon Bedrock Ops Alert 正是为了解决这些痛点而设计的三层自动化监控方案——它不只是"检测→通知"的流水线,而是把阈值自适应、告警分类、工单去重和上下文推送串成一条自驱闭环。...
2026-06-04
来源: aws.amazon.com
35
架构团队最常遇到的困境不是"没有需求",而是需求太多、每个都紧急、每个都重要。产品要新功能,运维要稳定性,安全要合规,基础设施要升级——所有倡议挤在一起,谁先谁后全靠嗓门大小。Tech Roadmap Prioritization(TRP)就是为解决这个问题设计的:一小时、一张矩阵、一群利益相关方,产出一份可执行的架构 backlog。 TRP 的关键...
2026-06-04
来源: aws.amazon.com
46
表格数据是企业里最常见的数据形态——客户画像、交易流水、设备日志,几乎都落在结构化表格里。传统做法是逐任务训练 XGBoost 或 LightGBM,每个模型只管一个场景,换个任务就要重新调参。Fundamental 推出的 NEXUS(Large Tabular Model)试图用"预训练 + 微调"的范式把表格数据也拉进大模型路线:先在海量表格数据...
2026-06-04
来源: blog.cloudflare.com
39
互联网的路由系统建立在信任之上:BGP 默认相信邻居通告的一切。这种信任带来了两类常见攻击——路由劫持(hijack)和路径泄漏(path leak)。RPKI 通过验证前缀的起源 AS,堵住了部分漏洞,但它无法判断 AS_PATH 中间跳是否被伪造。一个更简单、更古老的机制填补了这个缺口:First AS Enforcement——检查收到的路由中,...
2026-06-04
来源: aws.amazon.com
48
深度学习容器动辄数 GB,拉取镜像往往成为冷启动的瓶颈。AWS 推出的 SOCI(Seekable OCI)通过"懒加载"让容器不必等整个镜像下载完就能启动——镜像层按需拉取,启动后再后台补齐剩余数据。这篇文章聚焦如何在公开的 Deep Learning AMI(DLAMI)和 Deep Learning Containers(DLC)上使用 SOCI...
2026-06-03
来源: aws.amazon.com
48
大模型做 Agent 时,最让人头疼的不是推理能力不够,而是工具调用不准——该调 API 时不调,不该调时瞎调,参数拼错、格式乱写,整个工作流直接断掉。Amazon SageMaker AI 最近的一篇实践文章给出了一个清晰的解法:先用监督微调(SFT)教会模型"怎么正确调用工具",再用直接偏好优化(DPO)让它学会"哪种调用方式更好",两步叠加,小语...
2026-06-03
来源: aws.amazon.com
61
Oracle 数据库的高可用架构,核心难题一直是共享存储。传统做法依赖 SAN 或 NFS,在云上要么成本高,要么恢复慢。Amazon FSx for NetApp ONTAP(简称 FSxN)把 ONTAP 的数据管理能力搬进 AWS,配合 Auto Scaling 和无服务器编排,可以把故障恢复从"人肉重启"压缩到分钟级自动化。 下面拆解这套架构的...
2026-06-03
来源: infoq.com
32
把 Spark 作业从传统集群搬上 Kubernetes,看起来只是换了个运行环境——实际上底层资源模型的差异远比想象中大。Pranav Bhasker 在将 Spark 管道迁移到 Azure Kubernetes Service(AKS)后,遇到了一种标准诊断手段几乎无法捕捉的 OOM 故障:作业反复被杀,日志里没有明显的内存溢出线索,Spark ...
2026-06-03
来源: blogs.microsoft.com
33
单点能力再强,没有编排、治理和弹性伸缩的底座,AI 也只是实验室里的 demo。微软正在把 Azure 打造成一个覆盖全栈的开放 Agent 平台——多模型接入、每一层可替换、每一环可观测。这才是真正能把 AI 变成业务生产力的东西。 很多团队的第一步是选模型:GPT-4o、Claude、Gemini,然后围绕它写 prompt、做微调。这在原型阶段没...