标签

架构设计

让模型在潜空间里思考:Pathway 如何在 SageMaker HyperPod 上开发 BDH

来源: aws.amazon.com 20
大语言模型通常通过不断生成 token 来展开推理,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:它是一种受大脑启发的后 Transformer 架构,在潜空间中进行推理,而不是把完整的思维链逐 token 输出。这个变化不仅影响模型结构,也会改变训练、扩展和成本评估的方式。 Pathway 在 Amaz...

Kubernetes v1.37 工作负载感知调度:从 Pod 逐个排队到分层 Gang Scheduling

来源: kubernetes.io 41
AI 训练、分布式推理和复杂批处理任务很难用“每个 Pod 独立调度”的模型表达。一个包含 8 个 worker 和 1 个 driver 的训练任务,即使先启动了 3 个 worker,通常也无法产生有效进展,反而会长期占用 GPU、网络和 DRA 资源。 Kubernetes v1.37 继续推进 Workload-Aware Scheduling...

把灾备排障带进客户机房:HPE Zerto 的 Amazon Bedrock 多智能体架构

来源: aws.amazon.com 29
灾难恢复系统的排障难点,不只是日志多,而是证据分散在复制任务、恢复点、网络、存储和基础设施状态中。HPE Zerto 基于 Amazon Bedrock 构建了一套智能体式排障系统,并把执行环境部署在客户本地。这个设计值得关注:大模型负责推理,但对实时灾备数据的采集、约束和治理留在客户环境内。 这类系统真正困难的部分,不是让模型“读懂一段日志”,而是让...

用 Data Agent Kit 在 IDE 里完成跨数据源根因分析

来源: cloud.google.com 23
“1 月平均订单金额下降了 7%,但总收入没有变化,为什么?”这类问题难的不是写出某一条 SQL,而是答案通常散落在多个系统里:订单历史位于 BigQuery,实时客户资料保存在 Cloud SQL for PostgreSQL,营销规则则以 JSON 文件存放在 Cloud Storage。 Data Agent Kit 试图把这段调查过程收回到 I...

别把“胜出概率”当成贝叶斯 A/B 测试:理解 Spotify 的澄清

来源: engineering.atspotify.com 43
实验平台只要展示“B 胜过 A 的概率”,就算采用了贝叶斯 A/B 测试吗?不一定。Spotify Engineering 这次澄清的核心,正是不要仅凭结果页面上的概率指标,就给整套实验方法贴上“贝叶斯”标签。 来源摘要没有披露 Spotify 内部方法的完整实现,因此本文不推测其具体统计模型,而是借这个问题拆清楚:什么条件才能让一项 A/B 测试称为...

当攻击者开始使用 AI Agent:企业防线要从“拦截提示词”升级到控制执行链

来源: cloud.google.com 39
生成式 AI 对攻击者的价值正在发生变化:它不再只是编写邮件、翻译诱饵或生成脚本的聊天工具,而开始成为能够编排扫描器、处理错误、轮换基础设施并整理凭据的自动化控制层。 GTIG 对 2026 年第二季度活动的观察显示,一次云资源失陷后,攻击者在不到六小时内完成了代理化凭据收集活动的规划、构建与执行。真正值得防守方警惕的不是“AI 会不会生成恶意代码”,...

不改 GitHub Actions 工作流,用分布式追踪看清排队、慢任务与不稳定构建

来源: cncf.io 29
GitHub Actions 在组织里铺开后,账单通常比可观测性增长得更快。团队能看到某次构建失败,却很难立即回答:时间消耗在排队还是执行?哪个 job 长期拖慢流水线?失败后重跑成功的概率有多高? 解决这类问题不一定要给每个仓库修改 workflow YAML。更低侵入的做法,是从 GitHub 的控制面采集 Webhook,再通过 Actions ...

从默认放行到零信任:用 Kubernetes NetworkPolicy 隔离三层应用

来源: postgr.es 21
Kubernetes 集群中的 Pod 通常可以彼此通信。部署了 Frontend、Backend 和 Database,并不意味着三层之间天然存在网络边界。要实现零信任,需要先把命名空间切换为默认拒绝,再基于标签、端口和方向逐条开放业务真正需要的链路。 NetworkPolicy 是标准 Kubernetes API,但 API 对象本身不会拦截数据...

D2 开源 TALA:让软件架构图更像白板上的真实布局

来源: oschina.net 48
D2 的自动布局引擎 TALA 正式开源,采用 MPL-2.0 许可证,源代码已进入 仓库。这是 D2 转为非营利项目后的又一项重要动作,也让开发者有机会直接了解一个面向软件架构图的自动布局算法是如何工作的。 TALA 是 的缩写。它和常见的 Dagre、ELK 的差异,不只是算法名字不同,而是布局目标不同:TALA 专注于正交布局,让连线尽量以水平线...

用弹性 VM 与跨可用区调度提高 Spark 集群创建成功率

来源: cloud.google.com 40
对持续运行的大规模分析平台来说,Spark 作业能否按时开始,往往不只取决于代码和数据,还取决于指定规格的虚拟机当时是否有库存。固定机型、固定可用区的配置看似确定,遇到区域容量波动时却可能让整个数据管道停在集群创建阶段。 Yahoo 在 Google Cloud Managed Service for Apache Spark(原 Dataproc)中...