标签

云平台

PostgreSQL Performance Farm 重启:在 EC2 上搭建大规模 OLTP 性能试验场

来源: postgr.es 58
PostgreSQL Performance Farm 还没有真正落地,但项目已经出现了更具体的推进路径:借助 AWS 开源项目额度,在 EC2 上重新开展大规模 OLTP 测试,并更新 OSDL 时期留下的测试工具,尤其是 DBT-5。当前设想是从 实例和多块 EBS 卷入手,评估一种类似 TPC-E、I/O 与计算压力相对均衡的负载。 这件事的价值...

AI 基础设施进入编排深水区:从高性能存储到智能体密度优化

来源: cloud.google.com 36
2026 年 5 月至 7 月,Google Cloud 的 AI 基础设施更新呈现出一个清晰趋势:竞争重点已经从“能不能运行模型”转向“能否在大规模、低延迟、可观测且可控成本的条件下持续运行模型和智能体”。 这组更新覆盖存储、网络、TPU/GPU 编排、推理网关、AI 供应链安全以及智能体运行时。它们共同指向一个现实问题:Agentic AI 不只是...

用 AgentCore Observability 定位生产级 AI Agent 的性能与内存瓶颈

来源: aws.amazon.com 52
AI Agent 从原型进入生产环境后,工程重点会迅速变化:系统不再只是“能否完成任务”,还要回答一次会话为什么越来越慢、时间消耗在哪个工具调用上,以及长期运行时内存为何持续增长。Amazon Bedrock AgentCore Observability 与 Amazon CloudWatch 的组合,提供了从会话、执行步骤到资源指标的诊断路径,帮助...

用 MoQ Provisioning API 创建隔离中继:把发布权与观看权分开管理

来源: blog.cloudflare.com 53
Cloudflare 此前已经让其服务器具备 Media over QUIC(MoQ)中继能力。新的 provisioning API 又向前推进了一步:开发者可以创建自己的隔离中继,并明确控制哪些身份能够发布媒体、哪些身份只能观看。这让 MoQ 从共享基础设施能力,进一步变成可纳入业务权限体系的可编排资源。 媒体中继不仅负责转发数据,也处在内容生产者...

AI 威胁防御进入董事会议程:用五个治理问题推动安全现代化

来源: cloud.google.com 59
生成式 AI 正在缩短产品开发周期,也在压缩攻击者发现漏洞、生成利用代码和扩大攻击面的时间窗口。面对自动化攻击,企业若仍依赖人工分拣告警、跨工具复制数据和逐级审批,就很难保持同等响应速度。因此,AI 威胁防御不再只是安全运营中心的技术升级,而应成为董事会衡量业务韧性和创新能力的治理基线。 过去,安全投资常被视为成本。现在,每个重要业务计划都可能包含 A...

在 AWS 上部署 Kimi K3:SageMaker HyperPod 与 Amazon EKS 的选型和落地

来源: aws.amazon.com 36
部署 Kimi K3 这类大型模型,真正困难的部分通常不是启动一个容器,而是把 GPU 拓扑、模型权重、分布式推理、故障恢复和服务入口组合成一套可重复运维的系统。AWS 提供了两条主要路径:使用 Amazon SageMaker HyperPod 建设面向大规模 AI 工作负载的集群,或者把推理服务部署到 Amazon EKS,由 Kubernetes...

Yahoo 如何用 Amazon Bedrock 扩展搜索重定向的意图识别

来源: aws.amazon.com 46
搜索重定向(Search Retargeting,SRT)的价值,在于把用户已经表达过的搜索意图连接到展示、视频和原生广告。Yahoo 在其 DSP 广告技术套件中引入 Amazon Bedrock,进一步增强了这项能力:识别范围不再局限于 Yahoo Search 中输入的关键词,还可以覆盖集成合作伙伴系统中的搜索活动,并通过 AI 发现更广泛的意图...

用 Amazon Quick 为 SageMaker AI 推理端点搭建元监控治理层

来源: aws.amazon.com 43
生产环境中的模型监控不能只回答“端点是否在线”。真正影响业务的是:输入数据是否漂移、预测分布是否异常、延迟到达的真实标签是否证明模型仍然有效,以及团队能否在同一个视图中看到这些变化。推理元监控把这些信号汇总到生产推理管线之上,再通过 Amazon Quick 持续呈现质量和性能状态。 SageMaker AI 端点自身的运行指标仍然重要,例如调用量、延...

在 Amazon Bedrock 中精确缓存 GPT-5.6 提示词:降低重复推理成本

来源: aws.amazon.com 59
OpenAI GPT-5.6 Sol、Terra 和 Luna 已在 Amazon Bedrock 正式可用。与模型一同推出的显式提示词缓存,让应用可以明确指定哪些提示内容应被缓存和复用,而不是把缓存行为完全交给平台判断。对于长系统提示、固定知识库和重复工具定义较多的工作负载,这直接关系到推理成本与响应延迟。 典型的生产提示并不是一个不可拆分的字符串,...