2026-08-01
来源: postgr.es
58
PostgreSQL Performance Farm 还没有真正落地,但项目已经出现了更具体的推进路径:借助 AWS 开源项目额度,在 EC2 上重新开展大规模 OLTP 测试,并更新 OSDL 时期留下的测试工具,尤其是 DBT-5。当前设想是从 实例和多块 EBS 卷入手,评估一种类似 TPC-E、I/O 与计算压力相对均衡的负载。 这件事的价值...
2026-08-01
来源: cloud.google.com
36
2026 年 5 月至 7 月,Google Cloud 的 AI 基础设施更新呈现出一个清晰趋势:竞争重点已经从“能不能运行模型”转向“能否在大规模、低延迟、可观测且可控成本的条件下持续运行模型和智能体”。 这组更新覆盖存储、网络、TPU/GPU 编排、推理网关、AI 供应链安全以及智能体运行时。它们共同指向一个现实问题:Agentic AI 不只是...
2026-07-31
来源: aws.amazon.com
52
AI Agent 从原型进入生产环境后,工程重点会迅速变化:系统不再只是“能否完成任务”,还要回答一次会话为什么越来越慢、时间消耗在哪个工具调用上,以及长期运行时内存为何持续增长。Amazon Bedrock AgentCore Observability 与 Amazon CloudWatch 的组合,提供了从会话、执行步骤到资源指标的诊断路径,帮助...
2026-07-31
来源: blog.cloudflare.com
53
Cloudflare 此前已经让其服务器具备 Media over QUIC(MoQ)中继能力。新的 provisioning API 又向前推进了一步:开发者可以创建自己的隔离中继,并明确控制哪些身份能够发布媒体、哪些身份只能观看。这让 MoQ 从共享基础设施能力,进一步变成可纳入业务权限体系的可编排资源。 媒体中继不仅负责转发数据,也处在内容生产者...
2026-07-31
来源: cloud.google.com
59
生成式 AI 正在缩短产品开发周期,也在压缩攻击者发现漏洞、生成利用代码和扩大攻击面的时间窗口。面对自动化攻击,企业若仍依赖人工分拣告警、跨工具复制数据和逐级审批,就很难保持同等响应速度。因此,AI 威胁防御不再只是安全运营中心的技术升级,而应成为董事会衡量业务韧性和创新能力的治理基线。 过去,安全投资常被视为成本。现在,每个重要业务计划都可能包含 A...
2026-07-31
来源: aws.amazon.com
43
在 AWS 上部署 Kimi K3,可以沿两条路径展开:使用 Amazon SageMaker HyperPod 构建面向大模型训练与推理的集群,或者把服务部署到 Amazon Elastic Kubernetes Service(Amazon EKS)。两种方案都能承载模型工作负载,但它们解决的问题不同:HyperPod 更强调托管式集群与机器学习基...
2026-07-31
来源: aws.amazon.com
36
部署 Kimi K3 这类大型模型,真正困难的部分通常不是启动一个容器,而是把 GPU 拓扑、模型权重、分布式推理、故障恢复和服务入口组合成一套可重复运维的系统。AWS 提供了两条主要路径:使用 Amazon SageMaker HyperPod 建设面向大规模 AI 工作负载的集群,或者把推理服务部署到 Amazon EKS,由 Kubernetes...
2026-07-31
来源: aws.amazon.com
46
搜索重定向(Search Retargeting,SRT)的价值,在于把用户已经表达过的搜索意图连接到展示、视频和原生广告。Yahoo 在其 DSP 广告技术套件中引入 Amazon Bedrock,进一步增强了这项能力:识别范围不再局限于 Yahoo Search 中输入的关键词,还可以覆盖集成合作伙伴系统中的搜索活动,并通过 AI 发现更广泛的意图...
2026-07-31
来源: aws.amazon.com
43
生产环境中的模型监控不能只回答“端点是否在线”。真正影响业务的是:输入数据是否漂移、预测分布是否异常、延迟到达的真实标签是否证明模型仍然有效,以及团队能否在同一个视图中看到这些变化。推理元监控把这些信号汇总到生产推理管线之上,再通过 Amazon Quick 持续呈现质量和性能状态。 SageMaker AI 端点自身的运行指标仍然重要,例如调用量、延...
2026-07-31
来源: aws.amazon.com
59
OpenAI GPT-5.6 Sol、Terra 和 Luna 已在 Amazon Bedrock 正式可用。与模型一同推出的显式提示词缓存,让应用可以明确指定哪些提示内容应被缓存和复用,而不是把缓存行为完全交给平台判断。对于长系统提示、固定知识库和重复工具定义较多的工作负载,这直接关系到推理成本与响应延迟。 典型的生产提示并不是一个不可拆分的字符串,...