标签

云平台

Decathlon 如何用 Chronos-2 在 AWS 上规模化预测每周需求

来源: aws.amazon.com 42
对拥有数万种商品、覆盖多个大洲的零售商来说,需求预测真正难的部分不是“训练一个模型”,而是让预测系统稳定地跑起来:数据要按周整理,推理要覆盖大量 SKU,跨区域结果要能落地,成本和运维复杂度还必须可控。 Decathlon 的实践说明,Chronos-2 可以被部署到 AWS 上,服务大规模、周期性的需求预测任务。根据案例摘要,该方案将预测准确度提高了...

用 SageMaker Inference Components 跨可用区分布模型副本,实现 Multi-AZ 高可用

来源: aws.amazon.com 34
当一个模型服务需要满足 Multi-AZ 高可用合规要求时,问题并不只是“启动更多实例”。如果多个模型副本恰好集中在同一个 Availability Zone(AZ),单个可用区故障仍可能让服务整体失去容量。 Salesforce 的实践重点在于:利用 Amazon SageMaker AI Inference Components 的 ,让模型副本能...

Cloudflare BotBase 为机器人运营者补上可追踪、可修改的提交流程

来源: blog.cloudflare.com 41
Cloudflare 为 BotBase 机器人与智能体目录的运营者提供了一个更明确的管理入口。运营者现在可以在 Cloudflare Dashboard 中管理目录提交、跟踪审核状态、修改已提交信息,并通过行为模型更准确地声明机器人如何使用网站内容。 这次变化的重点不只是“多了一个页面”,而是把原本容易失控的一次性提交,变成一个可以持续维护的运营流程...

用 Amazon Quick 和 fal 搭建可复用的智能创意工作流

来源: aws.amazon.com 45
创意团队需要持续产出分镜、视觉草图、音乐视频概念等大量资产,但工具分散和人工传递上下文会让制作流程变慢。Amazon Quick 与 fal 通过 Model Context Protocol(MCP)连接后,可以把创意讨论、素材生成和结果整理放进一个可复用的 agent harness 中。 本文围绕两个实践场景展开:生成八格分镜,以及快速制作音乐视...

Amazon Bedrock 在印度支持 GPT-5.6 跨区域推理:本地数据处理的新选择

来源: aws.amazon.com 40
Amazon Bedrock 现已在印度支持 OpenAI GPT-5.6 系列模型 Terra 和 Luna,并提供印度地理范围内的跨区域推理能力。对于需要遵守本地数据处理要求的团队,这意味着可以在保持请求和数据留在印度的前提下,按需扩展模型推理能力。 企业在印度部署生成式 AI 时,通常同时面对两个约束:一方面,希望使用更强的基础模型处理复杂任务;...

Amazon Bedrock 在印度上线 OpenAI GPT-5.6、Terra 与 Luna:实现境内推理

来源: aws.amazon.com 44
Amazon Bedrock 现在支持在印度使用 OpenAI GPT-5.6 模型、Terra 和 Luna,并提供印度地理跨区域推理能力。对于需要本地数据处理的团队,这意味着可以在保持推理请求和数据留在印度境内的前提下,将这些模型接入生产系统并进行规模化使用。 很多企业并不是单纯缺少模型能力,而是受到数据驻留和本地处理要求的约束。业务请求中的客户资...

一个 DNS 缓存条目如何省下 100 TB 内存:从 Rust 数据布局看规模效应

来源: blog.cloudflare.com 38
Cloudflare 对 1.1.1.1 使用的 Big Pineapple DNS 缓存做了五项 Rust 层面的内存优化,将单条缓存记录的内存占用降低了 56%。当同一种数据结构在整个服务集群中被复制数十亿次时,这次看似局部的改造最终释放了约 100 TB 内存。 来源摘要没有列出五项优化的具体实现,因此下面不会猜测其内部字段或代码。我们更值得拆解...

托管 PostgreSQL 还是自建:把数据库运维成本算清楚

来源: azure.microsoft.com 27
选择 PostgreSQL 的部署方式,通常不是“云服务更省事”或“自建更可控”这么简单。托管 PostgreSQL 与自建 PostgreSQL 的差别,会持续反映在成本结构、安全责任、故障恢复速度、扩缩容路径,以及团队真正投入在数据库运维上的时间里。 关键不在于哪一种方案绝对更好,而在于业务是否需要把数据库基础设施作为一项核心能力来经营。 托管 P...

Deepgram 在 SageMaker 中把语音 AI 的账单、用量与 GPU 指标送进 CloudWatch

来源: aws.amazon.com 50
自托管语音 AI 的难点不只在部署模型,还在于运营数据的归属。推理服务虽然运行在自己的 Amazon SageMaker AI 环境中,但容量规划、成本核算所需的账单、调用量和单卡 GPU 指标,往往封闭在供应商容器内。Deepgram 针对 SageMaker AI 提供的 Enhanced Metrics,目标正是把这些数据直接落到用户自己的 Am...

用 NVIDIA MPS 提高 GPU 利用率:将 EC2 上的 ASR 推理成本降低 75%

来源: aws.amazon.com 37
自动语音识别服务常见的成本问题,不是模型无法跑满 GPU,而是单个请求只短暂占用一部分计算资源。为了守住延迟目标,团队往往增加 GPU 实例,结果是显存已经分配、CUDA 上下文已经建立,计算单元却仍有大量空闲。 在 Amazon EC2 GPU 实例上组合 NVIDIA CUDA Multi-Process Service(MPS)与 NVIDIA ...