标签

AWS

用 Amazon Bedrock AgentCore 构建多智能体 FDX API 入驻助手

来源: aws.amazon.com 41
开放金融接入最耗时的部分,往往不是把一个 API 请求发送出去,而是确认接口是否符合 Financial Data Exchange(FDX)标准、补齐证据、解释差异,并在安全与合规约束下反复沟通。Ninth Wave 构建的 Compass 将这套流程交给运行在 Amazon Bedrock AgentCore 上的多智能体助手处理,把原本以周计算的...

生成式 AI 定制路线怎么选:从提示词到 AWS 自定义模型

来源: aws.amazon.com 46
生成式 AI 项目最容易走偏的地方,不是模型调用,而是过早选择了过重的定制方案。很多问题用更好的提示词就能解决;有些问题需要接入企业知识库;只有当模型的行为、领域语言或任务能力仍然达不到要求时,才值得考虑微调、持续预训练,甚至构建更深度的自定义模型。 在 AWS 上,可以把这条路线理解为一条逐步升级的定制光谱:从提示词工程开始,经过 RAG、工具调用和...

让补货自动闭环:用 MMF、Databricks Genie 和 Amazon Quick 把预测变成订单

来源: aws.amazon.com 28
基础模型已经让“给整个商品目录做需求预测”变得相对容易,但预测本身不会让货架恢复库存。真正棘手的是下一步:识别需求激增、核对供应商的实时可供货量、决定补多少,并在条件满足时自动下单。 这篇文章讨论一种部署在 Databricks 和 Amazon Quick 上的闭环:检测需求变化,做出补货决策,执行采购动作;只有没有任何供应商能够覆盖需求时,才升级给...

Lambda SnapStart 支持容器镜像:依赖空间与冷启动不必再二选一

来源: infoq.com 47
AWS 将 Lambda SnapStart 扩展到了容器镜像函数。这个变化解决了一个长期存在的打包取舍:Zip 部署包的体积上限更小,而容器镜像可以容纳更多依赖;但团队过去往往要在依赖空间和亚秒级启动之间做选择。 现在,使用容器镜像的 Lambda 函数也可以采用 SnapStart。对于依赖较多、又对启动延迟敏感的函数,这意味着不必仅为了满足 Zi...

生产环境中的 Agent 生命周期监控:用 AgentCore Evaluations 与 AWS DevOps Agent 构建双层闭环

来源: aws.amazon.com 35
多 Agent 系统上线后,故障通常不只是“服务是否存活”。一个航空订票系统可能返回了 HTTP 200,却把乘客引导到错误的航班;某个 Agent 可能因为工具调用延迟变高而反复重试,最终拖慢整个预订流程。传统的 CPU、内存和错误率监控,很难回答这些问题。 这类系统需要两层监控:一层持续衡量 Agent 的回答质量和行为表现,另一层负责调查承载 A...

别只看每百万 Token 价格:如何为 Amazon Bedrock 选择合适的 OpenAI 模型

来源: aws.amazon.com 42
在 Amazon Bedrock 上比较 OpenAI 模型时,只看每百万 Token 的单价,很容易得到一个看似精确、实际不够有用的结论。生产系统真正承担的成本,通常还包括重试、人工复核、工具调用、上下文长度,以及模型是否一次就能交付正确结果。 更可靠的评估方式,是把价格放回业务结果中:每个正确答案花了多少钱?一次 Agent 任务完整轨迹消耗了多少...

用 Amazon Bedrock AgentCore 构建可交互的 MCP Apps

来源: aws.amazon.com 34
MCP Apps 让模型调用工具的结果不再局限于纯文本。通过交互式 HTML widget,同一个 MCP Server 可以把表单、筛选器、图表或审批控件交给 AI Host 渲染,让用户直接在对话界面中完成操作。 这套能力的关键在于:MCP Apps 是与 Host 解耦的标准扩展。只要 ChatGPT、Claude 或其他 AI Host 支持对...

从零样本预测到采购订单:用 Amazon Bedrock AgentCore 编排需求决策

来源: aws.amazon.com 43
需求预测真正难的地方,通常不是生成一个数字,而是把这个数字变成一张可解释、可校验、可追溯的采购订单。将 Amazon Chronos2 的零样本预测能力与 Amazon Bedrock AgentCore 的多智能体编排结合起来,可以搭建一条从历史销量到采购建议的自动化链路:不必为每个商品单独训练模型,同时把库存策略、供应商约束、审批规则和审计记录放进...

用前缀感知路由降低 Amazon SageMaker 大模型推理延迟

来源: aws.amazon.com 42
在大模型在线推理中,首 token 延迟往往比完整响应耗时更影响用户体验。Amazon SageMaker Inference 新增的前缀感知路由,会把共享相同提示词前缀的请求发送到同一个实例,让该实例上的 KV cache 更容易保持温热。 根据摘要中的 Llama 3.1 70B 基准测试,这种路由策略将 P50 time-to-first-tok...

让 SageMaker HyperPod 的推理冷启动从分钟级降到秒级:模型缓存实践

来源: aws.amazon.com 32
在大模型推理集群里,真正拖慢扩容的往往不是容器启动,而是模型权重和容器镜像的下载。Amazon SageMaker HyperPod 现在支持面向推理的模型缓存:提前把模型权重与容器镜像放到集群节点的本地 NVMe 存储中,Pod 启动时直接从本地读取,而不是重新通过网络下载。 这会把原本可能需要几十分钟的冷启动,压缩到秒级范围内。对于弹性扩容、故障替...