标签

机器学习

生产环境中的 Agent 生命周期监控:用 AgentCore Evaluations 与 AWS DevOps Agent 构建双层闭环

来源: aws.amazon.com 34
多 Agent 系统上线后,故障通常不只是“服务是否存活”。一个航空订票系统可能返回了 HTTP 200,却把乘客引导到错误的航班;某个 Agent 可能因为工具调用延迟变高而反复重试,最终拖慢整个预订流程。传统的 CPU、内存和错误率监控,很难回答这些问题。 这类系统需要两层监控:一层持续衡量 Agent 的回答质量和行为表现,另一层负责调查承载 A...

别只看每百万 Token 价格:如何为 Amazon Bedrock 选择合适的 OpenAI 模型

来源: aws.amazon.com 40
在 Amazon Bedrock 上比较 OpenAI 模型时,只看每百万 Token 的单价,很容易得到一个看似精确、实际不够有用的结论。生产系统真正承担的成本,通常还包括重试、人工复核、工具调用、上下文长度,以及模型是否一次就能交付正确结果。 更可靠的评估方式,是把价格放回业务结果中:每个正确答案花了多少钱?一次 Agent 任务完整轨迹消耗了多少...

用 Amazon Bedrock AgentCore 构建可交互的 MCP Apps

来源: aws.amazon.com 32
MCP Apps 让模型调用工具的结果不再局限于纯文本。通过交互式 HTML widget,同一个 MCP Server 可以把表单、筛选器、图表或审批控件交给 AI Host 渲染,让用户直接在对话界面中完成操作。 这套能力的关键在于:MCP Apps 是与 Host 解耦的标准扩展。只要 ChatGPT、Claude 或其他 AI Host 支持对...

用 Helion 与 Hugging Face Kernels 构建、调优并分发高性能 GPU Kernel

来源: pytorch.org 29
Hugging Face Kernels 项目加入 Helion 支持后,GPU Kernel 的开发链路变得更完整:开发者可以用更接近 Python 和 PyTorch 的方式描述计算,通过自动调优寻找适合当前硬件与输入形状的配置,再借助 Hugging Face Kernels 进行打包和分发。重点不只是“写出一个能运行的 Kernel”,而是让它...

用前缀感知路由降低 Amazon SageMaker 大模型推理延迟

来源: aws.amazon.com 40
在大模型在线推理中,首 token 延迟往往比完整响应耗时更影响用户体验。Amazon SageMaker Inference 新增的前缀感知路由,会把共享相同提示词前缀的请求发送到同一个实例,让该实例上的 KV cache 更容易保持温热。 根据摘要中的 Llama 3.1 70B 基准测试,这种路由策略将 P50 time-to-first-tok...

让 SageMaker HyperPod 的推理冷启动从分钟级降到秒级:模型缓存实践

来源: aws.amazon.com 32
在大模型推理集群里,真正拖慢扩容的往往不是容器启动,而是模型权重和容器镜像的下载。Amazon SageMaker HyperPod 现在支持面向推理的模型缓存:提前把模型权重与容器镜像放到集群节点的本地 NVMe 存储中,Pod 启动时直接从本地读取,而不是重新通过网络下载。 这会把原本可能需要几十分钟的冷启动,压缩到秒级范围内。对于弹性扩容、故障替...

让 Amazon Bedrock 知识库理解视频:用 Marengo 3.0 做多媒体语义搜索

来源: aws.amazon.com 35
过去,知识库检索通常围绕 PDF、网页和纯文本展开。现在,TwelveLabs Marengo Embed 3.0 已在 Amazon Bedrock Knowledge Bases 中正式可用,应用可以用自然语言搜索视频、图片和音频内容,而不必先为每种媒体单独搭建一套索引服务。 这项能力的价值不只是"给视频加个向量"。它把媒体内容纳入了知识库的检索链...

Amazon Quick 桌面版正式可用:企业 AI 助手开始进入日常工作流

来源: aws.amazon.com 35
Amazon Quick 桌面应用现已在 macOS 和 Windows 上正式可用。相比停留在浏览器标签页中的聊天工具,桌面客户端更容易进入员工每天处理邮件、会议和客户信息的工作路径。与此同时,iOS 与 Android 移动端新增活动信息流,用于集中呈现来自邮件、日历和 CRM 等系统的信息。 这次更新的重点并不只是多了几个客户端,而是让 AI 助...

用 Amazon Quick Automate 把多工作表 RFI 问卷自动整理为 CSV

来源: aws.amazon.com 30
RFI(信息请求)问卷经常以 Excel 工作簿流转:不同主题分散在多个工作表里,表头位置不统一,还夹杂说明文字、合并单元格和空行。真正费时间的往往不是读取文件,而是判断哪些行属于问题、如何统一字段,以及怎样输出可供后续系统消费的结构化数据。 Amazon Quick Automate 提供了一条更短的实现路径:从 Amazon S3 读取多工作表 R...

用 Amazon Bedrock 构建与模型无关的 PII 检测器

来源: aws.amazon.com 27
PII 检测不应该被某个固定模型或写死的实体列表绑住。这个方案的核心思路很直接:把待识别的实体类型放进提示词,把 Amazon Bedrock 上的任意大型语言模型当作检测引擎。这样,新增“客户编号”“内部项目代号”或某类业务敏感字段时,主要修改配置和提示词,不需要重新训练检测模型。 传统 PII 检测器通常在代码、规则或模型标签中固定实体集合,例如姓...