标签

机器学习

用 AEM 拆解多轮 Agent 失败:找到真正出错的那一轮

来源: aws.amazon.com 36
多轮 Agent 的失败通常不是“最后一轮突然答错”这么简单。一个早期决策如果写错了状态、误解了用户意图,或者调用了错误的工具,后续多轮可能只是沿着错误前提继续推理。只看最终结果,评估者很难判断问题究竟发生在哪里。 Agent Evaluation Metric(AEM)提供了一种更适合多轮对话的拆解方式:把 Agent 质量按轮次观察,并将“造成失败...

用 Amazon Bedrock AgentCore 把航班运行数据变成可执行的周转洞察

来源: aws.amazon.com 40
航班周转延误往往不是某一个环节单独失效,而是登机、行李、加油、清洁、机组和放行等多个事件在时间线上相互影响。AvioBook 是 Thales Group 旗下公司,其 Connected Analytics 原型展示了一种实用方向:基于 AvioBook Connect 的运行数据,通过 Amazon Bedrock AgentCore 生成面向航空...

从 PyTorch 模型到云原生部署:解读 PyTorch Conference China 2026 的开放 AI 技术栈

来源: pytorch.org 28
PyTorch Conference China 2026 于 9 月 8 日至 9 日在上海举行,并与 KubeCon + CloudNativeCon、OpenInfra Summit 同期举办;此前一天还有由赞助商组织的联合活动。这样的会议组合释放了一个清晰信号:AI 工程已经不再局限于模型训练,团队需要把框架、推理服务、容器、调度和基础设施作为...

在 Amazon SageMaker HyperPod 上用 vLLM 部署 Qwen3.8-2.4T-A95B

来源: aws.amazon.com 37
Qwen3.8-2.4T-A95B 是一个拥有 2.4 万亿参数的开放权重模型。要把这类模型稳定地运行起来,难点不只是启动一个容器,还包括多节点 GPU 集群规划、模型权重分发、NVFP4 量化、推理并行,以及如何把推理、工具调用和 MTP 投机解码暴露成可用的 API。 Amazon SageMaker HyperPod 负责提供可扩展的训练和推理基...

从百万 Token 到实体机器人:AWS 生成式 AI 的工程边界正在外扩

来源: aws.amazon.com 32
2026 年 8 月,AWS 面向 AI 开发者的一批更新集中落在三个方向:更大的模型上下文、更持久的智能体运行环境,以及从云端向政府区域和物理设备扩展的部署能力。涉及的产品包括 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands,其中包括 OpenAI 模型的百万 Token 上下文、跨区域推理、最长可...

Heurist Finance:用 Amazon Bedrock AgentCore 搭建可审计的 AI 投资工作台

来源: aws.amazon.com 43
Heurist Finance 把投资研究从“聊天问答”推进成了一个可以执行任务的 AI 工作台。用户可以用自然语言提出研究问题,系统按需购买高级市场数据,在隔离沙箱中运行分析,并记录每一次关键动作。 这套方案的重点不只是接入一个大模型,而是把支付、身份、记忆、代码执行和可观测性放进同一个代理运行环境。对于小团队来说,这种组合能减少自建基础设施的范围,...

用 Ray Serve 深度学习容器接管 TorchServe 之后的 GPU 推理栈

来源: aws.amazon.com 28
TorchServe 已不再维护,继续使用它意味着团队需要自行承担推理服务、GPU 运行时、依赖版本和故障排查的全部责任。对于已经运行在 Amazon EKS 上的团队,AWS Ray Serve Deep Learning Container(DLC)提供了一条更稳妥的迁移路径:把框架、GPU 驱动相关运行时和服务层预先组装在受支持、经过测试的容器中...

用自动化管理 Amazon Quick 的用户级自定义权限

来源: aws.amazon.com 28
Amazon Quick 的自定义权限可以按用户开关功能,把“所有人都能用”改成“每个人只能用到需要的部分”。真正困难的地方不在于创建一组权限,而在于让权限贯穿用户注册、角色分配、事件处理和历史用户治理这条完整生命周期。 本文整理四种可落地的自动化模式:在 调用时指定权限、配置账户或角色默认值、通过 Amazon EventBridge 与 AWS L...

GPT-6 Astra 登陆 Amazon Bedrock:把深度推理接入生产系统

来源: aws.amazon.com 42
OpenAI 的 GPT-6 Astra 现已在 Amazon Bedrock 正式可用。对已经把身份权限、审计、网络和模型调用统一放在 AWS 上的团队而言,这意味着可以通过 Bedrock 的推理基础设施,将更强的推理与判断能力用于复杂任务,而不必额外维护一套独立的模型服务接入层。 “正式可用”解决的是采购和生产接入问题,却不等于模型会自动改善业务...

在 SageMaker HyperPod 上扩展潜空间推理:解读 Pathway 的 BDH 架构

来源: aws.amazon.com 30
大语言模型通常把“思考过程”展开成一串 chain-of-thought(CoT)文本,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:让推理发生在潜空间中,不必逐步输出推理 token。这种脑启发、后 Transformer 架构不仅改变了推理接口,也改变了训练、评测和基础设施优化的重点。Pathway ...