来源: aws.amazon.com
36
多轮 Agent 的失败通常不是“最后一轮突然答错”这么简单。一个早期决策如果写错了状态、误解了用户意图,或者调用了错误的工具,后续多轮可能只是沿着错误前提继续推理。只看最终结果,评估者很难判断问题究竟发生在哪里。 Agent Evaluation Metric(AEM)提供了一种更适合多轮对话的拆解方式:把 Agent 质量按轮次观察,并将“造成失败...
来源: aws.amazon.com
40
航班周转延误往往不是某一个环节单独失效,而是登机、行李、加油、清洁、机组和放行等多个事件在时间线上相互影响。AvioBook 是 Thales Group 旗下公司,其 Connected Analytics 原型展示了一种实用方向:基于 AvioBook Connect 的运行数据,通过 Amazon Bedrock AgentCore 生成面向航空...
来源: pytorch.org
28
PyTorch Conference China 2026 于 9 月 8 日至 9 日在上海举行,并与 KubeCon + CloudNativeCon、OpenInfra Summit 同期举办;此前一天还有由赞助商组织的联合活动。这样的会议组合释放了一个清晰信号:AI 工程已经不再局限于模型训练,团队需要把框架、推理服务、容器、调度和基础设施作为...
来源: aws.amazon.com
37
Qwen3.8-2.4T-A95B 是一个拥有 2.4 万亿参数的开放权重模型。要把这类模型稳定地运行起来,难点不只是启动一个容器,还包括多节点 GPU 集群规划、模型权重分发、NVFP4 量化、推理并行,以及如何把推理、工具调用和 MTP 投机解码暴露成可用的 API。 Amazon SageMaker HyperPod 负责提供可扩展的训练和推理基...
来源: aws.amazon.com
32
2026 年 8 月,AWS 面向 AI 开发者的一批更新集中落在三个方向:更大的模型上下文、更持久的智能体运行环境,以及从云端向政府区域和物理设备扩展的部署能力。涉及的产品包括 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands,其中包括 OpenAI 模型的百万 Token 上下文、跨区域推理、最长可...
来源: aws.amazon.com
43
Heurist Finance 把投资研究从“聊天问答”推进成了一个可以执行任务的 AI 工作台。用户可以用自然语言提出研究问题,系统按需购买高级市场数据,在隔离沙箱中运行分析,并记录每一次关键动作。 这套方案的重点不只是接入一个大模型,而是把支付、身份、记忆、代码执行和可观测性放进同一个代理运行环境。对于小团队来说,这种组合能减少自建基础设施的范围,...
来源: aws.amazon.com
28
TorchServe 已不再维护,继续使用它意味着团队需要自行承担推理服务、GPU 运行时、依赖版本和故障排查的全部责任。对于已经运行在 Amazon EKS 上的团队,AWS Ray Serve Deep Learning Container(DLC)提供了一条更稳妥的迁移路径:把框架、GPU 驱动相关运行时和服务层预先组装在受支持、经过测试的容器中...
来源: aws.amazon.com
28
Amazon Quick 的自定义权限可以按用户开关功能,把“所有人都能用”改成“每个人只能用到需要的部分”。真正困难的地方不在于创建一组权限,而在于让权限贯穿用户注册、角色分配、事件处理和历史用户治理这条完整生命周期。 本文整理四种可落地的自动化模式:在 调用时指定权限、配置账户或角色默认值、通过 Amazon EventBridge 与 AWS L...
来源: aws.amazon.com
42
OpenAI 的 GPT-6 Astra 现已在 Amazon Bedrock 正式可用。对已经把身份权限、审计、网络和模型调用统一放在 AWS 上的团队而言,这意味着可以通过 Bedrock 的推理基础设施,将更强的推理与判断能力用于复杂任务,而不必额外维护一套独立的模型服务接入层。 “正式可用”解决的是采购和生产接入问题,却不等于模型会自动改善业务...
来源: aws.amazon.com
30
大语言模型通常把“思考过程”展开成一串 chain-of-thought(CoT)文本,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:让推理发生在潜空间中,不必逐步输出推理 token。这种脑启发、后 Transformer 架构不仅改变了推理接口,也改变了训练、评测和基础设施优化的重点。Pathway ...