2026-07-30
来源: aws.amazon.com
51
更换大模型往往不是修改一个模型 ID 那么简单。同一条提示词在不同模型上的指令遵循、输出格式、延迟和成本都可能变化,团队通常要反复改写提示词并运行评测。Amazon Bedrock Advanced Prompt Optimization 将这段流程集中起来:一次可以面向最多 5 个模型优化提示词,并比较原始版本与优化版本在质量、延迟和成本上的表现。 ...
2026-07-30
来源: pytorch.org
46
定制 GPU 编译器基础设施常见的难题,不是完成一次漂亮的优化,而是让优化在上游持续变化时仍然可用。Meta 的 FBTriton 一边承载 TLX、autoWS 等编译器创新,一边通过代理式上游摄取和分层的 L1/L2/L3 验证体系保持与 Triton 同步。真正值得借鉴的,是它把“跟进上游”从临时救火变成了一条可重复执行、可以逐层建立信心的工程流...
2026-07-30
来源: aws.amazon.com
42
当 Bedrock AgentCore 中的智能体需要访问外部 OAuth 2.0 服务时,传统做法通常是保存一个客户端密钥。Private Key JWT 改变了这个模型:智能体不再向身份提供商发送长期共享密钥,而是使用 AWS KMS 中的私钥签署一个短期 JWT,再由身份提供商用已注册的公钥验证。 这套方案的关键价值不只是“换一种登录方式”。私钥...
2026-07-29
来源: aws.amazon.com
42
企业并不缺数据,真正困难的是让模型在正确的权限边界内访问分散的数据,并把一次问答变成可持续的分析流程。Amazon Bedrock AgentCore 的思路是把数据连接、访问控制和持久记忆更多地交给配置层:通过预构建的 MCP Server 连接器接入多个系统,让业务人员用自然语言提问,同时自动执行角色边界。 传统商业智能助手通常需要为数据仓库、CR...
2026-07-29
来源: aws.amazon.com
48
客户表达不满之后,企业往往并不缺数据:通话转录里有投诉原因,CSAT 里有满意度评分,CRM 里有客户价值。真正拖慢响应的是这些信号散落在不同系统中,需要人工筛选、判断优先级,再逐封起草挽留邮件。 Amazon Quick 中的客户留存工作流提供了另一种组织方式:用无代码流程汇集通话转录和 CSAT 数据,识别有流失风险的客户,通过自定义 MCP Ac...
2026-07-29
来源: aws.amazon.com
52
MCP 2026-07-28 是该协议发布以来规模最大的一次修订:协议转向无状态运行,引入受治理的扩展体系,并强化授权机制。Amazon Bedrock AgentCore Gateway 支持通过一次 调用切换到新版本,但真正的升级工作不应止于修改版本号,还需要检查客户端状态、扩展依赖和授权边界。 无状态意味着服务端不能再默认依赖先前请求留下的会话上...
2026-07-29
来源: pytorch.org
56
PyTorch Foundation 正在征集 2026 年 PyTorch Conference North America 的 flare pin 设计。获胜者将获得一张该大会的免费门票。对开发者和技术设计师来说,这不只是一次画图比赛:一枚合格的徽章既要传达 PyTorch 社区的气质,也要经得起缩小、制版和实体生产。 会议徽章的展示面积有限。屏幕...
2026-07-29
来源: aws.amazon.com
42
市场监控不是一次简单的模型调用。一个生产系统需要持续接收行情与新闻,让不同智能体分别判断异常、核查证据、评估风险,并在任务中断后从最近状态继续执行。LangGraph、Strands 与 Amazon Bedrock AgentCore 的组合,正好对应这三个层次:LangGraph 管理确定性的工作流,Strands 承担智能体推理,AgentCor...
2026-07-28
来源: aws.amazon.com
42
传统检索增强生成(RAG)擅长回答“哪份文档提到了这个术语”,但面对需要横跨数百份报告进行比较、归因和趋势分析的任务时,很快会碰到上下文窗口、检索召回率和推理成本的共同上限。任务感知知识压缩(Task-Aware Knowledge Compression,TAKC)换了一个切入点:不要等到查询到来后再临时拼接文档,而是围绕明确任务,提前把整个知识库压...
2026-07-28
来源: aws.amazon.com
49
当 Deepgram 语音模型运行在客户自己的 Amazon SageMaker AI 环境中时,真正棘手的往往不是模型本身,而是支持工程师如何在不索取长期凭证、不过度开放权限的前提下,快速看到故障现场。 Deepgram 为此引入了基于 AWS IAM 的临时委派机制。按照其披露的结果,这项集成把 SageMaker AI 支持工单的初步调查时间从数...