2026-07-24
来源: aws.amazon.com
18
代码助手面对的输入和输出与普通问答不同:提示词可能包含源代码、配置文件和内部接口信息,模型输出则可能直接进入代码评审、构建流水线甚至生产环境。Amazon Bedrock Guardrails 可以作为代码生成工作流中的独立安全层,用于拦截或标记不合规内容,同时帮助团队更准确地评估调用量、延迟和处理容量。 关键不在于“给模型加一个过滤器”,而在于把 G...
2026-07-24
来源: blog.cloudflare.com
41
一个本应由边缘缓存直接返回的页面,有时会因为源站响应中的 或 被重新送回源站。麻烦在于,这些响应头可能来自旧框架、共享中间件或无法立即修改的托管服务。Cache Response Rules 提供了一个更合适的控制点:在响应进入缓存决策流程时修正这些头部,而不必先改造源站。 排查缓存未命中时,开发者通常先检查 URL、查询参数和缓存键。但缓存系统除了判...
2026-07-24
来源: azure.microsoft.com
27
AT&T 在开发 OTel2.0 的过程中处理了约一万亿个 Token。支撑这一规模的并非单一模型或单一 GPU,而是 Microsoft Foundry Managed Compute、开放模型,以及 AMD 和 NVIDIA GPU 基础设施组成的弹性计算体系。 这组信息揭示了大规模 AI 工程中的一个关键变化:当工作负载进入千亿乃至万亿 ...
2026-07-24
来源: aws.amazon.com
37
AI Agent 上线后,真正棘手的问题不是“能不能回答”,而是错误能否被稳定复现、自动发现并阻止进入生产环境。Motorway 与 AWS 构建的端到端评估流水线,将错误结果从每 8 次查询约 1 次降到每 50 次约 1 次,同时把问题发现时间从数小时缩短到几分钟。其核心组合是 Strands Agents SDK 与 Amazon Bedrock...
2026-07-24
来源: cloud.google.com
33
大模型强化学习后训练并不总是缺 GPU,很多时候真正的问题是 GPU 已经分配,却在等待下一阶段。同步 RL 在 rollout 采样与梯度训练之间严格交替;异步 RL 虽然允许两者重叠,训练器仍可能因新鲜轨迹不足而停顿。llm-d 引入的协作式时间切片把这些阶段变成可调度单元,让多个独立 RL 作业共享同一组物理加速器。 初步基准显示,这种平台级复用...
2026-07-24
来源: aws.amazon.com
26
交易前台并不缺数据,真正稀缺的是把分散的数据、制度文档和操作工具快速组织成可执行判断的能力。Jefferies 构建的交易助手没有把大语言模型当作一个独立聊天窗口,而是基于 Strands Agents 编排基础模型与外部工具,并结合 Amazon Bedrock、Amazon Bedrock Knowledge Bases 和模型上下文协议(MCP)...
2026-07-24
来源: aws.amazon.com
21
跨区域分析经常遇到一个矛盾:管理团队希望在同一张图中比较各区域的承运商表现,安全与合规团队却要求数据留在原始 AWS 区域。借助 QuickSight 的联合数据集能力与 Highcharts 自定义可视化,可以把“数据驻留”和“统一展示”拆成两个问题处理,并绕开原生图表在复杂组合图、交互和格式控制方面的限制。 这类方案的关键不是把所有原始记录复制到一...
2026-07-24
来源: aws.amazon.com
25
AI 智能体最棘手的生产事故,往往不会触发传统告警:接口返回 200、延迟正常、模型成功生成内容,最终结果却是错的。Amazon Bedrock AgentCore optimization 关注的正是这类“静默失败”,通过跨会话发现、解释并排序行为失败模式,帮助团队优先修复影响最大的缺陷。 传统服务监控擅长回答这些问题: 请求是否成功返回? 响应时间...
2026-07-24
来源: aws.amazon.com
37
传统 RAG 检索通常把用户问题编码成一个向量,再用它搜索知识库。这种方式处理单一事实问题很直接,但遇到包含多个约束、比较项或时间范围的复合问题时,一个查询向量很难同时准确表达所有意图。Amazon Bedrock Managed Knowledge Base 的 Agentic Retrieval 针对这一缺口,引入查询规划和流式执行,让检索过程能够...
2026-07-24
来源: cloud.google.com
21
企业把 AI 智能体推向生产时,真正卡住规模化的往往不是模型能力,而是数据能否提供可信的业务语境。智能体需要理解客户、订单、权限和业务规则,还要跨系统查询并执行操作。一次提示词就可能触发多轮检索、数据库查询和 API 调用,原本面向人工访问设计的数据平台,很容易在这种非线性负载下暴露延迟、成本和治理问题。 Google Cloud 在 Next 202...