2026-07-24
来源: blog.cloudflare.com
41
一个本应由边缘缓存直接返回的页面,有时会因为源站响应中的 或 被重新送回源站。麻烦在于,这些响应头可能来自旧框架、共享中间件或无法立即修改的托管服务。Cache Response Rules 提供了一个更合适的控制点:在响应进入缓存决策流程时修正这些头部,而不必先改造源站。 排查缓存未命中时,开发者通常先检查 URL、查询参数和缓存键。但缓存系统除了判...
2026-07-24
来源: aws.amazon.com
37
AI Agent 上线后,真正棘手的问题不是“能不能回答”,而是错误能否被稳定复现、自动发现并阻止进入生产环境。Motorway 与 AWS 构建的端到端评估流水线,将错误结果从每 8 次查询约 1 次降到每 50 次约 1 次,同时把问题发现时间从数小时缩短到几分钟。其核心组合是 Strands Agents SDK 与 Amazon Bedrock...
2026-07-24
来源: cloud.google.com
33
大模型强化学习后训练并不总是缺 GPU,很多时候真正的问题是 GPU 已经分配,却在等待下一阶段。同步 RL 在 rollout 采样与梯度训练之间严格交替;异步 RL 虽然允许两者重叠,训练器仍可能因新鲜轨迹不足而停顿。llm-d 引入的协作式时间切片把这些阶段变成可调度单元,让多个独立 RL 作业共享同一组物理加速器。 初步基准显示,这种平台级复用...
2026-07-24
来源: aws.amazon.com
26
交易前台并不缺数据,真正稀缺的是把分散的数据、制度文档和操作工具快速组织成可执行判断的能力。Jefferies 构建的交易助手没有把大语言模型当作一个独立聊天窗口,而是基于 Strands Agents 编排基础模型与外部工具,并结合 Amazon Bedrock、Amazon Bedrock Knowledge Bases 和模型上下文协议(MCP)...
2026-07-24
来源: aws.amazon.com
25
AI 智能体最棘手的生产事故,往往不会触发传统告警:接口返回 200、延迟正常、模型成功生成内容,最终结果却是错的。Amazon Bedrock AgentCore optimization 关注的正是这类“静默失败”,通过跨会话发现、解释并排序行为失败模式,帮助团队优先修复影响最大的缺陷。 传统服务监控擅长回答这些问题: 请求是否成功返回? 响应时间...
2026-07-24
来源: aws.amazon.com
37
传统 RAG 检索通常把用户问题编码成一个向量,再用它搜索知识库。这种方式处理单一事实问题很直接,但遇到包含多个约束、比较项或时间范围的复合问题时,一个查询向量很难同时准确表达所有意图。Amazon Bedrock Managed Knowledge Base 的 Agentic Retrieval 针对这一缺口,引入查询规划和流式执行,让检索过程能够...
2026-07-24
来源: cloud.google.com
21
企业把 AI 智能体推向生产时,真正卡住规模化的往往不是模型能力,而是数据能否提供可信的业务语境。智能体需要理解客户、订单、权限和业务规则,还要跨系统查询并执行操作。一次提示词就可能触发多轮检索、数据库查询和 API 调用,原本面向人工访问设计的数据平台,很容易在这种非线性负载下暴露延迟、成本和治理问题。 Google Cloud 在 Next 202...
2026-07-24
来源: cloud.google.com
32
餐厅电话一响,漏接可能意味着订单流失;医疗机构接到预约电话时,任何一个字段错误都可能影响后续服务。Voicify 的实践说明,企业级语音助手并不只是把大语言模型接到电话系统上,而是要同时解决交易准确性、流量尖峰、响应延迟以及安全合规问题。 Voicify 成立于 2018 年,最初希望为电话、聊天等渠道构建实用的语音驱动助手。疫情期间,团队将重点转向餐...
2026-07-23
来源: infoq.com
22
生产事故排查通常不是“没有数据”,而是数据分散在日志、指标、链路追踪和事件记录中。工程师需要在高压状态下快速建立时间线、筛选异常服务,并判断哪些信号最可能指向根因。Expedia Group 引入的内部平台 STAR,正是围绕这一过程构建的 AI 辅助可观测性工具。 STAR 将服务遥测数据、结构化调查流程和大语言模型结合起来,帮助工程师分析生产事故、...
2026-07-23
来源: infoq.com
40
生产事故调查最耗时的部分,往往不是查看某一张监控图,而是在日志、指标、链路追踪和部署记录之间反复切换,并把零散信号整理成可验证的故障假设。Expedia Group 推出的内部平台 STAR,尝试用结构化工作流和大模型缩短这一过程,同时保留工程师对结论的审核权。 根据公开摘要,STAR 使用 FastAPI、Datadog、Celery、Redis 和...