AI 精选工程笔记

技术摘要

AI 精选与摘要技术文章、编程实践和人工智能新闻。

---

生产环境中的 Agent 生命周期监控:用 AgentCore Evaluations 与 AWS DevOps Agent 构建双层闭环

来源: aws.amazon.com 17
多 Agent 系统上线后,故障通常不只是“服务是否存活”。一个航空订票系统可能返回了 HTTP 200,却把乘客引导到错误的航班;某个 Agent 可能因为工具调用延迟变高而反复重试,最终拖慢整个预订流程。传统的 CPU、内存和错误率监控,很难回答这些问题。 这类系统需要两层监控:一层持续衡量 Agent 的回答质量和行为表现,另一层负责调查承载 A...

别只看每百万 Token 价格:如何为 Amazon Bedrock 选择合适的 OpenAI 模型

来源: aws.amazon.com 27
在 Amazon Bedrock 上比较 OpenAI 模型时,只看每百万 Token 的单价,很容易得到一个看似精确、实际不够有用的结论。生产系统真正承担的成本,通常还包括重试、人工复核、工具调用、上下文长度,以及模型是否一次就能交付正确结果。 更可靠的评估方式,是把价格放回业务结果中:每个正确答案花了多少钱?一次 Agent 任务完整轨迹消耗了多少...

用 Amazon Bedrock AgentCore 构建可交互的 MCP Apps

来源: aws.amazon.com 20
MCP Apps 让模型调用工具的结果不再局限于纯文本。通过交互式 HTML widget,同一个 MCP Server 可以把表单、筛选器、图表或审批控件交给 AI Host 渲染,让用户直接在对话界面中完成操作。 这套能力的关键在于:MCP Apps 是与 Host 解耦的标准扩展。只要 ChatGPT、Claude 或其他 AI Host 支持对...

用 Helion 与 Hugging Face Kernels 构建、调优并分发高性能 GPU Kernel

来源: pytorch.org 17
Hugging Face Kernels 项目加入 Helion 支持后,GPU Kernel 的开发链路变得更完整:开发者可以用更接近 Python 和 PyTorch 的方式描述计算,通过自动调优寻找适合当前硬件与输入形状的配置,再借助 Hugging Face Kernels 进行打包和分发。重点不只是“写出一个能运行的 Kernel”,而是让它...

NVIDIA PAIR:把局域网里的多台电脑变成个人 AI 推理池

来源: infoq.com 23
NVIDIA Personal AI Router(PAIR)现已进入 Beta 阶段。它的目标不是让某一张 GPU 突然拥有更多显存,而是把局域网中多台电脑的推理能力组织起来,自动将 AI 请求分发到合适的节点。对于会同时触发多个模型调用的本地多智能体系统,这种调度方式尤其有价值:规划、检索、编码和审查任务不必再排队挤占同一张 GPU。 理解 PAI...

NVIDIA PAIR:把局域网里的多台电脑变成 AI 推理资源池

来源: infoq.com 20
本地 AI 的瓶颈不总是模型太大,也可能是请求太多。单个智能体运行顺畅,并不代表研究、编码、检索等多个智能体同时工作时,一张 GPU 还能稳定响应。处于 Beta 阶段的 NVIDIA Personal AI Router(PAIR)试图解决这个问题:汇集局域网内多台计算机的推理能力,并自动把 AI 请求分配给它们。 PAIR 最适合多个相互独立的模型...

Netflix 如何让 Conductor 承载 4.2 亿次月度工作流执行

来源: infoq.com 32
当工作流从几百个任务增长到数万个任务时,瓶颈通常不在某一台机器的 CPU,而在元数据读写、调度评估和并发控制之间的耦合。Netflix 对 Conductor 4.0 的重构,正是围绕这个问题展开:支持的工作流规模从约 2,500 个任务提升到 30,000 个任务,同时将工作流评估的 p99 延迟降低了约 40%,以支撑每月约 4.2 亿次工作流执行...

从零样本预测到采购订单:用 Amazon Bedrock AgentCore 编排需求决策

来源: aws.amazon.com 30
需求预测真正难的地方,通常不是生成一个数字,而是把这个数字变成一张可解释、可校验、可追溯的采购订单。将 Amazon Chronos2 的零样本预测能力与 Amazon Bedrock AgentCore 的多智能体编排结合起来,可以搭建一条从历史销量到采购建议的自动化链路:不必为每个商品单独训练模型,同时把库存策略、供应商约束、审批规则和审计记录放进...

用 Cloudflare CASB 自动修复 SaaS 风险:从事件触发到撤销共享

来源: blog.cloudflare.com 32
SaaS 风险治理的难点,往往不在于发现问题,而在于发现之后能否及时处理。Cloudflare CASB 的自动修复策略把事件驱动逻辑直接放到 Cloudflare 开发者平台中,让安全团队可以针对高风险 SaaS 事件自动撤销文件共享,并通过 Webhook 通知其他系统,减少人工介入和风险暴露时间。 传统 CASB 流程通常是:扫描 SaaS 应用...

tsgolint v7 稳定版:让 Oxlint 获得 Go 驱动的 TypeScript 类型感知检查

来源: infoq.com 27
TypeScript lint 的性能瓶颈,往往不在语法扫描,而在类型信息构建。只看 AST 的规则可以很快,但一旦规则需要判断 Promise 是否被处理、类型断言是否安全,或两个表达式在语义上是否兼容,就必须借助 TypeScript 编译器的语义分析。 tsgolint v7 已进入稳定阶段,它通过 编译器提供类型语义,并把这部分能力接入 Oxl...