标签

机器学习

用三道防线构建多租户 LLM 分析系统:SigV4、语义校验与行级隔离

来源: aws.amazon.com 37
多租户分析系统接入 LLM 后,最危险的变化不是“模型会不会答错”,而是“模型会不会被诱导越权”。如果一个租户通过自然语言问出了另一个租户的数据,传统的应用层权限判断很容易被 prompt injection、工具调用参数污染或 SQL 生成错误绕过。 PAR 的做法值得关注:他们把安全边界拆成三层,而且每一层都独立工作。请求入口用 AWS SigV4...

用 Amazon Bedrock 和 AWS HealthLake 搭建智能理赔流水线

来源: aws.amazon.com 34
医疗理赔处理最怕两件事:表单信息散落在 PDF、扫描件和附件里,人工录入又慢又容易出错。这个方案的核心变化是把“读单据、抽字段、校验、转成标准医疗数据”串成一条自动化流水线:Amazon Bedrock Data Automation 负责从理赔表单中提取结构化信息,Amazon Bedrock AgentCore 托管 AI Agent 来做校验和转...

用 Amazon Bedrock AgentCore Observability 排查生产 Agent 故障

来源: aws.amazon.com 25
Agent 进入生产环境后,最难处理的不是“模型答错了”这种显性问题,而是它为什么反复调用同一个工具、为什么一次工具调用没有返回、为什么用户看到超时但后端日志看起来正常。Amazon Bedrock AgentCore Observability 的价值就在这里:把 Agent 的执行轨迹、工具调用和运行指标放到同一个可分析的上下文里,让排障从猜测变成...

PyTorch 用 CRCR 把下游后端 CI 接进主仓库节奏

来源: pytorch.org 28
PyTorch 新引入的 Cross-Repository CI Relay,简称 CRCR,解决的是一个很现实的问题:当 的 PR 打开或提交更新时,树外后端仓库也需要尽早知道这次变化会不会把自己打坏。过去这类验证往往靠人工触发、定期同步或维护者事后排查;CRCR 的目标是把“主仓库变化”和“下游仓库 CI”连成一条自动链路,并能追踪结果。 PyTo...

用按需与批量推理动态切换,构建弹性文档抽取管线

来源: aws.amazon.com 37
处理海量文档时,你总会面对一个矛盾:实时场景要求秒级响应,离线场景则更在意成本控制。Amazon Bedrock 同时提供了按需推理(On-demand)和批量推理(Batch)两种调用模式,但多数人只用了其中一种。把两者组合成一条动态切换的管线,才能在延迟和费用之间找到最优解。 Bedrock 的按需推理是同步调用——请求发出后等待模型返回结果,适合...

用 Agent-EvalKit 系统化评估你的 AI Agent

来源: aws.amazon.com 40
AI Agent 越来越多,但"它到底好不好用"这件事,大多数团队还在靠手动试几个场景、凭感觉判断。Agent-EvalKit 这个 Apache 2.0 开源工具包,试图把 Agent 评估从"拍脑袋"变成"有流程、有数据、可复现"的工程实践。它已经对接了 Claude Code、Kiro CLI、Kilo Code 等主流 AI 编码助手,并提供了...

QuickSight 新能力:迷你趋势图 + 控件自定义排序,让仪表盘更"决策就绪"

来源: aws.amazon.com 32
Amazon QuickSight 最近上线了两项功能——Sparklines(迷你趋势图) 和 Custom Sort for Controls(控件自定义排序)。它们分别解决两个长期痛点:表格里看不出趋势走向,筛选器里业务维度总是按字母排而不是按逻辑排。两个功能看似独立,组合起来却能让仪表盘从"展示数据"升级为"驱动决策"。 Sparklines ...

用示例文档几分钟内优化 Amazon Bedrock Data Automation 的蓝图提取精度

来源: aws.amazon.com 46
从非结构化文档中提取字段,蓝图(Blueprint)是核心配置——它告诉 BDA 你要抽什么、怎么抽。但写好蓝图指令并不容易:一条模糊的指令可能导致字段漏抽、值偏移、格式混乱。过去要修正这些问题,往往需要反复调整指令文本、跑测试集、人工比对,周期以周计。 Amazon BDA 现在提供了 蓝图指令优化(Blueprint Instruction Opt...

前沿团队正在重塑 AI 原生开发:不只是写代码更快

来源: aws.amazon.com 47
"用 AI 写代码更快"——这是大多数团队对 AI 辅助开发的全部理解。但真正走在前面的团队已经不满足于让 Copilot 自动补全几行代码了。他们正在重新设计软件的构建方式本身,从需求定义到代码生成、从测试策略到团队分工,整个流程都在被重构。结果是:4.5 倍的生产力提升,部分场景甚至超过 10 倍。 这不是夸张的营销数字,而是那些把 AI 当作"开...

用 Helion 让 vLLM 的 FP8 推理内核跨 GPU 架构跑起来

来源: pytorch.org 36
大模型推理的算力瓶颈从来不在模型本身,而在底层 kernel。vLLM 社区长期依赖手写 CUDA kernel 来榨取 GPU 性能,但每换一代硬件就得重写一遍——H100 上的优化到了 B200 可能就不再是最优路径。Helion 的思路很直接:用 PyTorch 原生的方式写 kernel,让同一份代码在 H100 和 B200 上都能跑出接近手...