标签

机器学习

用 Agent-EvalKit 系统化评估你的 AI Agent

来源: aws.amazon.com 59
AI Agent 越来越多,但"它到底好不好用"这件事,大多数团队还在靠手动试几个场景、凭感觉判断。Agent-EvalKit 这个 Apache 2.0 开源工具包,试图把 Agent 评估从"拍脑袋"变成"有流程、有数据、可复现"的工程实践。它已经对接了 Claude Code、Kiro CLI、Kilo Code 等主流 AI 编码助手,并提供了...

QuickSight 新能力:迷你趋势图 + 控件自定义排序,让仪表盘更"决策就绪"

来源: aws.amazon.com 46
Amazon QuickSight 最近上线了两项功能——Sparklines(迷你趋势图) 和 Custom Sort for Controls(控件自定义排序)。它们分别解决两个长期痛点:表格里看不出趋势走向,筛选器里业务维度总是按字母排而不是按逻辑排。两个功能看似独立,组合起来却能让仪表盘从"展示数据"升级为"驱动决策"。 Sparklines ...

用示例文档几分钟内优化 Amazon Bedrock Data Automation 的蓝图提取精度

来源: aws.amazon.com 59
从非结构化文档中提取字段,蓝图(Blueprint)是核心配置——它告诉 BDA 你要抽什么、怎么抽。但写好蓝图指令并不容易:一条模糊的指令可能导致字段漏抽、值偏移、格式混乱。过去要修正这些问题,往往需要反复调整指令文本、跑测试集、人工比对,周期以周计。 Amazon BDA 现在提供了 蓝图指令优化(Blueprint Instruction Opt...

前沿团队正在重塑 AI 原生开发:不只是写代码更快

来源: aws.amazon.com 61
"用 AI 写代码更快"——这是大多数团队对 AI 辅助开发的全部理解。但真正走在前面的团队已经不满足于让 Copilot 自动补全几行代码了。他们正在重新设计软件的构建方式本身,从需求定义到代码生成、从测试策略到团队分工,整个流程都在被重构。结果是:4.5 倍的生产力提升,部分场景甚至超过 10 倍。 这不是夸张的营销数字,而是那些把 AI 当作"开...

用 Helion 让 vLLM 的 FP8 推理内核跨 GPU 架构跑起来

来源: pytorch.org 54
大模型推理的算力瓶颈从来不在模型本身,而在底层 kernel。vLLM 社区长期依赖手写 CUDA kernel 来榨取 GPU 性能,但每换一代硬件就得重写一遍——H100 上的优化到了 B200 可能就不再是最优路径。Helion 的思路很直接:用 PyTorch 原生的方式写 kernel,让同一份代码在 H100 和 B200 上都能跑出接近手...

用 Amazon Bedrock AgentCore 搭一个农机维修 AI 助手

来源: aws.amazon.com 43
田间地头,拖拉机突然熄火,农民翻遍手册也找不到故障原因——这种场景比我们想象的更常见。设备维修的痛点一直很明确:技术文档分散、专业术语晦涩、现场人员经验参差不齐。Amazon Bedrock AgentCore 的出现,让"对着机器说句话就能定位问题"这件事变得可落地了。 这篇文章拆解一个完整方案:用 AgentCore Runtime + Stran...

用 SageMaker AI 搭 NVIDIA Isaac Lab,给 Unitree H1 人形机器人练强化学习策略

来源: aws.amazon.com 50
人形机器人的强化学习(RL)训练瓶颈不在算法,而在算力——一次策略迭代需要数百万步仿真,单机 GPU 根本撑不住。NVIDIA Isaac Lab 提供高并行仿真环境,Amazon SageMaker AI 则给出两种弹性算力方案:Training Jobs 按次启动、HyperPod 长驻集群。把两者拼起来,H1 人形机器人的策略训练就能从"实验室跑...

免手操理赔报案:用 Strands Agents 与 Bedrock AgentCore Browser Tool 搭建智能 FNOL 流程

来源: aws.amazon.com 58
保险理赔的第一报案(FNOL,First Notice of Loss)是整个理赔链条的起点,也是最耗人力的环节之一。报案员需要一边听客户描述事故,一边在多个门户系统中录入信息、查询保单、校验字段——手眼并用,重复劳动密集。AWS 最近展示了一种新思路:用 Strands Agents SDK 做领域推理,用 Amazon Bedrock AgentC...

用 Amazon Q + New Relic MCP 搭建值班事故分拣 Agent

来源: aws.amazon.com 55
凌晨两点,PagerDuty 响了。你爬起来打开 New Relic 看仪表盘、翻日志、查部署记录、在 Slack 里同步进展、最后还要在 Asana 里建任务留档——整套流程走完,半小时过去了,其中大部分时间花在"找信息"而不是"做判断"上。 Amazon Q 的 Agent 能力加上 New Relic 的 MCP Server,可以把这套"人肉串...