Amazon Quick 新增 Agentic Catalog Experience,将 AI 工作流带入数据策展过程。数据管理员可以用自然语言查找上游目录资产,并基于已有元数据自动创建 Dataset 和 Topic,同时继承源资产中的业务语义。该能力目前处于预览阶段,支持 AWS Glue Data Catalog 和 Databricks Unity Catalog。
它缩短了哪一段数据链路
传统的数据消费流程通常横跨多个工具:先在数据目录中搜索表,再确认字段含义、负责人和更新频率,随后到分析平台创建数据集,最后手工配置面向业务用户的主题与术语。
Agentic Catalog Experience 试图把这些动作收敛为一个由自然语言驱动的工作流。例如,策展人员可以描述“寻找包含客户、订单金额和区域信息的已认证资产”,让系统发现候选上游资产,并据此创建 Amazon Quick 中的 Dataset 和 Topic。
真正重要的不只是少点几次鼠标,而是语义可以沿着链路传递。字段名称、业务描述以及目录中已有的语义信息不必全部重新录入,这有助于减少数据目录与分析层之间的定义漂移。
不过,“继承语义”不等于自动保证语义正确。如果上游目录中的描述已经过时、字段存在歧义,或者不同团队对同一指标采用了不同口径,AI 工作流仍可能把这些问题带到下游。
Dataset 与 Topic 承担不同职责
在这条工作流中,可以把两个产物理解为不同层次:
- Dataset 连接并组织可分析的数据资产,决定分析可以使用哪些表、字段和关系。
- Topic 面向自然语言问答和业务表达,承载用户更容易理解的术语与语义。
因此,目录资产的质量会直接影响后续体验。order_total 如果只有字段名而没有币种、税费范围和退款处理规则,即使成功进入 Dataset,也很难让业务用户得到稳定答案。相反,包含清晰描述、负责人、敏感级别和更新周期的目录资产,更适合作为自动化策展的输入。
在接入预览能力前检查 Glue 元数据
下面的命令不是 Agentic Catalog Experience 的调用接口,而是一种可以这样实践的接入前检查:使用 AWS CLI 导出 Glue Data Catalog 中某个数据库的表和字段描述,快速找出缺少语义信息的资产。
运行前需要安装并配置 AWS CLI,同时把 analytics 和 us-east-1 改成自己的 Glue 数据库与区域。若安装了 jq,可以直接生成便于审查的 JSON:
DB_NAME="analytics"
AWS_REGION="us-east-1"
aws glue get-tables \
--database-name "$DB_NAME" \
--region "$AWS_REGION" \
--output json \
| jq '[.TableList[] | {
table: .Name,
description: (.Description // ""),
columns: [.StorageDescriptor.Columns[]? | {
name: .Name,
type: .Type,
comment: (.Comment // "")
}]
}]'
还可以把缺少表描述或字段注释的对象单独筛出来:
DB_NAME="analytics"
AWS_REGION="us-east-1"
aws glue get-tables \
--database-name "$DB_NAME" \
--region "$AWS_REGION" \
--output json \
| jq -r '
.TableList[]
| select(
(.Description // "") == ""
or any(.StorageDescriptor.Columns[]?; (.Comment // "") == "")
)
| .Name
'
对于候选资产,团队还可以维护一份最小语义验收清单。下面是可按现有治理系统改造的 YAML 示例,并非 Amazon Quick 的官方配置格式:
asset: analytics.customer_orders
owner: data-commerce@example.com
description: One row per completed customer order
refresh_frequency: hourly
certification: approved
business_terms:
order_total:
meaning: Amount charged after discounts and before refunds
currency: USD
customer_region:
meaning: Sales region assigned at checkout
sensitive_fields:
- customer_email
这份检查的目的不是复制目录,而是在自动创建 Dataset 和 Topic 之前确认源语义是否足够完整、明确且可追责。
预览阶段应保留人工闸门
团队可以先选择一个定义稳定、访问边界清晰的数据域试用,例如销售订单或库存,而不是直接覆盖整个企业目录。落地时重点检查以下事项:
- 候选资产是否来自预期的 Glue Data Catalog 或 Unity Catalog 范围。
- 自动生成的 Dataset 是否选择了正确字段,并保持预期的数据粒度。
- Topic 中的业务术语、同义词和指标定义是否符合团队口径。
- 敏感字段、行列级权限和目录访问策略是否继续生效。
- 上游 schema 或描述变化后,继承的语义如何复核与更新。
- 发布前是否由数据所有者或领域专家审批。
Agentic Catalog Experience 的价值在于压缩“发现资产、理解资产、创建分析入口”之间的距离。它能否稳定进入生产流程,则取决于目录质量、权限治理和人工审核机制。预览期间最合理的目标不是完全无人值守,而是把策展人员从重复录入中释放出来,同时保留对业务语义的最终控制权。