Amazon Quick 推出智能目录体验:用自然语言连接数据资产与业务语义

2026-08-01 25 预计阅读时间: 1 分钟
来源: aws.amazon.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:7 分钟

Amazon Quick 新增 Agentic Catalog Experience,将 AI 工作流带入数据策展过程。数据管理员可以用自然语言查找上游目录资产,并基于已有元数据自动创建 Dataset 和 Topic,同时继承源资产中的业务语义。该能力目前处于预览阶段,支持 AWS Glue Data Catalog 和 Databricks Unity Catalog。

它缩短了哪一段数据链路

传统的数据消费流程通常横跨多个工具:先在数据目录中搜索表,再确认字段含义、负责人和更新频率,随后到分析平台创建数据集,最后手工配置面向业务用户的主题与术语。

Agentic Catalog Experience 试图把这些动作收敛为一个由自然语言驱动的工作流。例如,策展人员可以描述“寻找包含客户、订单金额和区域信息的已认证资产”,让系统发现候选上游资产,并据此创建 Amazon Quick 中的 Dataset 和 Topic。

真正重要的不只是少点几次鼠标,而是语义可以沿着链路传递。字段名称、业务描述以及目录中已有的语义信息不必全部重新录入,这有助于减少数据目录与分析层之间的定义漂移。

不过,“继承语义”不等于自动保证语义正确。如果上游目录中的描述已经过时、字段存在歧义,或者不同团队对同一指标采用了不同口径,AI 工作流仍可能把这些问题带到下游。

Dataset 与 Topic 承担不同职责

在这条工作流中,可以把两个产物理解为不同层次:

  • Dataset 连接并组织可分析的数据资产,决定分析可以使用哪些表、字段和关系。
  • Topic 面向自然语言问答和业务表达,承载用户更容易理解的术语与语义。

因此,目录资产的质量会直接影响后续体验。order_total 如果只有字段名而没有币种、税费范围和退款处理规则,即使成功进入 Dataset,也很难让业务用户得到稳定答案。相反,包含清晰描述、负责人、敏感级别和更新周期的目录资产,更适合作为自动化策展的输入。

在接入预览能力前检查 Glue 元数据

下面的命令不是 Agentic Catalog Experience 的调用接口,而是一种可以这样实践的接入前检查:使用 AWS CLI 导出 Glue Data Catalog 中某个数据库的表和字段描述,快速找出缺少语义信息的资产。

运行前需要安装并配置 AWS CLI,同时把 analyticsus-east-1 改成自己的 Glue 数据库与区域。若安装了 jq,可以直接生成便于审查的 JSON:

DB_NAME="analytics"
AWS_REGION="us-east-1"

aws glue get-tables \
  --database-name "$DB_NAME" \
  --region "$AWS_REGION" \
  --output json \
| jq '[.TableList[] | {
    table: .Name,
    description: (.Description // ""),
    columns: [.StorageDescriptor.Columns[]? | {
      name: .Name,
      type: .Type,
      comment: (.Comment // "")
    }]
  }]'

还可以把缺少表描述或字段注释的对象单独筛出来:

DB_NAME="analytics"
AWS_REGION="us-east-1"

aws glue get-tables \
  --database-name "$DB_NAME" \
  --region "$AWS_REGION" \
  --output json \
| jq -r '
  .TableList[]
  | select(
      (.Description // "") == ""
      or any(.StorageDescriptor.Columns[]?; (.Comment // "") == "")
    )
  | .Name
'

对于候选资产,团队还可以维护一份最小语义验收清单。下面是可按现有治理系统改造的 YAML 示例,并非 Amazon Quick 的官方配置格式:

asset: analytics.customer_orders
owner: data-commerce@example.com
description: One row per completed customer order
refresh_frequency: hourly
certification: approved
business_terms:
  order_total:
    meaning: Amount charged after discounts and before refunds
    currency: USD
  customer_region:
    meaning: Sales region assigned at checkout
sensitive_fields:
  - customer_email

这份检查的目的不是复制目录,而是在自动创建 Dataset 和 Topic 之前确认源语义是否足够完整、明确且可追责。

预览阶段应保留人工闸门

团队可以先选择一个定义稳定、访问边界清晰的数据域试用,例如销售订单或库存,而不是直接覆盖整个企业目录。落地时重点检查以下事项:

  1. 候选资产是否来自预期的 Glue Data Catalog 或 Unity Catalog 范围。
  2. 自动生成的 Dataset 是否选择了正确字段,并保持预期的数据粒度。
  3. Topic 中的业务术语、同义词和指标定义是否符合团队口径。
  4. 敏感字段、行列级权限和目录访问策略是否继续生效。
  5. 上游 schema 或描述变化后,继承的语义如何复核与更新。
  6. 发布前是否由数据所有者或领域专家审批。

Agentic Catalog Experience 的价值在于压缩“发现资产、理解资产、创建分析入口”之间的距离。它能否稳定进入生产流程,则取决于目录质量、权限治理和人工审核机制。预览期间最合理的目标不是完全无人值守,而是把策展人员从重复录入中释放出来,同时保留对业务语义的最终控制权。


相关推荐