Data Agent Kit 正式 GA:让编码智能体直接理解 Google Cloud 数据环境

2026-09-30 13 预计阅读时间: 1 分钟
来源: cloud.google.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:11 分钟

编码智能体早已能生成 SQL、PySpark 和流水线代码,真正拖慢开发的往往不是语法,而是环境上下文:有哪些表、分区键是什么、团队认可哪份数据、昨晚的任务为何失败。Google Cloud Data Agent Kit 现已正式 GA,通过 MCP 工具和开源技能,把这些上下文带给 Claude Code、Codex、Antigravity 以及 VS Code 兼容编辑器中的智能体。

这次 GA 不只是扩大服务列表,还新增了 BigQuery Graph、Bigtable,以及通过 Managed Service for Apache Spark 访问开放 Lakehouse 的能力。对数据团队而言,它更像一层连接智能体与真实云环境的受控操作面,而不只是又一个聊天窗口。

两层能力:连接环境,再教会智能体如何工作

Data Agent Kit 的核心可以拆成两部分。

MCP 工具负责连接。 它覆盖 15 种以上的 Google Data Cloud 服务,让智能体能够检查 Schema、运行查询、读取作业日志和管理资源。这样,开发者不必反复复制表结构、错误堆栈和任务配置到对话框里。

Google 编写的技能负责方法。 这些开源指令告诉智能体如何优化 BigQuery SQL、设计 Bigtable Row Key、构建 dbt 模型,或者排查 Spark 与 Airflow 任务。工具回答“能访问什么”,技能回答“应该怎样做”。

这一区分很重要。单纯给模型数据库权限,只会让它更方便地执行猜测;把实时元数据、操作工具和领域规则放在一起,智能体才有机会先检查事实,再提出方案。

例如,当用户要求预测热销商品下月需求并核对库存时,智能体可以先通过 Knowledge Catalog 查找团队信任的销售与库存表,再在 BigQuery 中完成预测、到 AlloyDB for PostgreSQL 查询库存,最后把结果带回编辑器。所有步骤仍使用当前用户权限,或者使用用户模拟的服务账号权限。

GA 新能力覆盖图、实时数据库与开放 Lakehouse

BigQuery Graph:先验证关系,再创建图

属性图适合分析共同购买、供应链连接和实体关系,但手写 CREATE PROPERTY GRAPH DDL、学习 GQL、确认边对应的键并不轻松。

GA 提供的 bigquery-graph-author 技能可以把关系表映射为节点和边,并使用实际数据检查候选关系。创建资源前,智能体会展示计划供开发者批准;已有 ER 图或数据模型也可以作为起点。图创建后,bigquery-graph-query 技能负责生成 GQL,IDE 中的可视化工具则用于浏览查询结果。

这里最值得保留的流程不是“让智能体自动建图”,而是“生成方案—验证关系—人工批准—执行创建”。关系键选错会放大为错误图结构,因此审批步骤不应省略。

Bigtable:从访问模式反推 Row Key

Bigtable 适合个性化信息流、实时计数器和最近浏览记录等低延迟场景,但它对 Row Key 设计非常敏感。新的 bigtable-basics 技能会围绕读取方式设计 Schema,并在创建前提示热点和全表扫描风险。

智能体还可以创建表并使用 GoogleSQL 查询。列族会被展开为更易读的列,开发者也能在 IDE 的目录浏览器中查看实例和表。需要注意,智能体能协助评审 Row Key,不代表可以跳过容量、访问分布和峰值流量测试。

Spark 与 Iceberg:同一批表,多种计算入口

Data Agent Kit 原本可以通过 BigQuery 查询 Lakehouse 中的 Apache Iceberg 表;GA 后,同一批表也能交给 Managed Service for Apache Spark 处理,无需自行维护集群。

Spark 会话可以保留状态,因此临时视图能够跨语句使用,同时支持 Iceberg 的分支、时间旅行和 Schema 演进。federate-lakehouse-catalog 技能还可连接 AWS Glue 和 Databricks Unity Catalog,让智能体尝试就地查询数据,而不是先搭建一条复制数据的摄取流水线。

跨云联邦查询虽然减少搬运,但仍要评估网络、权限、延迟和扫描成本。适合探索的方案,不一定适合高频生产任务。

动手安装:选择一个编码智能体即可

下面三组命令分别对应不同客户端,只运行你正在使用的那一组。执行前需要安装并登录相应的 CLI。

# Antigravity CLI
agy plugin install https://github.com/GoogleCloudPlatform/data-agent-kit-plugin

# Claude Code
claude plugin install data-agent-kit-starter-pack@claude-plugins-official

# Codex CLI:依次执行两条命令
codex plugin marketplace add GoogleCloudPlatform/data-agent-kit-plugin
codex plugin add dak@dak-marketplace

如果使用 VS Code、Cursor 或其他 VS Code 兼容编辑器,可以在扩展面板中搜索 Google Cloud Data Agent Kit。Cloud Shell 和 Cloud Workstations 已预装,只需打开编辑器并登录。初始化时选择实际使用的 Google Cloud 服务,工具会处理所需 API、技能和 MCP Server 配置。

安装后,可以从一个只读分析任务开始:

使用 BigQuery 公共 Google Trends 数据集,找出本周在美国增长最快、但未进入上周前十名的搜索词。

执行要求:
1. 先确认数据集、表、字段和日期范围;
2. 展示准备执行的 SQL;
3. 检查分区键并先做 dry run;
4. 估算扫描量,得到我的确认后再运行;
5. 返回结果,同时说明排名和增长率的计算方式。

这类提示词比一句“帮我查趋势”更适合生产环境:它要求智能体先检查元数据和成本,再执行查询,并把计算口径明确写出来。

流水线故障也可以采用同样思路:

诊断当前失败的 Airflow DAG。先读取失败任务及相关日志,给出根因、证据和最小修改方案。不要直接修改或重新运行任务;等我批准补丁后再执行。

Data Agent Kit 能把成功的逻辑转换成 dbt 或 Dataform 模型,并通过 Managed Service for Apache Airflow 编排。任务失败时,诊断功能可以把日志交给智能体,由 Spark 或 Airflow 排障技能追踪根因。不过,“建议修复”和“自动上线”应保持为两个不同权限阶段。

企业落地时,权限和成本仍是硬边界

Data Agent Kit 本身不额外收费,但查询、数据库、Spark 和编排等底层 Google Cloud 服务仍按标准价格计费。技能会引导智能体检查分区键、执行 BigQuery dry run,避免意外全表扫描,但团队不应只依赖提示词控制成本。

访问控制方面,智能体以用户身份或用户模拟的服务账号连接,因此现有行级与列级安全策略会继续生效。管理员还可以使用 IAM 管理 MCP 访问,通过 Model Armor 检查 MCP 流量,并使用 VPC Service Controls 与 Principal Access Boundary 缩小可访问范围。

推荐按以下顺序采用:

  • 从只读目录浏览、Schema 检查和查询 dry run 开始;
  • 为开发、测试和生产环境配置不同身份;
  • 将建表、改 Schema、启动昂贵任务和部署流水线设为人工审批动作;
  • 给 BigQuery 扫描、Spark 运行和数据库操作设置预算与告警;
  • 审计并按团队规范分叉开源技能,例如强制分区过滤或禁止生产环境全表扫描;
  • 记录智能体调用的工具、提交的 SQL、资源变更和审批人。

Data Agent Kit 的价值不在于让智能体“拥有更多权限”,而在于让它在真实元数据、团队规则和现有权限边界内工作。把它当作受审计的数据工程协作者,而不是无人监管的数据库管理员,才能真正减少上下文搬运,同时避免把一次错误推理变成昂贵的生产操作。


相关推荐