编码智能体早已能生成 SQL、PySpark 和流水线代码,真正拖慢开发的往往不是语法,而是环境上下文:有哪些表、分区键是什么、团队认可哪份数据、昨晚的任务为何失败。Google Cloud Data Agent Kit 现已正式 GA,通过 MCP 工具和开源技能,把这些上下文带给 Claude Code、Codex、Antigravity 以及 VS Code 兼容编辑器中的智能体。
这次 GA 不只是扩大服务列表,还新增了 BigQuery Graph、Bigtable,以及通过 Managed Service for Apache Spark 访问开放 Lakehouse 的能力。对数据团队而言,它更像一层连接智能体与真实云环境的受控操作面,而不只是又一个聊天窗口。
两层能力:连接环境,再教会智能体如何工作
Data Agent Kit 的核心可以拆成两部分。
MCP 工具负责连接。 它覆盖 15 种以上的 Google Data Cloud 服务,让智能体能够检查 Schema、运行查询、读取作业日志和管理资源。这样,开发者不必反复复制表结构、错误堆栈和任务配置到对话框里。
Google 编写的技能负责方法。 这些开源指令告诉智能体如何优化 BigQuery SQL、设计 Bigtable Row Key、构建 dbt 模型,或者排查 Spark 与 Airflow 任务。工具回答“能访问什么”,技能回答“应该怎样做”。
这一区分很重要。单纯给模型数据库权限,只会让它更方便地执行猜测;把实时元数据、操作工具和领域规则放在一起,智能体才有机会先检查事实,再提出方案。
例如,当用户要求预测热销商品下月需求并核对库存时,智能体可以先通过 Knowledge Catalog 查找团队信任的销售与库存表,再在 BigQuery 中完成预测、到 AlloyDB for PostgreSQL 查询库存,最后把结果带回编辑器。所有步骤仍使用当前用户权限,或者使用用户模拟的服务账号权限。
GA 新能力覆盖图、实时数据库与开放 Lakehouse
BigQuery Graph:先验证关系,再创建图
属性图适合分析共同购买、供应链连接和实体关系,但手写 CREATE PROPERTY GRAPH DDL、学习 GQL、确认边对应的键并不轻松。
GA 提供的 bigquery-graph-author 技能可以把关系表映射为节点和边,并使用实际数据检查候选关系。创建资源前,智能体会展示计划供开发者批准;已有 ER 图或数据模型也可以作为起点。图创建后,bigquery-graph-query 技能负责生成 GQL,IDE 中的可视化工具则用于浏览查询结果。
这里最值得保留的流程不是“让智能体自动建图”,而是“生成方案—验证关系—人工批准—执行创建”。关系键选错会放大为错误图结构,因此审批步骤不应省略。
Bigtable:从访问模式反推 Row Key
Bigtable 适合个性化信息流、实时计数器和最近浏览记录等低延迟场景,但它对 Row Key 设计非常敏感。新的 bigtable-basics 技能会围绕读取方式设计 Schema,并在创建前提示热点和全表扫描风险。
智能体还可以创建表并使用 GoogleSQL 查询。列族会被展开为更易读的列,开发者也能在 IDE 的目录浏览器中查看实例和表。需要注意,智能体能协助评审 Row Key,不代表可以跳过容量、访问分布和峰值流量测试。
Spark 与 Iceberg:同一批表,多种计算入口
Data Agent Kit 原本可以通过 BigQuery 查询 Lakehouse 中的 Apache Iceberg 表;GA 后,同一批表也能交给 Managed Service for Apache Spark 处理,无需自行维护集群。
Spark 会话可以保留状态,因此临时视图能够跨语句使用,同时支持 Iceberg 的分支、时间旅行和 Schema 演进。federate-lakehouse-catalog 技能还可连接 AWS Glue 和 Databricks Unity Catalog,让智能体尝试就地查询数据,而不是先搭建一条复制数据的摄取流水线。
跨云联邦查询虽然减少搬运,但仍要评估网络、权限、延迟和扫描成本。适合探索的方案,不一定适合高频生产任务。
动手安装:选择一个编码智能体即可
下面三组命令分别对应不同客户端,只运行你正在使用的那一组。执行前需要安装并登录相应的 CLI。
# Antigravity CLI
agy plugin install https://github.com/GoogleCloudPlatform/data-agent-kit-plugin
# Claude Code
claude plugin install data-agent-kit-starter-pack@claude-plugins-official
# Codex CLI:依次执行两条命令
codex plugin marketplace add GoogleCloudPlatform/data-agent-kit-plugin
codex plugin add dak@dak-marketplace
如果使用 VS Code、Cursor 或其他 VS Code 兼容编辑器,可以在扩展面板中搜索 Google Cloud Data Agent Kit。Cloud Shell 和 Cloud Workstations 已预装,只需打开编辑器并登录。初始化时选择实际使用的 Google Cloud 服务,工具会处理所需 API、技能和 MCP Server 配置。
安装后,可以从一个只读分析任务开始:
使用 BigQuery 公共 Google Trends 数据集,找出本周在美国增长最快、但未进入上周前十名的搜索词。
执行要求:
1. 先确认数据集、表、字段和日期范围;
2. 展示准备执行的 SQL;
3. 检查分区键并先做 dry run;
4. 估算扫描量,得到我的确认后再运行;
5. 返回结果,同时说明排名和增长率的计算方式。
这类提示词比一句“帮我查趋势”更适合生产环境:它要求智能体先检查元数据和成本,再执行查询,并把计算口径明确写出来。
流水线故障也可以采用同样思路:
诊断当前失败的 Airflow DAG。先读取失败任务及相关日志,给出根因、证据和最小修改方案。不要直接修改或重新运行任务;等我批准补丁后再执行。
Data Agent Kit 能把成功的逻辑转换成 dbt 或 Dataform 模型,并通过 Managed Service for Apache Airflow 编排。任务失败时,诊断功能可以把日志交给智能体,由 Spark 或 Airflow 排障技能追踪根因。不过,“建议修复”和“自动上线”应保持为两个不同权限阶段。
企业落地时,权限和成本仍是硬边界
Data Agent Kit 本身不额外收费,但查询、数据库、Spark 和编排等底层 Google Cloud 服务仍按标准价格计费。技能会引导智能体检查分区键、执行 BigQuery dry run,避免意外全表扫描,但团队不应只依赖提示词控制成本。
访问控制方面,智能体以用户身份或用户模拟的服务账号连接,因此现有行级与列级安全策略会继续生效。管理员还可以使用 IAM 管理 MCP 访问,通过 Model Armor 检查 MCP 流量,并使用 VPC Service Controls 与 Principal Access Boundary 缩小可访问范围。
推荐按以下顺序采用:
- 从只读目录浏览、Schema 检查和查询 dry run 开始;
- 为开发、测试和生产环境配置不同身份;
- 将建表、改 Schema、启动昂贵任务和部署流水线设为人工审批动作;
- 给 BigQuery 扫描、Spark 运行和数据库操作设置预算与告警;
- 审计并按团队规范分叉开源技能,例如强制分区过滤或禁止生产环境全表扫描;
- 记录智能体调用的工具、提交的 SQL、资源变更和审批人。
Data Agent Kit 的价值不在于让智能体“拥有更多权限”,而在于让它在真实元数据、团队规则和现有权限边界内工作。把它当作受审计的数据工程协作者,而不是无人监管的数据库管理员,才能真正减少上下文搬运,同时避免把一次错误推理变成昂贵的生产操作。