Google 连续第二年进入 Gartner 2026 年对话式 AI 平台魔力象限的领导者区间,并表示自己在“愿景完整性”和“执行能力”两个维度上分别处于最远和最高位置,同时在四项关键能力用例中的三项排名第一。比排名更值得工程团队关注的是背后的产品方向:企业客户体验正在从“回答问题的聊天机器人”转向能够理解意图、检索企业知识、调用业务系统并在必要时转人工的 AI Agent。
这意味着,模型能力只是起点。真正进入生产环境后,团队必须同时处理延迟、数据可信度、权限边界、操作审计、跨渠道上下文和人工接管。
CX Agent Studio 试图解决什么问题
根据 Google 的介绍,Gemini Enterprise for Customer Experience 以 CX Agent Studio 为核心,将多模态模型、Agent 编排、企业检索和开发工具放在同一平台中。它覆盖四类典型工作负载:
- 在语音和聊天渠道部署多模态 Agent;
- 实时辅助客服与服务人员;
- 分析客户对话,定位业务和服务问题;
- 使用零售、餐饮订购、汽车等行业的预构建 Agent 加速上线。
这里的变化不是给传统 FAQ 机器人换一个更强的生成模型。新的执行链路更接近:
客户输入
-> 意图识别与上下文补全
-> 检索经过授权的企业数据
-> 制定多步骤处理计划
-> 调用订单、库存或工单系统
-> 返回结果,或携带上下文转交人工
Home Depot 的案例体现了这条路径。按照来源中的描述,其语音 Agent 可以在不到 10 秒内理解来电原因,并帮助客户完成购买、发起服务请求或转接员工;部分客户找到解决方案的速度最高可达到传统电话菜单的四倍。这个案例说明语音 Agent 的价值不只来自回答准确率,也来自减少菜单跳转和重复描述。
生产环境的难点藏在模型之外
语音交互对延迟尤其敏感。文本回答慢两秒可能只是体验不佳,语音通话中的长时间停顿却会让客户误以为系统失效。因此,语音 Agent 的指标不能只看模型输出质量,还要拆分首包音频时间、检索耗时、工具调用耗时和端到端响应时间。
可信度则取决于数据链路。库存、价格、订单状态等信息不能依赖模型记忆,必须从实时或足够新鲜的企业数据中检索。Google 将其描述为通过 Agentic Data Cloud 为模型提供实时事实依据,并使用 Agentic Defense 提供保护。它还强调 CX Agent Studio 运行在包括 AI Hypercomputer 在内的 Google Cloud 第一方 AI 技术栈之上,以统一性能、安全与成本控制。
不过,“统一技术栈”并不会自动消除业务风险。上线团队仍然需要明确:
- 哪些操作可以自动执行,哪些必须确认或审批;
- 检索结果是否包含客户无权访问的数据;
- Agent 调用外部系统时使用什么身份和最小权限;
- 模型无法确认意图、连续失败或客户要求人工服务时,如何接管;
- 每次检索、决策和工具调用是否能够审计和回放。
可以这样实践:先搭一个可审计的最小执行链路
下面是一个可运行的 FastAPI 示例。它不是 CX Agent Studio 的真实 API,而是根据来源所描述的“意图识别、企业检索、业务操作、人工转接”能力构造的最小项目。实际接入时,应将示例中的规则函数替换为 Gemini 模型调用,将内存数据替换为受权限控制的企业检索与业务 API。
将以下内容保存为 app.py:
from datetime import datetime, timezone
from typing import Literal
from fastapi import FastAPI
from pydantic import BaseModel
app = FastAPI(title="Auditable CX Agent")
ORDERS = {
"A1001": {"status": "shipped", "eta": "2026-07-10"},
"A1002": {"status": "processing", "eta": "2026-07-12"},
}
class Request(BaseModel):
customer_id: str
message: str
channel: Literal["chat", "voice"] = "chat"
confirmed: bool = False
class Response(BaseModel):
intent: str
answer: str
action: str | None = None
handoff: bool = False
audit: dict
def detect_intent(message: str) -> str:
text = message.lower()
if "order" in text or "订单" in text:
return "check_order"
if "cancel" in text or "取消" in text:
return "cancel_order"
if "human" in text or "人工" in text:
return "human_handoff"
return "unknown"
def find_order_id(message: str) -> str | None:
for order_id in ORDERS:
if order_id.lower() in message.lower():
return order_id
return None
@app.post("/agent", response_model=Response)
def run_agent(request: Request) -> Response:
intent = detect_intent(request.message)
order_id = find_order_id(request.message)
audit = {
"timestamp": datetime.now(timezone.utc).isoformat(),
"customer_id": request.customer_id,
"channel": request.channel,
"intent": intent,
}
if intent == "human_handoff" or intent == "unknown":
return Response(
intent=intent,
answer="已为你转接人工客服,并保留本次对话上下文。",
handoff=True,
audit={**audit, "reason": "requested_or_low_confidence"},
)
if not order_id or order_id not in ORDERS:
return Response(
intent=intent,
answer="请提供有效的订单号,例如 A1001。",
audit={**audit, "tool_called": None},
)
if intent == "check_order":
order = ORDERS[order_id]
return Response(
intent=intent,
answer=f"订单 {order_id} 状态为 {order['status']},预计送达日期为 {order['eta']}。",
action="read_order",
audit={**audit, "tool_called": "get_order", "order_id": order_id},
)
if not request.confirmed:
return Response(
intent=intent,
answer=f"取消订单 {order_id} 属于高影响操作,请确认后再执行。",
action="confirmation_required",
audit={**audit, "tool_called": None, "order_id": order_id},
)
return Response(
intent=intent,
answer=f"已提交订单 {order_id} 的取消申请。",
action="cancel_order",
audit={**audit, "tool_called": "cancel_order", "order_id": order_id},
)
安装依赖并启动服务:
python -m venv .venv
source .venv/bin/activate
pip install fastapi uvicorn
uvicorn app:app --reload --port 8000
查询订单:
curl -s http://localhost:8000/agent \
-H 'Content-Type: application/json' \
-d '{
"customer_id": "C-42",
"channel": "chat",
"message": "请查询订单 A1001"
}'
尝试取消订单时,第一次请求不会直接执行。只有客户端明确传入 "confirmed": true,服务才会调用模拟的取消操作。这种确认门槛、审计记录和人工转接机制,比单纯提高提示词质量更接近生产系统的真实需求。
评估平台时不要只看象限位置
Gartner 的定位可以作为市场与产品能力的参考,但 Gartner 明确表示其研究不构成对厂商、产品或服务的背书,也不建议企业只选择评分最高的厂商。采购和架构决策仍应回到自己的流量、数据边界和业务风险。
落地前可以用一组真实任务做小规模验证:覆盖语音与文本、正常流程与异常流程、读取操作与高影响写操作。重点记录意图识别成功率、检索命中率、工具调用成功率、错误操作率、人工接管率、P95 延迟和单次会话成本。
Google 展示的方向很清楚:下一代客户体验 Agent 不只是回答问题,而是跨企业知识进行推理,并代表客户完成有意义的操作。企业是否能获得实际收益,取决于能否把这些能力放进一个有权限、有确认、有审计、可降级的工程系统中。