CatPaw 正式上线:从 AI 工作台到企业级 Agent 托管,如何真正落地

2026-07-28 19 预计阅读时间: 1 分钟
来源: tech.meituan.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:10 分钟

搭载美团 LongCat 2.0 的 CatPaw 正式上线。它关注的不只是让模型“跑得动”,而是把模型能力放进真实工作流程,进一步做到“用得好”。从已公布的信息看,CatPaw 同时提供开箱即用的 AI 智能工作台,以及面向企业的 Agent 开发与托管能力,覆盖个人提效和组织级智能化两类场景。

这两类能力看似都叫 Agent,落地方式却很不一样:个人用户关心能否快速完成任务,企业则必须同时处理权限、工具接入、运行稳定性和审计边界。

两条产品路径:直接使用与开发托管

CatPaw 的定位可以拆成两个层次。

AI 智能工作台:缩短从问题到结果的距离

工作台面向的是直接使用 AI 的人。相比单轮问答,Agent 更适合承接有目标、有步骤的任务,例如整理资料、生成报告草稿、拆解工作计划,或者围绕某个目标持续执行多个动作。

这类场景的价值不只来自模型生成文字,还来自任务上下文和执行流程。一个好用的工作台,需要让用户清楚知道:

  • 当前任务目标是什么;
  • Agent 正在执行哪一步;
  • 哪些结果来自模型推理,哪些来自外部工具;
  • 涉及提交、发送或修改数据时,是否需要人工确认。

来源信息没有披露 CatPaw 工作台的具体工具清单,因此不宜预设它已经支持某个内部系统或第三方应用。实际评估时,应以产品当前开放的能力和接入文档为准。

企业级 Agent 开发托管:把实验变成长期服务

企业 Agent 往往不是一个更长的提示词,而是模型、业务数据、工具调用和运行治理的组合。开发团队通常需要解决以下问题:

  1. 身份与权限:Agent 以谁的身份读取数据、调用系统?
  2. 工具边界:哪些操作允许自动执行,哪些必须审批?
  3. 运行治理:如何处理超时、重试、并发和失败回滚?
  4. 审计追踪:能否定位某次回答使用了哪些上下文和工具?
  5. 版本管理:模型、提示词和工具变化后,如何验证效果没有退化?

CatPaw 提供企业级 Agent 开发托管能力,意味着它面向的不只是一次性体验,也包括 Agent 的工程化建设。不过,具体支持哪些部署形态、接口协议和治理功能,仍应以正式文档为准。

不要从“万能助手”开始,先定义一条可验收的流程

企业采用 Agent 时,一个常见误区是先创建“什么都能做”的助手,再去寻找使用场景。更稳妥的做法是从窄流程切入,例如:

根据用户提交的问题和已授权知识,生成工单处理建议;如果需要修改订单、退款或发送通知,只输出操作计划,等待人工批准。

这个目标可以拆成清晰的输入、输出和边界:

角色:内部工单处理助手
输入:工单正文、业务类型、已授权知识片段
输出:问题摘要、处理建议、待执行动作、风险提示
约束:
- 不得补造订单状态或用户信息
- 没有证据时明确标记“需要人工核实”
- 涉及退款、通知和数据修改时不得直接执行
- 输出中保留引用的知识片段编号

这样的任务更容易建立测试集。团队可以用历史工单检查摘要准确率、建议采纳率、错误工具调用次数和人工处理时间,而不是只评价回答“看起来是否聪明”。

可运行示例:先在 Agent 前面建立企业网关

下面是一个可以直接运行的最小示例。它不是 CatPaw 官方 SDK,也不假设 CatPaw 已公开某种特定 API;它展示的是企业接入 Agent 时可以采用的网关结构。接入正式服务时,只需按照官方文档替换 execute_agent 函数,并补充真实的身份认证与日志系统。

将以下内容保存为 app.py

from typing import Literal
from uuid import uuid4

from fastapi import FastAPI, Header, HTTPException
from pydantic import BaseModel, Field

app = FastAPI(title="Enterprise Agent Gateway")

ALLOWED_TOOLS = {"search_knowledge", "draft_ticket_reply"}


class AgentRequest(BaseModel):
    task: str = Field(min_length=1, max_length=2000)
    mode: Literal["plan", "execute"] = "plan"
    tools: list[str] = []


class AgentResponse(BaseModel):
    request_id: str
    status: str
    result: str
    approved_tools: list[str]


def execute_agent(task: str, mode: str, tools: list[str]) -> str:
    """演示实现:接入 CatPaw 时按正式文档替换这一层。"""
    if mode == "plan":
        return f"执行计划:分析任务“{task}”,检索授权知识,并生成回复草稿。"
    return f"已在允许的工具范围内处理任务:{task}"


@app.post("/agent/run", response_model=AgentResponse)
def run_agent(
    payload: AgentRequest,
    x_user_id: str | None = Header(default=None),
):
    if not x_user_id:
        raise HTTPException(status_code=401, detail="Missing X-User-Id")

    unknown_tools = set(payload.tools) - ALLOWED_TOOLS
    if unknown_tools:
        raise HTTPException(
            status_code=403,
            detail=f"Tools are not allowed: {sorted(unknown_tools)}",
        )

    request_id = str(uuid4())
    result = execute_agent(payload.task, payload.mode, payload.tools)

    # 生产环境应记录 request_id、用户、Agent 版本、工具调用与审批结果,
    # 但不要把密钥或完整敏感数据写入日志。
    print(
        {
            "request_id": request_id,
            "user_id": x_user_id,
            "mode": payload.mode,
            "tools": payload.tools,
        }
    )

    return AgentResponse(
        request_id=request_id,
        status="completed",
        result=result,
        approved_tools=payload.tools,
    )

安装依赖并启动服务:

python -m venv .venv
source .venv/bin/activate
pip install fastapi 'uvicorn[standard]'
uvicorn app:app --reload --port 8000

Windows PowerShell 可将激活命令替换为:

.venv\Scripts\Activate.ps1

发送一个只生成计划、不执行高风险操作的请求:

curl -s http://127.0.0.1:8000/agent/run \
  -H 'Content-Type: application/json' \
  -H 'X-User-Id: employee-1001' \
  -d '{
    "task": "总结这条售后工单,并生成一份待人工确认的回复草稿",
    "mode": "plan",
    "tools": ["search_knowledge", "draft_ticket_reply"]
  }'

这个薄网关解决了三个基础问题:调用者必须提供身份、工具需要经过白名单检查、每次请求都有可追踪的 request_id。进入生产环境后,还应加入单点登录或服务身份认证、速率限制、超时控制、敏感信息脱敏和人工审批节点。

上线前检查:能力之外还有治理成本

CatPaw 把 LongCat 2.0 的模型能力连接到智能工作台和企业 Agent 开发托管场景,为个人体验与企业工程化提供了统一入口。真正决定落地效果的,仍然是场景选择和治理设计。

可以按下面的顺序推进:

  • 个人试用阶段:选择资料整理、草稿生成等可人工复核的低风险任务;
  • 团队验证阶段:固定输入输出格式,建立包含正常、模糊和恶意输入的测试集;
  • 系统接入阶段:采用最小权限原则,只开放完成任务必需的工具;
  • 生产运行阶段:记录 Agent、提示词和工具版本,监控成功率、延迟、成本及人工接管率;
  • 高风险动作阶段:对付款、退款、外部发送和数据修改设置明确审批,不把模型判断直接等同于业务授权。

对于企业而言,“用得好”不是让 Agent 执行更多动作,而是在可验证、可追踪、可撤回的边界内完成正确动作。先跑通一条小而明确的流程,再逐步扩大工具和数据范围,通常比一开始追求全能 Agent 更可靠。


相关推荐