搭载美团 LongCat 2.0 的 CatPaw 正式上线。它关注的不只是让模型“跑得动”,而是把模型能力放进真实工作流程,进一步做到“用得好”。从已公布的信息看,CatPaw 同时提供开箱即用的 AI 智能工作台,以及面向企业的 Agent 开发与托管能力,覆盖个人提效和组织级智能化两类场景。
这两类能力看似都叫 Agent,落地方式却很不一样:个人用户关心能否快速完成任务,企业则必须同时处理权限、工具接入、运行稳定性和审计边界。
两条产品路径:直接使用与开发托管
CatPaw 的定位可以拆成两个层次。
AI 智能工作台:缩短从问题到结果的距离
工作台面向的是直接使用 AI 的人。相比单轮问答,Agent 更适合承接有目标、有步骤的任务,例如整理资料、生成报告草稿、拆解工作计划,或者围绕某个目标持续执行多个动作。
这类场景的价值不只来自模型生成文字,还来自任务上下文和执行流程。一个好用的工作台,需要让用户清楚知道:
- 当前任务目标是什么;
- Agent 正在执行哪一步;
- 哪些结果来自模型推理,哪些来自外部工具;
- 涉及提交、发送或修改数据时,是否需要人工确认。
来源信息没有披露 CatPaw 工作台的具体工具清单,因此不宜预设它已经支持某个内部系统或第三方应用。实际评估时,应以产品当前开放的能力和接入文档为准。
企业级 Agent 开发托管:把实验变成长期服务
企业 Agent 往往不是一个更长的提示词,而是模型、业务数据、工具调用和运行治理的组合。开发团队通常需要解决以下问题:
- 身份与权限:Agent 以谁的身份读取数据、调用系统?
- 工具边界:哪些操作允许自动执行,哪些必须审批?
- 运行治理:如何处理超时、重试、并发和失败回滚?
- 审计追踪:能否定位某次回答使用了哪些上下文和工具?
- 版本管理:模型、提示词和工具变化后,如何验证效果没有退化?
CatPaw 提供企业级 Agent 开发托管能力,意味着它面向的不只是一次性体验,也包括 Agent 的工程化建设。不过,具体支持哪些部署形态、接口协议和治理功能,仍应以正式文档为准。
不要从“万能助手”开始,先定义一条可验收的流程
企业采用 Agent 时,一个常见误区是先创建“什么都能做”的助手,再去寻找使用场景。更稳妥的做法是从窄流程切入,例如:
根据用户提交的问题和已授权知识,生成工单处理建议;如果需要修改订单、退款或发送通知,只输出操作计划,等待人工批准。
这个目标可以拆成清晰的输入、输出和边界:
角色:内部工单处理助手
输入:工单正文、业务类型、已授权知识片段
输出:问题摘要、处理建议、待执行动作、风险提示
约束:
- 不得补造订单状态或用户信息
- 没有证据时明确标记“需要人工核实”
- 涉及退款、通知和数据修改时不得直接执行
- 输出中保留引用的知识片段编号
这样的任务更容易建立测试集。团队可以用历史工单检查摘要准确率、建议采纳率、错误工具调用次数和人工处理时间,而不是只评价回答“看起来是否聪明”。
可运行示例:先在 Agent 前面建立企业网关
下面是一个可以直接运行的最小示例。它不是 CatPaw 官方 SDK,也不假设 CatPaw 已公开某种特定 API;它展示的是企业接入 Agent 时可以采用的网关结构。接入正式服务时,只需按照官方文档替换 execute_agent 函数,并补充真实的身份认证与日志系统。
将以下内容保存为 app.py:
from typing import Literal
from uuid import uuid4
from fastapi import FastAPI, Header, HTTPException
from pydantic import BaseModel, Field
app = FastAPI(title="Enterprise Agent Gateway")
ALLOWED_TOOLS = {"search_knowledge", "draft_ticket_reply"}
class AgentRequest(BaseModel):
task: str = Field(min_length=1, max_length=2000)
mode: Literal["plan", "execute"] = "plan"
tools: list[str] = []
class AgentResponse(BaseModel):
request_id: str
status: str
result: str
approved_tools: list[str]
def execute_agent(task: str, mode: str, tools: list[str]) -> str:
"""演示实现:接入 CatPaw 时按正式文档替换这一层。"""
if mode == "plan":
return f"执行计划:分析任务“{task}”,检索授权知识,并生成回复草稿。"
return f"已在允许的工具范围内处理任务:{task}"
@app.post("/agent/run", response_model=AgentResponse)
def run_agent(
payload: AgentRequest,
x_user_id: str | None = Header(default=None),
):
if not x_user_id:
raise HTTPException(status_code=401, detail="Missing X-User-Id")
unknown_tools = set(payload.tools) - ALLOWED_TOOLS
if unknown_tools:
raise HTTPException(
status_code=403,
detail=f"Tools are not allowed: {sorted(unknown_tools)}",
)
request_id = str(uuid4())
result = execute_agent(payload.task, payload.mode, payload.tools)
# 生产环境应记录 request_id、用户、Agent 版本、工具调用与审批结果,
# 但不要把密钥或完整敏感数据写入日志。
print(
{
"request_id": request_id,
"user_id": x_user_id,
"mode": payload.mode,
"tools": payload.tools,
}
)
return AgentResponse(
request_id=request_id,
status="completed",
result=result,
approved_tools=payload.tools,
)
安装依赖并启动服务:
python -m venv .venv
source .venv/bin/activate
pip install fastapi 'uvicorn[standard]'
uvicorn app:app --reload --port 8000
Windows PowerShell 可将激活命令替换为:
.venv\Scripts\Activate.ps1
发送一个只生成计划、不执行高风险操作的请求:
curl -s http://127.0.0.1:8000/agent/run \
-H 'Content-Type: application/json' \
-H 'X-User-Id: employee-1001' \
-d '{
"task": "总结这条售后工单,并生成一份待人工确认的回复草稿",
"mode": "plan",
"tools": ["search_knowledge", "draft_ticket_reply"]
}'
这个薄网关解决了三个基础问题:调用者必须提供身份、工具需要经过白名单检查、每次请求都有可追踪的 request_id。进入生产环境后,还应加入单点登录或服务身份认证、速率限制、超时控制、敏感信息脱敏和人工审批节点。
上线前检查:能力之外还有治理成本
CatPaw 把 LongCat 2.0 的模型能力连接到智能工作台和企业 Agent 开发托管场景,为个人体验与企业工程化提供了统一入口。真正决定落地效果的,仍然是场景选择和治理设计。
可以按下面的顺序推进:
- 个人试用阶段:选择资料整理、草稿生成等可人工复核的低风险任务;
- 团队验证阶段:固定输入输出格式,建立包含正常、模糊和恶意输入的测试集;
- 系统接入阶段:采用最小权限原则,只开放完成任务必需的工具;
- 生产运行阶段:记录 Agent、提示词和工具版本,监控成功率、延迟、成本及人工接管率;
- 高风险动作阶段:对付款、退款、外部发送和数据修改设置明确审批,不把模型判断直接等同于业务授权。
对于企业而言,“用得好”不是让 Agent 执行更多动作,而是在可验证、可追踪、可撤回的边界内完成正确动作。先跑通一条小而明确的流程,再逐步扩大工具和数据范围,通常比一开始追求全能 Agent 更可靠。