让 AI 助理值得托付:从收件箱整理到写出用户自己的语气

2026-09-14 19 预计阅读时间: 1 分钟
来源: openai.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:10 分钟

一个能替用户写邮件的 AI 助理,难点并不只是“生成一段通顺文字”。真正影响信任的,是它能否持续理解用户的工作重点、记住偏好,并且在不确定时保持克制。

Fyxer 的做法可以概括为一条完整链路:使用 OpenAI 模型处理邮件内容,通过微调和记忆逐步贴近每位用户,再把真实用户反馈纳入改进过程。这个思路对任何“替用户处理信息并采取行动”的 AI 产品都很有参考价值。

信任来自可控的自动化,而不是无条件自动化

收件箱整理和邮件起草看似是两个功能,实际上都涉及用户授权:AI 需要判断哪些邮件重要,也需要代表用户表达观点。

因此,产品不应只追求自动化比例,还要让用户知道 AI 做了什么、为什么这样做,以及如何快速纠正。一个较稳妥的分层方式是:

  • 低风险操作:给邮件分类、提取待办事项、标记优先级,可以自动执行。
  • 中风险操作:生成回复草稿,默认交给用户检查。
  • 高风险操作:发送邮件、承诺交付时间、代表用户做决定,除非有明确授权,否则不应自动执行。

这类边界设计比单纯提高模型能力更重要。模型可能写出非常自然的句子,但自然不等于正确,更不等于得到了发送授权。

“用户的语气”需要记忆,也需要约束

让 AI 写出用户风格,不能只靠一句“请模仿这个人的语气”。实际系统通常需要把长期偏好和当前上下文结合起来,例如:

  • 用户更喜欢简短还是详细的回复;
  • 是否习惯使用称呼、签名和项目缩写;
  • 面对客户、同事和供应商时,语气是否不同;
  • 哪些内容必须由用户亲自确认;
  • 过去被用户修改过的草稿,修改方向是什么。

这里的“记忆”不一定意味着保存所有历史邮件。更可行的方式是保存经过提炼的偏好,例如“对内部同事使用直接语气”“涉及价格时不自动承诺”“默认用英文回复客户”。

记忆还应当可查看、可删除、可纠正。否则,模型一次错误学习就可能持续污染后续草稿,用户也很难理解系统为什么越来越不像自己。

微调解决一致性,反馈解决真实世界的问题

微调适合改善稳定、重复出现的模式,比如邮件分类、特定格式输出或某类常用表达。但它不应被当成解决一切问题的工具。

真实用户反馈能暴露更多细节:

  • 哪些邮件被错误地判断为紧急;
  • 草稿是否遗漏了关键问题;
  • 语气是否过于强硬或过于客套;
  • 用户为什么删除了整段生成内容;
  • 哪些场景应该让 AI 停下来询问用户。

可以把用户的“接受、修改、拒绝”都视为信号,而不仅仅收集显式评分。尤其是修改后的最终版本,它比“这封邮件写得不错”更能说明用户真正想要什么。

不过,反馈数据也要经过清洗和授权。邮件包含大量敏感信息,不能因为它们能帮助训练,就默认可以长期保存或用于所有用户。数据保留期限、访问权限、脱敏策略和退出机制,都应当成为产品设计的一部分。

一个可改造的邮件处理最小实现

下面是一个简化示例:先让模型输出结构化的邮件判断,再根据用户偏好生成草稿。它展示的是实现思路,不代表 Fyxer 的内部代码。运行前需要安装 SDK,并设置 OPENAI_API_KEY;模型名称可以按自己的账户配置替换。

pip install openai
export OPENAI_API_KEY="your-api-key"
import json
import os
from openai import OpenAI

client = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
MODEL = os.getenv("OPENAI_MODEL", "gpt-4o-mini")

email = {
    "sender": "alex@example.com",
    "subject": "Project timeline",
    "body": "Can you confirm whether the new timeline still works for your team?"
}

user_memory = {
    "language": "English",
    "style": "concise, warm, and direct",
    "rules": [
        "Do not promise a delivery date without explicit confirmation.",
        "Ask one clear follow-up question when information is missing.",
        "Use a short sign-off: Best"
    ]
}

triage_prompt = f"""
Classify this email. Return JSON only with these keys:
priority: one of low, medium, high
needs_reply: boolean
reason: short explanation

Email:
{json.dumps(email, ensure_ascii=False)}
"""

triage = client.chat.completions.create(
    model=MODEL,
    temperature=0,
    response_format={"type": "json_object"},
    messages=[
        {"role": "system", "content": "You classify emails conservatively."},
        {"role": "user", "content": triage_prompt},
    ],
)

classification = json.loads(triage.choices[0].message.content)

if classification["needs_reply"]:
    draft_prompt = f"""
Write a reply draft to the email below.
Follow the user's preferences exactly. Do not invent facts, dates, or commitments.
Return only the email body, without a subject line.

User preferences:
{json.dumps(user_memory, ensure_ascii=False)}

Email:
{json.dumps(email, ensure_ascii=False)}
"""

    draft = client.chat.completions.create(
        model=MODEL,
        temperature=0.3,
        messages=[
            {
                "role": "system",
                "content": "You draft emails for review. When uncertain, state the uncertainty instead of guessing.",
            },
            {"role": "user", "content": draft_prompt},
        ],
    )
    draft_text = draft.choices[0].message.content
else:
    draft_text = None

print(json.dumps({
    "classification": classification,
    "draft_for_human_review": draft_text,
}, ensure_ascii=False, indent=2))

这个示例有几个值得保留的工程约束:分类和起草分成两个步骤;分类使用较低随机性;输出分类结果采用 JSON;草稿明确禁止编造事实;最终结果标记为 draft_for_human_review,而不是直接发送。

生产环境还应增加权限检查、敏感信息脱敏、日志审计、重试策略和人工确认界面。对于批量邮件处理,最好设置置信度阈值:低于阈值时只给出摘要和建议,不自动生成可发送草稿。

从真实反馈建立评估闭环

上线后不要只看“生成了多少封邮件”。更有价值的指标包括:

  • 用户保留草稿的比例;
  • 草稿被大幅重写的比例;
  • 用户撤销或拒绝的比例;
  • 错误分类和遗漏高优先级邮件的数量;
  • 用户主动修改记忆规则的频率;
  • 高风险场景下的拦截率。

评估集也要覆盖不同类型的邮件:客户沟通、内部协作、会议安排、投诉、账单和包含敏感信息的内容。一个只在普通商务邮件上表现良好的系统,遇到模糊承诺或复杂上下文时仍可能损害信任。

反馈闭环的关键不是让模型“更像人”,而是让系统能够回答三个问题:它哪里做错了?用户如何修正?相同问题下次是否真的改善?

落地时可以遵循的检查清单

  • 把整理、建议和发送分成不同权限等级。
  • 用可解释、可删除的偏好记忆替代无边界的历史数据堆积。
  • 让模型明确区分已知事实、推断和未知信息。
  • 默认生成草稿,不默认发送邮件。
  • 收集接受、修改和拒绝等隐式反馈。
  • 对敏感邮件设置更严格的保留、访问和人工确认规则。
  • 用真实工作流评估,而不是只用离线文本相似度评估。

AI 执行助理的核心竞争力,最终不只是模型能写出多漂亮的句子,而是用户是否愿意把一部分注意力和工作交给它。稳定的记忆、谨慎的权限、透明的反馈闭环,才是从“会写邮件”走向“值得托付”的关键。


相关推荐