把 90 年职场研究变成实时教练:Gallup AI 的 Amazon Bedrock 实践

2026-08-27 35 预计阅读时间: 1 分钟
来源: aws.amazon.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

Gallup 将 90 年积累的职场科学转化为 Gallup AI,并通过 Amazon Bedrock 在 Gallup Access 应用中向领导者提供实时、个性化的辅导。这个案例的重要之处不只是“接入了一个大模型”,而是把长期沉淀的专业知识嵌入用户已有的工作入口,同时将服务扩展到数千名用户。

真正的产品是上下文,而不是聊天框

通用模型可以生成流畅建议,但领导力辅导需要知道用户面对的具体情境:团队状态、管理目标、当前挑战,以及组织允许使用的数据边界。Gallup AI 直接进入 Gallup Access,意味着辅导能力不必作为孤立工具存在,用户可以在熟悉的应用中获得支持。

这类产品通常需要组织三层上下文:

  • 稳定知识:经过验证的职场研究、管理方法和术语定义。
  • 用户上下文:角色、目标及用户主动提供的工作情境。
  • 当前问题:例如如何准备一对一沟通、处理反馈或制定行动计划。

来源摘要没有披露 Gallup AI 的具体检索、提示词或数据架构。类似系统可以这样实践:由后端选择获准使用的上下文,构造受约束的请求,再通过 Amazon Bedrock 调用模型。不要把整份员工档案或原始调查数据直接拼入提示词。

从研究结论到可执行辅导

把 90 年研究资料放进模型上下文,并不会自动产生可靠的教练。工程团队还需要把“知识”转换成稳定的交互规则:模型何时提问、何时给出建议、怎样说明依据,以及在哪些场景下拒绝代替人做判断。

一个实用的辅导响应可以包含四部分:

  1. 复述问题,确认模型理解的情境。
  2. 提出一到两个澄清问题,避免过早下结论。
  3. 给出数量有限、可以执行的行动建议。
  4. 标明建议边界,尤其避免替代人事、法律或医疗专业判断。

实时体验还要求后端控制延迟、超时和输出长度。与其让模型生成一篇泛泛的管理文章,不如要求它返回三个明确行动和一个后续问题。这样既方便用户阅读,也更容易做自动评测。

可以这样实践:用 Bedrock 构建最小辅导接口

下面是一个可改造的 Python 示例。它使用 Amazon Bedrock Runtime 的 Converse API,将经过筛选的组织知识和用户问题发送给模型。运行前需要配置 AWS 凭证、安装依赖,并把 BEDROCK_MODEL_ID 改成账户所在区域中已获准使用的模型 ID。

python -m venv .venv
source .venv/bin/activate
pip install boto3
export AWS_REGION=us-east-1
export BEDROCK_MODEL_ID='replace-with-an-enabled-model-id'

创建 coach.py

import os
import boto3

region = os.getenv("AWS_REGION", "us-east-1")
model_id = os.environ["BEDROCK_MODEL_ID"]
client = boto3.client("bedrock-runtime", region_name=region)

APPROVED_CONTEXT = """
Use only these approved coaching principles:
- Ask for context before making assumptions.
- Turn broad goals into observable next actions.
- Do not make employment, legal, medical, or disciplinary decisions.
""".strip()


def coach(question: str, role: str = "team leader") -> str:
    response = client.converse(
        modelId=model_id,
        system=[
            {
                "text": (
                    "You are a workplace coaching assistant. "
                    "Provide concise, practical guidance grounded only in the "
                    "approved context. If evidence is missing, say so. "
                    "Do not infer sensitive employee attributes.\n\n"
                    f"Approved context:\n{APPROVED_CONTEXT}"
                )
            }
        ],
        messages=[
            {
                "role": "user",
                "content": [
                    {
                        "text": (
                            f"User role: {role}\n"
                            f"Situation: {question}\n\n"
                            "Return: one clarification question, three concrete "
                            "actions, and one boundary or caveat."
                        )
                    }
                ],
            }
        ],
        inferenceConfig={
            "maxTokens": 500,
            "temperature": 0.2,
        },
    )
    return response["output"]["message"]["content"][0]["text"]


if __name__ == "__main__":
    prompt = (
        "Two experienced team members disagree in meetings, and the rest of "
        "the team has stopped contributing. How should I prepare for my next "
        "one-on-one conversations?"
    )
    print(coach(prompt))

运行:

python coach.py

生产环境不能把 APPROVED_CONTEXT 长期写死在代码里。可以将版本化知识存入受控内容库,由检索层按权限取回少量相关片段,并在请求日志中记录知识版本、模型版本和策略版本。用户身份、员工数据和访问控制应在调用模型之前由应用后端处理,而不是交给提示词决定。

扩展到数千名用户时,瓶颈不只在吞吐量

标题强调 Gallup 将实时辅导扩展给数千名用户。达到这个规模后,工程目标至少包括四类指标:

  • 体验指标:首字节延迟、完整响应时间、超时率和用户追问率。
  • 质量指标:建议是否具体、是否忠于获准知识、是否出现无依据推断。
  • 安全指标:敏感数据泄漏、越权检索、提示词注入和高风险建议的触发率。
  • 成本指标:单次会话输入与输出 token、重复上下文比例及峰值并发成本。

评测集应覆盖真实工作场景,而不只是一般问答。可以准备经过匿名化的测试案例,例如反馈沟通、团队冲突和目标澄清,并让领域专家为每个案例定义必须出现的要点、禁止出现的判断和可接受的建议范围。模型或提示词升级后,先运行离线回归,再逐步放量。

上线前的取舍与检查清单

Gallup AI 展示了一条值得关注的产品路径:专业机构可以把多年积累的方法论变成应用内、实时且个性化的交互能力。Amazon Bedrock 提供模型调用基础,但产品可信度仍取决于知识治理、权限控制、评测和人工边界。

落地类似系统时,应确认:

  • 只向模型发送完成当前任务所需的最少数据。
  • 专业知识有来源、版本和审核流程。
  • 输出明确区分事实、建议与不确定性。
  • 高风险问题能够拒答、转交或提示联系专业人员。
  • 日志经过脱敏,并设置合理的留存期限。
  • 模型、提示词或知识库变更都能通过固定评测集回归。
  • 为峰值流量设置限流、重试、超时和成本告警。

实时教练的价值不在于替领导者作决定,而在于把可靠的方法和恰当的问题放到决策发生的那一刻。规模越大,这种边界越需要通过代码、权限和评测明确落实。


相关推荐