用 Amazon Nova 重构长期护理临床文档处理:从原始记录到可审计结构化数据

2026-07-28 20 预计阅读时间: 1 分钟
来源: aws.amazon.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

长期护理机构每天会产生护理记录、交班摘要、病情变化说明等大量临床文档。Guardoc Health 的实践重点,是通过 Amazon Bedrock 调用 Amazon Nova 系列模型,把原本依赖人工阅读、摘录和整理的流程,转变为可扩展的文档处理管道。真正值得关注的并不只是生成一段摘要,而是如何让模型输出进入现有临床工作流,同时保持可追溯、可验证和可控。

从“生成文字”转向“处理文档”

临床文档处理通常包含多个独立任务:识别患者问题、提取症状和生命体征、整理用药变化、生成交班摘要,以及标记需要人工关注的内容。把所有任务塞进一个开放式提示词,虽然实现很快,但输出格式和稳定性往往难以满足后续系统的要求。

更适合生产环境的方式,是把流程拆成几个明确阶段:

  1. 接收文档并完成格式转换、文本提取和基础校验。
  2. 删除无关页眉、重复模板和不可见字符,并按语义边界切分长文档。
  3. 通过 Amazon Bedrock 调用合适的 Amazon Nova 模型,执行分类、提取或摘要任务。
  4. 使用 JSON Schema 或业务规则验证结果,不合格的输出自动重试或转入人工队列。
  5. 保存模型版本、提示词版本、输入文档标识和审核结果,形成审计链路。

这类设计把大语言模型放在受约束的处理节点中,而不是让它直接成为临床事实的最终裁决者。

为什么 Bedrock 与 Nova 适合这类管道

Amazon Nova 模型可以通过 Amazon Bedrock 的统一运行时接口调用。这意味着应用层可以围绕身份权限、日志、模型调用和区域部署建立一致的工程边界,而不必为每个模型维护完全不同的接入方式。

模型选择应由任务决定。轻量的分类、字段提取和批量摘要通常更看重延迟与成本;复杂的跨段推理则更看重模型能力。可以先用一批经过人工标注的真实样本建立基准,再比较准确率、遗漏率、延迟和单文档成本,而不是仅凭演示效果选型。

在长期护理场景中,还要特别区分三类内容:

  • 原文事实:文档中明确出现的症状、数值、时间和药物名称。
  • 模型归纳:根据多段记录生成的趋势或摘要。
  • 临床判断:诊断、处置和风险决策,通常必须由有资质的人员确认。

如果界面把这三类结果混在一起,使用者很难判断哪些内容可以直接信任。输出中保留证据片段和来源位置,通常比只返回一段流畅摘要更有价值。

可以这样实践:调用 Nova 提取结构化信息

下面是一个可改造的 Python 示例。它通过 Bedrock Runtime 的 Converse API 调用 Amazon Nova Lite,要求模型从护理记录中返回 JSON。运行前需要配置 AWS 凭证,并确保当前区域和账户可以访问指定模型。

安装依赖:

python -m pip install --upgrade boto3
export AWS_REGION=us-east-1

创建 extract_note.py

import json
import os

import boto3

MODEL_ID = os.getenv("NOVA_MODEL_ID", "amazon.nova-lite-v1:0")
REGION = os.getenv("AWS_REGION", "us-east-1")

client = boto3.client("bedrock-runtime", region_name=REGION)

note = """Resident reported dizziness after standing at 08:30.
Blood pressure was 98/62. Staff assisted the resident to a chair,
encouraged fluids, and notified the charge nurse. No fall occurred."""

schema = {
    "event_time": "string or null",
    "symptoms": ["string"],
    "measurements": [{"name": "string", "value": "string"}],
    "interventions": ["string"],
    "notifications": ["string"],
    "requires_review": "boolean",
    "evidence": ["exact quotation from the note"]
}

prompt = f"""Extract only facts explicitly stated in the clinical note.
Do not diagnose, infer causes, or invent missing values.
Return one valid JSON object and no Markdown.
Use this shape:
{json.dumps(schema, ensure_ascii=False)}

Clinical note:
{note}
"""

response = client.converse(
    modelId=MODEL_ID,
    system=[{
        "text": "You extract auditable facts from clinical documents. "
                "When information is absent, use null or an empty list."
    }],
    messages=[{
        "role": "user",
        "content": [{"text": prompt}]
    }],
    inferenceConfig={
        "temperature": 0,
        "maxTokens": 800
    }
)

text = response["output"]["message"]["content"][0]["text"]
result = json.loads(text)

required = {
    "event_time", "symptoms", "measurements", "interventions",
    "notifications", "requires_review", "evidence"
}
missing = required - result.keys()
if missing:
    raise ValueError(f"Missing fields: {sorted(missing)}")

print(json.dumps(result, indent=2, ensure_ascii=False))

运行:

python extract_note.py

这个示例只演示调用和最基础的字段检查。生产系统应使用 jsonschema 或数据模型库验证类型、枚举和长度,并检查 evidence 是否确实存在于原文中。对于长文档,还需要按章节或时间段切分,再通过第二阶段汇总结果。

让模型输出可进入临床工作流

一个实用的处理结果不应只有摘要,还应包含置信信息、证据和审核状态。例如,应用可以保存如下记录:

{
  "document_id": "doc-2025-00142",
  "model_id": "amazon.nova-lite-v1:0",
  "prompt_version": "clinical-extract-v3",
  "status": "needs_human_review",
  "facts": {
    "symptoms": ["dizziness"],
    "measurements": [{"name": "blood pressure", "value": "98/62"}]
  },
  "evidence": [
    "Resident reported dizziness after standing at 08:30.",
    "Blood pressure was 98/62."
  ]
}

审核界面可以并排显示原文、提取字段和证据,让护理人员快速确认或修正。人工修改也应作为评估数据保存,用于发现提示词缺陷、文档模板变化和特定字段的系统性遗漏。

上线前需要守住的边界

医疗文档包含高度敏感的信息。使用托管模型服务并不自动意味着系统已经满足所有隐私、安全或合规要求。团队仍需根据自身义务确认区域、数据处理方式、加密、保留期限、访问控制、审计日志和供应商协议,并遵循最小权限原则。

上线检查至少应覆盖:

  • 使用去标识化样本进行早期开发和回归测试。
  • 对事实提取、遗漏、错误归因和虚构内容分别建立指标。
  • 对药物、跌倒、过敏、生命体征异常等高风险信息设置人工审核。
  • 固定并记录模型版本、提示词版本和推理参数。
  • 为限流、超时、无效 JSON 和模型拒答设计重试与降级路径。
  • 进行成本和延迟压测,避免长文档在高峰期造成不可控开销。

Guardoc Health 的案例说明,Nova 在长期护理中的价值并不局限于“帮人写摘要”。更完整的方向是建立一条受约束、可评估、可审计的临床文档管道。模型负责压缩阅读和整理成本,规则与验证层负责约束输出,最终临床责任仍由专业人员承担。


相关推荐