用 AWS 构建医疗理赔文档智能处理流水线:从百分钟审阅到可追溯的 AI 辅助审核

2026-09-22 24 预计阅读时间: 1 分钟
来源: aws.amazon.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

医疗理赔审核的瓶颈往往不在规则计算,而在阅读:审核人员需要从病历、检查报告、账单和出院记录中找出关键事实,再判断它们是否支持理赔申请。EXL 构建的 Medical IDP 方案把智能文档处理与 Amazon SageMaker、Amazon Bedrock 上的领域模型结合起来,用于提取、摘要和查询医疗记录,面向企业规模处理原本单案超过 100 分钟的审核工作。

真正值得借鉴的并不是简单地“让大模型读 PDF”,而是把 OCR、结构化提取、领域推理、证据引用和人工复核组织成一条可审计的流水线。

一条医疗 IDP 流水线应该怎样拆分

可以把系统划分为四层,每一层只处理自己擅长的问题:

  1. 文档接入与识别:接收扫描件、PDF、图片和电子病历导出文件,识别正文、表格、页码与文档类型。
  2. 字段标准化:抽取患者信息、诊断、手术、用药、服务日期和费用等实体,并统一日期、编码与单位。
  3. 领域摘要与问答:使用部署在 SageMaker 上的领域模型,或通过 Amazon Bedrock 调用适合的基础模型,生成时间线、病例摘要和问题答案。
  4. 审核工作台:把结论、证据页码、置信度和异常项呈现给审核人员,而不是只显示一段无法验证的自然语言。

一个典型的数据流可以表示为:

S3 原始文档
  -> OCR / 文档分类
  -> 标准化医疗记录 JSON
  -> SageMaker 领域模型或 Bedrock 大模型
  -> 摘要、问答、证据引用、风险标记
  -> 人工审核与审计日志

这种分层设计有两个直接收益。其一,OCR 错误、字段抽取错误和推理错误能够分别定位;其二,同一份结构化记录可以服务摘要、检索、欺诈线索分析和后续规则校验,不必为每个场景重新解析原始文件。

大模型不应直接替审核人员做最终决定

医疗理赔属于高风险场景。模型适合压缩阅读量和定位证据,但不应在缺乏人工确认的情况下自动拒赔。输出格式至少应包含以下内容:

  • 关键诊断、治疗与服务日期;
  • 按时间排序的临床事件;
  • 对审核问题的直接回答;
  • 支持回答的页码或原文片段;
  • 信息缺失、前后矛盾和低置信度字段;
  • 明确的“无法从材料确认”状态。

提示词也要避免诱导模型补全事实。例如,与其要求“解释为什么应该拒赔”,不如要求“仅根据提供的记录列出支持与不支持该申请的证据;没有证据时返回 unknown”。

SageMaker 与 Bedrock 可以承担不同角色:前者适合托管经过医疗领域适配的模型或定制推理端点,后者适合通过统一 API 使用基础模型完成摘要和问答。实际选型要结合数据驻留、模型可控性、延迟、成本以及组织对模型供应商的要求。

可改造的 Bedrock 病历摘要示例

下面是一个最小 Python 示例。它读取已经完成 OCR 的文本文件,调用 Amazon Bedrock Converse API,要求模型返回带证据引用的结构化结果。运行前需要把 BEDROCK_MODEL_ID 改成账户和区域中已启用、支持 Converse API 的模型 ID,并配置有调用权限的 AWS 凭证。

python -m pip install boto3
export AWS_REGION=us-east-1
export BEDROCK_MODEL_ID='your-enabled-model-id'
python review_record.py medical_record.txt '记录中是否包含支持住院必要性的证据?'

将以下内容保存为 review_record.py

import json
import os
import sys
from pathlib import Path

import boto3

if len(sys.argv) != 3:
    raise SystemExit(
        "Usage: python review_record.py <record.txt> <question>"
    )

region = os.getenv("AWS_REGION", "us-east-1")
model_id = os.environ["BEDROCK_MODEL_ID"]
record = Path(sys.argv[1]).read_text(encoding="utf-8")
question = sys.argv[2]

# 这是最小示例。生产环境应按页或章节切分,并保留 [Page N] 标记。
if len(record) > 30000:
    raise ValueError("Record is too long for this demo; split it by page first.")

prompt = f"""
You assist a human medical claims reviewer.
Use only the supplied record. Do not infer missing diagnoses or treatments.
If the evidence is insufficient, set answer to "unknown".
Return valid JSON with these fields:
- answer: string
- evidence: array of objects with quote and page
- missing_information: array of strings
- contradictions: array of strings

Reviewer question:
{question}

Medical record:
{record}
"""

client = boto3.client("bedrock-runtime", region_name=region)
response = client.converse(
    modelId=model_id,
    system=[{
        "text": (
            "You extract evidence from medical records. "
            "Never make a coverage or denial decision."
        )
    }],
    messages=[{
        "role": "user",
        "content": [{"text": prompt}]
    }],
    inferenceConfig={
        "temperature": 0,
        "maxTokens": 1200
    }
)

result = response["output"]["message"]["content"][0]["text"]
try:
    print(json.dumps(json.loads(result), ensure_ascii=False, indent=2))
except json.JSONDecodeError:
    print(result)

这段代码只是推理层原型。接入真实系统时,应在 OCR 阶段写入 [Page 1] 之类的稳定页码标记,并在展示答案时让审核人员能够跳回原始页面。长文档应按页或章节切分,先提取局部事实,再合并为全局时间线,避免简单截断导致遗漏关键证据。

企业落地要补齐的控制面

当系统处理受保护的健康信息时,模型效果只是验收标准之一。生产设计还应覆盖:

  • 最小权限:分别限制原始文档桶、处理结果桶、SageMaker 端点和 Bedrock 模型的访问权限。
  • 加密与网络边界:为存储和日志配置加密,评估私有网络连接与数据出域策略。
  • 审计记录:保存输入文档版本、模型 ID、提示词版本、输出结果和人工修改痕迹。
  • 脱敏策略:测试数据和开发日志不应默认包含真实患者标识信息。
  • 质量评估:分别测量字段准确率、证据召回率、无依据陈述率和人工审核耗时,不能只看摘要是否“读起来不错”。
  • 降级机制:OCR 质量过低、关键页面缺失或模型输出解析失败时,自动转入人工队列。

从辅助阅读开始,而不是从自动裁决开始

稳妥的采用路径是先选择一种材料相对固定、人工耗时较高的理赔类型,让 AI 生成时间线、关键字段和证据索引,最终决定仍由审核人员完成。上线前使用历史案件建立评测集,并比较原流程与 AI 辅助流程的处理时间、遗漏率和复核率。

只有当证据引用稳定、审计链完整、异常能够可靠降级时,才适合逐步扩大文档类型和自动化范围。医疗 IDP 的价值不只是缩短阅读时间,更在于把分散在数十页材料中的事实变成可搜索、可验证、可复用的数据,同时保留人类对高风险决定的控制权。


相关推荐