Polimill 如何用 GPT 与 Codex 构建面向日本地方政府的公共 AI 基础设施

2026-08-31 27 预计阅读时间: 1 分钟
来源: openai.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:8 分钟

地方政府拥有大量条例、制度说明、办事指南和内部知识,但这些信息往往分散在网页、PDF 与不同部门的系统中。来源摘要显示,Polimill 正在使用 OpenAI GPT 模型和 Codex,帮助日本地方政府搜索、理解并利用行政知识,同时加快相关系统的开发。

这类项目的重点并不只是接入一个聊天机器人,而是把模型能力放进公共服务的知识、权限和审计体系中,让工作人员更快找到依据,让居民更容易获得一致的信息。

从“能回答”到“能引用依据”

行政知识问答与普通客服问答有一个关键区别:答案通常需要能够追溯到条例、制度文件或正式通知。模型回答得流畅,并不等于回答可靠。

可以这样理解一个面向地方政府的检索增强生成流程:

  1. 收集经过授权的行政资料。
  2. 将 PDF、网页和文档切分为可检索片段。
  3. 根据用户问题检索相关内容。
  4. 把检索结果连同来源信息交给 GPT 模型。
  5. 返回答案、引用依据和必要的“不确定”提示。

实际部署时,还应为资料增加部门、适用地区、生效日期、失效日期和访问级别等元数据。这样,“儿童补贴如何申请”这类问题才不会把旧制度与现行制度混在一起。

GPT 与 Codex 的分工

GPT 模型适合处理自然语言理解、资料总结、问题改写和多轮问答。Codex 则可以用于加速开发,例如生成检索接口的初始代码、编写数据转换脚本、补充测试,或帮助工程师理解既有系统。

但在公共部门场景中,代码生成仍需要经过正常的工程流程:代码审查、依赖检查、权限验证、测试和发布审批不能由模型替代。尤其是涉及个人信息、身份认证和行政决策的部分,应明确哪些动作只能由工作人员确认。

一个可改造的最小检索问答示例

下面的示例假设已经准备好一组行政资料,并通过向量检索服务取得了相关片段。它展示的是模型调用边界,而不是完整的生产级知识库。运行前请设置 OPENAI_API_KEY,并将 search_documents 替换为组织内部经过授权的检索实现。

import os
from openai import OpenAI

client = OpenAI(api_key=os.environ["OPENAI_API_KEY"])


def search_documents(question: str) -> list[dict]:
    # 实践中替换为经过权限过滤的向量数据库或全文检索服务。
    return [
        {
            "title": "儿童补贴申请指南",
            "effective_date": "2025-04-01",
            "text": "申请人需要提交申请表、身份确认材料以及指定的收入证明。",
        },
        {
            "title": "地方政府办事窗口说明",
            "effective_date": "2025-04-01",
            "text": "居民可以通过在线门户或市政府窗口提交申请。",
        },
    ]


def answer(question: str) -> str:
    documents = search_documents(question)
    context = "\n\n".join(
        f"【{doc['title']},生效日:{doc['effective_date']}\n{doc['text']}"
        for doc in documents
    )

    response = client.responses.create(
        model="gpt-4.1",
        input=[
            {
                "role": "system",
                "content": (
                    "你是地方政府行政知识助手。只能依据提供的资料回答。"
                    "如果资料不足,请明确说明,并建议用户联系负责部门。"
                    "回答中必须列出使用的资料标题。"
                ),
            },
            {
                "role": "user",
                "content": f"参考资料:\n{context}\n\n居民问题:{question}",
            },
        ],
    )
    return response.output_text


if __name__ == "__main__":
    print(answer("儿童补贴可以在哪里申请?需要准备什么?"))

这个例子有三个值得保留的边界:检索先于生成,提示词明确要求“不足时拒答”,返回内容保留资料标题。生产系统还应增加访问控制、敏感信息脱敏、日志审计、提示词注入防护和人工升级入口。

公共 AI 基础设施的工程边界

“基础设施”意味着能力需要被多个部门和场景稳定复用,而不是为一次演示拼出一条调用链。落地时可以重点检查以下问题:

  • 资料治理:谁负责资料上传、审核、版本管理和失效处理?
  • 权限控制:不同部门、工作人员和居民能看到哪些资料?
  • 答案可追溯:回答是否展示来源、版本和生效时间?
  • 数据保护:个人信息是否在发送给模型前完成最小化和脱敏?
  • 质量评估:是否有一组真实问题,用于持续测试准确性、拒答率和引用正确率?
  • 故障降级:模型不可用或资料不足时,是否能转人工或回到正式办事页面?

Codex 可以缩短从需求到原型的距离,但公共系统的可靠性来自资料治理、测试和责任边界。模型生成的代码和答案都应被当作需要验证的产物,而不是未经审查的最终结果。

采用建议

Polimill 的实践方向说明,地方政府可以把 GPT 用在行政知识搜索和使用环节,并借助 Codex 提升系统开发速度。更稳妥的采用路径是从一个资料边界清晰、风险可控的部门开始,先建立带来源的问答和评测集,再逐步扩展到跨部门知识。

对准备建设类似系统的团队来说,最重要的验收标准不是“模型能否回答所有问题”,而是:它是否能在授权范围内找到最新依据,无法确定时是否诚实停下,并且让工作人员能够检查和纠正结果。


相关推荐