地方政府拥有大量条例、制度说明、办事指南和内部知识,但这些信息往往分散在网页、PDF 与不同部门的系统中。来源摘要显示,Polimill 正在使用 OpenAI GPT 模型和 Codex,帮助日本地方政府搜索、理解并利用行政知识,同时加快相关系统的开发。
这类项目的重点并不只是接入一个聊天机器人,而是把模型能力放进公共服务的知识、权限和审计体系中,让工作人员更快找到依据,让居民更容易获得一致的信息。
从“能回答”到“能引用依据”
行政知识问答与普通客服问答有一个关键区别:答案通常需要能够追溯到条例、制度文件或正式通知。模型回答得流畅,并不等于回答可靠。
可以这样理解一个面向地方政府的检索增强生成流程:
- 收集经过授权的行政资料。
- 将 PDF、网页和文档切分为可检索片段。
- 根据用户问题检索相关内容。
- 把检索结果连同来源信息交给 GPT 模型。
- 返回答案、引用依据和必要的“不确定”提示。
实际部署时,还应为资料增加部门、适用地区、生效日期、失效日期和访问级别等元数据。这样,“儿童补贴如何申请”这类问题才不会把旧制度与现行制度混在一起。
GPT 与 Codex 的分工
GPT 模型适合处理自然语言理解、资料总结、问题改写和多轮问答。Codex 则可以用于加速开发,例如生成检索接口的初始代码、编写数据转换脚本、补充测试,或帮助工程师理解既有系统。
但在公共部门场景中,代码生成仍需要经过正常的工程流程:代码审查、依赖检查、权限验证、测试和发布审批不能由模型替代。尤其是涉及个人信息、身份认证和行政决策的部分,应明确哪些动作只能由工作人员确认。
一个可改造的最小检索问答示例
下面的示例假设已经准备好一组行政资料,并通过向量检索服务取得了相关片段。它展示的是模型调用边界,而不是完整的生产级知识库。运行前请设置 OPENAI_API_KEY,并将 search_documents 替换为组织内部经过授权的检索实现。
import os
from openai import OpenAI
client = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
def search_documents(question: str) -> list[dict]:
# 实践中替换为经过权限过滤的向量数据库或全文检索服务。
return [
{
"title": "儿童补贴申请指南",
"effective_date": "2025-04-01",
"text": "申请人需要提交申请表、身份确认材料以及指定的收入证明。",
},
{
"title": "地方政府办事窗口说明",
"effective_date": "2025-04-01",
"text": "居民可以通过在线门户或市政府窗口提交申请。",
},
]
def answer(question: str) -> str:
documents = search_documents(question)
context = "\n\n".join(
f"【{doc['title']},生效日:{doc['effective_date']}】\n{doc['text']}"
for doc in documents
)
response = client.responses.create(
model="gpt-4.1",
input=[
{
"role": "system",
"content": (
"你是地方政府行政知识助手。只能依据提供的资料回答。"
"如果资料不足,请明确说明,并建议用户联系负责部门。"
"回答中必须列出使用的资料标题。"
),
},
{
"role": "user",
"content": f"参考资料:\n{context}\n\n居民问题:{question}",
},
],
)
return response.output_text
if __name__ == "__main__":
print(answer("儿童补贴可以在哪里申请?需要准备什么?"))
这个例子有三个值得保留的边界:检索先于生成,提示词明确要求“不足时拒答”,返回内容保留资料标题。生产系统还应增加访问控制、敏感信息脱敏、日志审计、提示词注入防护和人工升级入口。
公共 AI 基础设施的工程边界
“基础设施”意味着能力需要被多个部门和场景稳定复用,而不是为一次演示拼出一条调用链。落地时可以重点检查以下问题:
- 资料治理:谁负责资料上传、审核、版本管理和失效处理?
- 权限控制:不同部门、工作人员和居民能看到哪些资料?
- 答案可追溯:回答是否展示来源、版本和生效时间?
- 数据保护:个人信息是否在发送给模型前完成最小化和脱敏?
- 质量评估:是否有一组真实问题,用于持续测试准确性、拒答率和引用正确率?
- 故障降级:模型不可用或资料不足时,是否能转人工或回到正式办事页面?
Codex 可以缩短从需求到原型的距离,但公共系统的可靠性来自资料治理、测试和责任边界。模型生成的代码和答案都应被当作需要验证的产物,而不是未经审查的最终结果。
采用建议
Polimill 的实践方向说明,地方政府可以把 GPT 用在行政知识搜索和使用环节,并借助 Codex 提升系统开发速度。更稳妥的采用路径是从一个资料边界清晰、风险可控的部门开始,先建立带来源的问答和评测集,再逐步扩展到跨部门知识。
对准备建设类似系统的团队来说,最重要的验收标准不是“模型能否回答所有问题”,而是:它是否能在授权范围内找到最新依据,无法确定时是否诚实停下,并且让工作人员能够检查和纠正结果。