深圳九有数据库有限公司与北京大学联合攻关的“可信多模 AI 数据底座关键技术及应用”项目,近日通过先进技术成果西部转化中心组织的科技成果评价。专家组给出的结论是:成果技术总体达到国内领先水平,部分技术达到国际领先水平。
公开摘要没有披露具体技术架构、性能指标和产品接口,因此不能据此推断项目采用了哪些数据库内核、向量算法或模型框架。不过,“可信”“多模 AI”“数据底座”这三个关键词,已经指出了企业建设 AI 数据平台时必须同时解决的三类问题:异构数据如何统一组织,数据和模型结果如何追溯,以及访问、训练和推理过程如何接受治理。
多模数据底座不能只是一个文件仓库
多模 AI 系统处理的不再是结构化表格这一种数据。文本、图片、音频、视频、向量、标注结果和模型生成内容通常会同时进入数据链路,而且彼此存在派生关系。
例如,一段视频可能产生音轨、关键帧、字幕、文本向量和内容标签。如果平台只保存文件路径,后续很难回答几个直接影响生产的问题:
- 当前向量由哪个模型、哪个版本生成?
- 一条训练样本来自原始数据,还是模型合成数据?
- 原始文件变更后,哪些索引和标注需要重建?
- 用户撤回数据授权时,如何定位受影响的数据集和模型?
- 检索结果能否证明自己引用的是经过批准的数据版本?
因此,数据底座至少需要维护对象、元数据、内容摘要、派生关系、权限策略和处理记录。向量数据库解决的是相似度检索问题,并不能单独覆盖完整的数据治理链路。
“可信”需要落实成可检查的工程属性
可信不是一个抽象标签。落到系统设计中,它通常应当被拆成一组可以记录、验证和审计的属性。
完整性要求系统能够发现文件或记录是否被意外替换。常见做法是保存 SHA-256 等内容摘要,并在数据进入训练或推理任务前重新校验。
来源可追溯要求每个资产带有来源、采集时间、授权状态和处理历史。经过 OCR、切片、转码、嵌入或模型生成后,还应记录父资产和处理程序版本。
访问可控制意味着权限不能只停留在存储桶或数据库实例层面。医疗影像、合同文本等敏感数据可能需要细化到租户、数据集、字段、用途和有效期。
结果可复现则要求记录模型版本、提示词模板、参数、检索快照和运行环境。只保存最终回答,无法解释结果为何变化。
需要注意的是,通过科技成果评价并不等同于某个产品已经适用于所有生产环境。企业采购或落地时,仍应检查评价范围、测试条件、可用性、兼容性以及自身合规要求。
可以这样实践:为多模资产建立可验证清单
下面是一个仅使用 Python 标准库的最小示例。它不是九有项目的实现,而是一种可以直接改造的工程起点:程序为文件生成资产清单,记录来源、授权状态、模型版本和内容摘要,并在使用前验证文件是否被修改。
将下面内容保存为 asset_manifest.py,直接运行 python asset_manifest.py:
from __future__ import annotations
import hashlib
import json
import mimetypes
from datetime import datetime, timezone
from pathlib import Path
def sha256_file(path: Path) -> str:
digest = hashlib.sha256()
with path.open("rb") as stream:
for chunk in iter(lambda: stream.read(1024 * 1024), b""):
digest.update(chunk)
return digest.hexdigest()
def build_manifest(
path: Path,
source: str,
consent: str,
processor: str | None = None,
parent_sha256: str | None = None,
) -> dict:
return {
"schema_version": 1,
"file_name": path.name,
"media_type": mimetypes.guess_type(path.name)[0] or "application/octet-stream",
"size_bytes": path.stat().st_size,
"sha256": sha256_file(path),
"source": source,
"consent": consent,
"processor": processor,
"parent_sha256": parent_sha256,
"created_at": datetime.now(timezone.utc).isoformat(),
}
def verify(path: Path, manifest: dict) -> bool:
return path.stat().st_size == manifest["size_bytes"] and sha256_file(path) == manifest["sha256"]
def main() -> None:
asset = Path("sample.txt")
asset.write_text("可信多模 AI 数据样例\n", encoding="utf-8")
manifest = build_manifest(
asset,
source="internal-demo",
consent="training-and-retrieval",
processor="manual-import/1.0",
)
Path("sample.manifest.json").write_text(
json.dumps(manifest, ensure_ascii=False, indent=2),
encoding="utf-8",
)
print(json.dumps(manifest, ensure_ascii=False, indent=2))
print("verified:", verify(asset, manifest))
if __name__ == "__main__":
main()
生产化时,可以把清单保存到支持事务和索引的数据库中,把二进制内容放入对象存储,并为 parent_sha256 建立关系索引。对图片切片、OCR 文本和向量等派生资产,应分别创建清单,而不是覆盖原始资产记录。
还需要补上几个示例没有覆盖的能力:清单签名、密钥管理、不可篡改审计日志、租户隔离、数据保留策略、删除传播和授权到期处理。哈希只能发现内容变化,不能证明数据来源合法,也不能替代权限控制。
落地前应验证什么
可信多模 AI 数据底座的价值,最终要通过真实工作负载来判断。技术选型时可以围绕以下项目开展验证:
- 导入文本、图片、音视频和向量后,能否维持统一资产标识与派生关系。
- 原始数据删除、授权撤回或内容更新后,索引、缓存、训练集和下游副本能否同步处理。
- 检索或生成结果能否返回数据来源、版本、模型版本和处理记录。
- 在目标数据规模与并发量下,向量检索、元数据过滤和权限判断能否同时满足延迟要求。
- 审计日志是否覆盖读取、修改、导出、训练和推理,并能抵抗普通管理员直接篡改。
- 平台宣称的领先能力是否有明确测试条件、对比基线和可复现数据支撑。
此次成果评价说明,可信多模 AI 数据底座已经成为数据库与 AI 工程交叉领域的重要技术方向。对使用方而言,更务实的判断标准不是概念是否完整,而是每一份数据能否找到来源、每一次处理能否留下证据、每一项权限能否被执行,以及异常发生后能否准确定位影响范围。