福特这次的动作很有现实感:生产线上装了大量 AI 摄像头,希望用机器视觉替代一部分资深工程师的质量判断,结果发现效果不够稳,于是三年里重新找回、招进、提拔了大约 350 位技术专家。内部把这些人称为 “gray beard”,也就是经验很深的老工程师、老专家。
这件事的重点不是“AI 没用”,而是质量控制这种工作不能只靠识别缺陷。真正难的是判断缺陷从哪里来、是否会扩散、该不该停线、供应链哪一环需要被追责。这些判断往往来自多年现场经验,而不是单张图片上的分类结果。
AI 摄像头能看见问题,但不一定理解问题
生产线上的 AI 摄像头很适合做几类事情:发现划痕、错装、漏装、间隙异常、颜色差异,或者把异常图片快速推给质检系统。它的优势是稳定、持续、不会疲劳,也能覆盖人眼不可能长期盯住的工位。
但质量管控不是“发现一张异常图片”这么简单。比如同样是装配缝隙异常,可能来自零件公差、夹具磨损、工人操作、供应商批次、温湿度变化,也可能只是摄像头角度或光照变化造成的误报。
资深工程师的价值在这里显现出来:他们能把一个视觉异常放回工艺链条里看,问出更关键的问题:
- 这个问题是单点偶发,还是批量趋势?
- 当前缺陷会不会影响安全、召回或保修成本?
- 是该调模型阈值,还是该停线查夹具?
- 供应商最近有没有换材料、换模具、换班组?
- 过去类似问题最后是怎么收敛的?
AI 可以当“眼睛”,但质量系统还需要“诊断经验”。福特把老专家请回来,说明它不是简单放弃 AI,而是在补上生产系统里最难自动化的那一层。
350 位专家补的是判断链,不只是人手
摘要里提到,福特三年内找回、招进、提拔了大约 350 位技术专家,其中既有前员工,也有供应链上的老专家。这种配置很有意思,因为汽车质量问题经常跨越公司边界。
一个最终装配缺陷,可能根因在供应商的铸造、冲压、涂层、电子件校准,或者运输包装。只在主机厂产线末端用 AI 摄像头拦截,最多是“把坏件挑出来”;要降低缺陷率,必须回到上游工艺。
这也是很多 AI 质检项目容易翻车的地方:团队把系统目标设成“识别准确率”,而业务真正需要的是“减少返修、停线、保修、召回和客户投诉”。两个目标有关联,但不是一回事。
更合理的组织方式是让 AI 做三件事:
- 自动收集异常证据,包括图片、时间、工位、批次、设备状态;
- 给出初步分级和相似案例,减少专家翻资料的时间;
- 把专家最终判断反哺给模型和规则系统。
专家不是 AI 系统的替代品,也不该只是“人工兜底”。他们应该变成反馈闭环里的核心标注者、根因分析者和规则制定者。
可以这样实践:给 AI 质检加一个“专家复核阈值”
下面是一个可改造的小例子。它不声称代表福特内部系统,只演示一种工程实践:AI 视觉模型输出缺陷概率后,不直接决定放行或报废,而是结合缺陷类型、置信度、批次趋势,把一部分样本送给资深工程师复核。
保存为 quality_gate.py 后可以直接运行:
from dataclasses import dataclass
from enum import Enum
from typing import List
class Decision(str, Enum):
PASS = "pass"
REWORK = "rework"
EXPERT_REVIEW = "expert_review"
STOP_AND_INVESTIGATE = "stop_and_investigate"
@dataclass
class InspectionResult:
vin: str
station: str
defect_type: str
ai_score: float
batch_defect_rate: float
safety_related: bool
def decide_quality_gate(item: InspectionResult) -> Decision:
# 安全相关缺陷不要只交给模型阈值处理。
if item.safety_related and item.ai_score >= 0.40:
return Decision.EXPERT_REVIEW
# 批次缺陷率升高时,即使单件置信度不极端,也应触发调查。
if item.batch_defect_rate >= 0.08 and item.ai_score >= 0.50:
return Decision.STOP_AND_INVESTIGATE
# 高置信度非安全缺陷可以直接返修。
if item.ai_score >= 0.90:
return Decision.REWORK
# 模型最不稳定的中间区间,交给专家复核并记录结论。
if 0.55 <= item.ai_score < 0.90:
return Decision.EXPERT_REVIEW
return Decision.PASS
def main() -> None:
samples: List[InspectionResult] = [
InspectionResult("VIN001", "door-fit", "panel_gap", 0.62, 0.03, False),
InspectionResult("VIN002", "brake-line", "clip_missing", 0.45, 0.02, True),
InspectionResult("VIN003", "paint", "scratch", 0.93, 0.01, False),
InspectionResult("VIN004", "seat", "bolt_alignment", 0.71, 0.10, False),
]
for item in samples:
decision = decide_quality_gate(item)
print(f"{item.vin} {item.station} {item.defect_type}: {decision.value}")
if __name__ == "__main__":
main()
运行:
python quality_gate.py
你可以改三类参数来贴近自己的场景:
ai_score:模型对缺陷存在的置信度;batch_defect_rate:最近一个批次或时间窗口的异常比例;safety_related:是否涉及制动、转向、电池、气囊等安全相关系统。
这个例子的核心不是阈值本身,而是决策结构:AI 负责持续检测,规则负责风险分流,专家负责高风险和不确定样本的判断。后续还可以把专家结论写回数据库,作为模型再训练和工艺改进的输入。
真正要建的是闭环,不是摄像头项目
很多企业引入 AI 质检时,会从设备和模型开始:买摄像头、采图、训练模型、上看板。这些都必要,但还不够。质量系统能不能跑起来,关键看闭环是否存在。
一个更扎实的落地清单可以这样写:
- 每个 AI 报警必须绑定工位、时间、批次、供应商、设备状态;
- 中等置信度样本必须有专家复核队列,而不是简单丢弃;
- 专家结论要结构化记录,包括真实缺陷、误报、根因、处置动作;
- 模型指标之外,还要跟踪返修率、停线次数、保修索赔和客户投诉;
- 一旦批次趋势异常,系统应触发工艺或供应链调查,而不是只调模型阈值。
福特这件事给开发团队的提醒很直接:AI 可以扩大观察范围,但不能自动继承组织经验。尤其在制造、医疗、金融风控这类高成本决策场景里,最危险的不是模型犯错,而是公司误以为模型已经接管了判断责任。
更稳妥的路线是把资深工程师放进系统设计里:让他们定义风险分级、复核边界、根因分类和处置规则。AI 摄像头负责看得更广,老专家负责判断得更深。两者结合,质量系统才不只是一个漂亮的检测演示。