项目背景:模型准确率不错,为什么一上产线就出问题
客户是一家工业零部件制造企业,长期依赖人工完成外观缺陷检测。随着产量增长,人工质检逐渐暴露出三类问题:
- 检测成本持续上升。
- 不同质检人员的判断标准不一致。
- 长时间重复作业容易造成疲劳漏检。
为降低人工成本、提高质量稳定性,企业启动了 AI 视觉质检项目。
早期试点中,模型在测试数据上的准确率表现不错。但接入真实产线后,误判明显增加,甚至多次触发停线。生产团队认为系统影响效率,质量团队担心放行风险,技术团队则认为模型已经达到验收标准。
项目由此陷入争议:模型能用,但产线不敢用。
关键诊断:问题不只在模型
复盘后我们发现,试点效果无法复制到产线,并不是单一的算法问题,而是数据、环境、流程和管理机制没有同步建立。
主要问题集中在四个方面。
1. 样本覆盖不足
训练数据以典型缺陷为主,缺少真实生产环境中的边界样本,例如:
- 轻微划痕与正常纹理之间的模糊情况。
- 油污、反光造成的疑似缺陷。
- 多种缺陷同时出现的复杂样本。
- 不同批次原材料带来的外观差异。
模型可以识别“标准答案”,却难以处理产线上的复杂情况。
2. 图像采集环境不稳定
不同班次、设备位置和产品批次之间,光照强度、拍摄角度、工件位置存在差异。
这些变化在人眼看来影响不大,却可能明显改变模型判断结果。缺少统一的采集标准,模型准确率就无法稳定复现。
3. 误判后的处理流程不清
系统发现疑似缺陷后,现场人员不知道应该立即停线、人工复核,还是继续生产。
一旦出现误判,各方都倾向于规避责任,导致频繁停线或重复确认。AI 没有减少工作,反而增加了沟通成本。
4. 三方指标没有统一
质量、生产和技术团队关注的目标并不相同:
团队 核心关注指标 质量团队 漏检率、缺陷拦截率 生产团队 产线节拍、停线次数 技术团队 准确率、召回率、响应时间如果只用模型准确率验收,无法说明系统是否真正适合生产。只有把质量风险和生产效率纳入同一套指标体系,三方才可能共同决策。
第一阶段:先稳定数据和采集环境
我们没有立即调整模型,而是先统一数据来源和现场采集标准。
主要动作包括:
- 固定相机位置、拍摄距离和角度。
- 统一光源强度、色温和背景环境。
- 建立缺陷分类、严重程度和标注规则。
- 为每类缺陷建立持续更新的样本池。
- 单独保留误判、漏判和存在争议的样本。
- 记录产品批次、设备状态、班次和环境变化。
这一步的重点不是单纯增加样本数量,而是让训练数据能够覆盖真实产线中的变化。
我们还建立了争议样本复盘机制。由质量、生产和技术人员共同确认样本归类,避免不同团队使用不同标准评价模型。
第二阶段:用风险分级设计人机协同
在产线初期,AI 不直接决定产品的最终去向,而是根据识别结果输出风险等级。
高风险:自动拦截,必须复核
适用于置信度高、质量影响严重的缺陷。系统自动拦截产品,并通知质检人员进行确认。
中风险:进入抽检或复检
适用于疑似缺陷、边界缺陷以及模型置信度不足的情况。系统将产品送入人工复检队列,不直接触发整条产线停机。
低风险:正常放行,持续留样
适用于未发现明显异常的产品。系统允许产品通过,同时保留部分图片,用于后续抽检和模型效果评估。
这一机制把 AI 从“最终裁判”调整为“风险筛选器”,既降低了漏检风险,也避免因单次误判频繁打断生产。
随着数据积累和模型表现趋于稳定,再逐步扩大自动判定范围。
第三阶段:让系统适配产线节拍
工业质检系统不仅要识别准确,还必须在规定时间内完成采集、分析和处置。
如果模型判断时间超过产线节拍,即使准确率再高,也无法投入实际生产。
我们将整个质检过程拆分为多个节点:
- 图像采集:在固定工位完成拍摄和质量检查。
- 模型识别:异步处理图像,减少对设备运行的影响。
- 风险分级:根据缺陷类型、置信度和业务规则生成处置结果。
- 现场提示:只向对应岗位推送必要信息。
- 人工复核:对高风险和争议样本进行确认。
- 异常记录:自动保存图片、判断结果、复核结论和处置过程。
通过拆分流程,模型响应、图片上传或人工复核不再成为单点阻塞。即使某个环节短暂异常,也不会直接拖慢整条产线。
第四阶段:建立共同验收指标
为了避免项目再次陷入“技术说能用、生产说不好用”的争议,我们重新设计了验收指标。
模型指标
- 缺陷召回率。
- 误判率与漏判率。
- 不同缺陷类型的识别效果。
- 边界样本的判断稳定性。
生产指标
- 单件检测耗时。
- 系统对产线节拍的影响。
- 因误判造成的停线次数。
- 异常情况下的恢复时间。
质量指标
- 高风险缺陷漏检率。
- 人工复核准确率。
- 客户投诉和退货情况。
- 不同批次产品的质量波动。
经营指标
- 人工质检工作量。
- 单件检测成本。
- 返工与报废成本。
- 项目投入回收周期。
这套指标让项目不再只关注模型表现,而是共同判断 AI 是否真正改善了质量、效率和成本。
项目结果
经过三个月的试运行和持续优化,项目取得了以下结果:
- 人工质检工作量下降 31%。
- 高风险缺陷漏检率下降 18%。
- 因误判造成的产线停线次数下降 42%。
- 争议样本形成持续回流机制,模型能够根据真实生产数据迭代。
更重要的是,质量、生产和技术团队形成了统一的异常处理与复盘机制。AI 质检不再是技术部门独立维护的工具,而是正式进入了生产质量管理流程。
案例启示:工业 AI 落地要同时改造四个环节
工业质检 AI 从试点走向稳定运行,至少需要处理四个问题:
- 数据是否覆盖真实生产环境。
- 采集条件是否足够稳定。
- 人机协同流程是否清晰。
- 质量、生产和技术指标是否统一。
模型准确率只是起点,并不是最终结果。
工业 AI 落地的本质,也不是把一个模型部署进工厂,而是把识别能力嵌入生产流程、质量标准和责任机制。只有数据、设备、流程与组织协同运行,AI 才能真正从演示项目走向稳定产线。
