把“识别得好”变成可复核的条件

先选一个明确工位,把识别对象、完成条件、异常类型和业务后果写清楚。相同画面应由业务人员给出一致的参考判定;分歧先复核,不急于计算总分。

验证样本应区分正常与异常,覆盖计划使用的产品、班次、光照、遮挡与作业节奏,并与训练数据区分。没有覆盖的条件,应列为适用范围之外或待验证项。

不要只看一个“准确率”

漏检
在人工确认的异常样本中,有多少未被系统识别?按异常类型分别报告数量、比例和样本量;没有异常样本时,不能报告“漏检率为零”。
误报
在人工确认的正常样本中,有多少被判为异常?同时观察每班次复核量,避免整体比例掩盖现场负担。
作业步骤与顺序
区分“动作发生”“步骤完成”“顺序正确”;约定事件匹配时间窗,并记录遗漏、重复与错误顺序。
现场运行
按约定的工位数量、输入质量和持续时间验证延迟、断网、异常恢复与人员处理流程,不能只测单个算法环节。

每项结果都要带上统计单位、样本量、时间范围、产品与模型版本、相机条件及人工复核方法。验收阈值由项目双方在测试前约定,不使用一套数字承诺所有工厂。

案例里的数字,分别能说明什么

  • 视频时长、帧数、阶段片段数:说明已处理的资料与输出规模,不代表识别准确率。
  • 关键帧和标注条数:说明数据准备进度,不代表完成生产验收。
  • 条码解码耗时:只说明对应解码环节,不能当作整套装箱核验的响应时间。
  • 数据导入校验问题为 0:说明对应检查通过,不代表生产准确率,也不能证明没有漏检或误报。

阅读案例时,先看它处于样本准备、验证还是正式生产阶段,再看结果在什么条件下成立。查看案例与证据范围 →

投入产出,先建立同口径基线

实施前记录现有复核耗时、返工报废、异常追溯耗时及相关成本;实施后在相近产品、产量和时间窗口下比较,并单列工艺、人员或设备同时变化的影响。

收益只计入有依据的节省或损失减少,避免人工节省与产能收益重复计数。成本应包含软件、硬件、实施、维护、数据准备和新增复核工作。没有可靠基线时,先验证可行性,不给出回本周期承诺。

试点结束,做出一个明确决定

  1. 继续上线:达到事先约定的指标,运行条件与责任分工得到确认。
  2. 限定使用:仅在已验证的产品、工位和条件内使用,未覆盖部分保留人工流程。
  3. 补条件再验证:先调整光照、机位、样本或异常定义,再重新测量。

更换产品、相机、工艺或模型后,要判断原验收是否仍然适用。了解两种训练模式与运行条件 →