跳到主要内容

模型验证

训练完成后,AI Studio 提供全面的验证评估工具,帮助工程师从多个维度评估模型性能,确保模型达到工业部署标准。


验证入口

训练完成后,系统自动进入验证评估页面。也可以通过模型库中已训练模型的"验证"按钮手动进入。

┌─────────────────────────────────────────────────────────────┐
│ 模型验证 — gear_defect_v1 │
├─────────────────────────────────────────────────────────────┤
│ 模型: gear_defect_yolov8s_v3 │
│ 数据集: gear_defect_v1 (v3) │
│ 训练用时: 2h 34m │
│ 最佳 Epoch: 87/100 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 概览指标: │
│ │
[email protected] [email protected]:0.95 Precision Recall │
│ 0.928 0.674 0.941 0.915 │
│ │
│ [导出报告] │
└─────────────────────────────────────────────────────────────┘

验证指标

核心指标

指标含义范围工业合格参考
Precision(精确率)预测为正类中真正的正类比例0~1≥ 0.90
Recall(召回率)真正的正类中被正确检出的比例0~1≥ 0.85
[email protected]IoU 阈值 0.5 时的平均精度均值0~1≥ 0.90
[email protected]:0.95多 IoU 阈值(0.5~0.95)的平均精度均值0~1≥ 0.50
F1-ScorePrecision 和 Recall 的调和平均0~1≥ 0.87

各项含义详解

Precision(精确率):

Precision = TP / (TP + FP)

预测的缺陷中有多少是真的缺陷。高 Precision 意味着误检少(把良品判为缺陷的情况少)。

Recall(召回率):

Recall = TP / (TP + FN)

真正的缺陷中有多少被检出。高 Recall 意味着漏检少(缺陷没被漏掉)。

mAP(Mean Average Precision):

mAP = 对所有类别的 AP 取平均

综合衡量模型在各个类别上的检测精度。[email protected] 是工业场景最常用的指标。


混淆矩阵

混淆矩阵直观展示模型在每个类别上的分类表现:

                预测值
┌─────────────────────────────────────────┐
│ 良品 划痕 裂纹 背景 │
┌───┼─────────────────────────────────────────┤
真 │良品│ 482 8 4 4 │
际 ├───┼─────────────────────────────────────────┤
值 │划痕│ 6 348 12 6 │
├───┼─────────────────────────────────────────┤
│裂纹│ 3 10 350 12 │
├───┼─────────────────────────────────────────┤
│背景│ 5 4 6 945 │
└───┴─────────────────────────────────────────┘
  • 主对角线(绿色高亮):正确预测的数量,越大越好
  • 非对角线(红色标记):错误预测,需要关注
  • 背景列:假正例(FP)——误检
  • 背景行:假反例(FN)——漏检

从上面示例可见:

  • 良品类别:482/498 正确(96.8%),主要误判为划痕(8 例)
  • 划痕类别:348/372 正确(93.5%),与裂纹有交叉混淆(12 例)
  • 裂纹类别:350/375 正确(93.3%),与划痕有交叉混淆(10 例)

测试集评估

使用训练时保留的测试集(从未参与训练和验证)进行最终评估。

逐图结果

测试集评估结果 (62 张)
═══════════════════════════════════════════════════════════════

图像 001 — 良品 ✅
预测: 良品 (置信度 0.97) 真实: 良品

图像 002 — 划痕 ✅
预测: 划痕 (置信度 0.92) 真实: 划痕

图像 003 — 裂纹 ⚠️
预测: 划痕 (置信度 0.51) 真实: 裂纹 ← 漏检(FN)
└─ 建议:该裂纹尺寸较小(32×18px),可考虑增加小目标增强

图像 004 — 良品 ✅
预测: 良品 (置信度 0.95) 真实: 良品
...

测试集统计汇总

测试集评估汇总
═══════════════════════════════════════════════

总图像: 62 张
正确: 56 张 (90.3%)
错误: 6 张 (9.7%)
├─ 漏检 (FN): 4 张
└─ 误检 (FP): 2 张

按类别:
良品: 30/31 (96.8%) ── 1 误检为划痕
划痕: 15/16 (93.8%) ── 1 漏检
裂纹: 13/15 (86.7%) ── 2 漏检 ← 需改进

模型对比

AI Studio 支持将当前模型与历史版本进行对比,直观展示迭代效果。

选择对比模型

对比模型: gear_defect_v1 (v2) vs gear_defect_v1 (v3)
═══════════════════════════════════════════════════════════════

指标 v2 (2026-07-15) v3 (2026-07-22) 变化
───────────────────────────────────────────────────────────
[email protected] 0.887 0.928 +0.041 ↑
[email protected]:0.95 0.612 0.674 +0.062 ↑
Precision 0.903 0.941 +0.038 ↑
Recall 0.874 0.915 +0.041 ↑
F1-Score 0.888 0.928 +0.040 ↑
训练时间 1h 52m 2h 34m +42m
模型大小 (ONNX) 22.4 MB 22.4 MB —

可视化对比

AI Studio 支持在同一张测试图像上并排显示两个模型的推理结果,便于直观比较差异:

v2 (2026-07-15)                v3 (2026-07-22)
┌────────────────────┐ ┌────────────────────┐
│ │ │ │
│ [图像] │ │ [图像] │
│ │ │ │
│ 划痕 0.82 ──┐ │ │ 划痕 0.94 ────── │
│ │ │ │ │
│ │ │ │ + 裂纹 0.87 ← 新增检出
│ 裂纹 未检出 │ │ │
└────────────────────┘ └────────────────────┘

可视化验证结果

AI Studio 提供丰富的可视化工具,帮助理解模型行为:

检测结果可视化

在测试集图像上叠加显示模型预测结果:

标注框颜色说明:
┌─────────────────────────────────────────┐
│ 绿色 ── 正确检测 (TP) │
│ 红色 ── 误检 (FP) │
│ 黄色 ── 漏检 (FN,人工标注但模型未检出) │
│ 数字 ── 置信度 (0~1) │
└─────────────────────────────────────────┘

Precision-Recall 曲线

显示每个类别的 PR 曲线,曲线下面积(AP)越大越好:

  Precision
1.0 ┤ ╱╲
│ ╱ ╲
0.8 ┤ ╱ ╲
│ ╱ ╲
0.6 ┤ ╱ ╲
│ ╱ ╲
0.4 ┤╱ ╲
│ ╲
0.2 ┤ ╲
│ ╲
0.0 ┤─────────────────────── Recall
1.0 0.8 0.6 0.4 0.2 0.0

良品 (AP=0.985) ── 划痕 (AP=0.942)
裂纹 (AP=0.918) ──

验证报告导出

验证完成后,可导出标准格式的报告:

支持导出格式:

  • PDF: 包含所有指标、图表和汇总的完整报告
  • JSON: 结构化指标数据,便于自动化处理
  • CSV: 逐图检测结果表格

报告内容:

  1. 模型元信息(名称、架构、训练参数)
  2. 核心指标汇总表
  3. 混淆矩阵
  4. 各类别详细指标
  5. Precision-Recall 曲线
  6. 测试集逐图结果
  7. 失败案例汇总(漏检/误检 Top-N)

导出报告可用于内部评审或交付客户的质量证明文档。