模型训练
AI Studio 的训练模块支持从数据集到模型的完整训练流程。您无需编写任何训练脚本,通过 GUI 配置即可启动训练任务。
训练配置入口
在数据集管理页面,选择已划分好的数据集版本,点击"开始训练"进入训练配置向导:
┌─────────────────────────────────────────────────────────────┐
│ 训练配置 — gear_defect_v1 │
├─────────────────────────────────────────────────────────────┤
│ 步骤 1/3: 选择模型架构 │
│ │
│ ┌──────────────────────────────────────────────────────┐ │
│ │ ● YOLOv8s (检测) 推荐 精度/速度均衡 │ │
│ │ ○ YOLOv8n (检测) 轻量快速 │ │
│ │ ○ YOLOv8m (检测) 高精度 │ │
│ │ ○ YOLOv8l (检测) 极高精度 │ │
│ │ ○ ResNet-50 (分类) 标准分类网络 │ │
│ │ ○ MobileNet-V3 (分类) 移动端优化 │ │
│ │ ○ UNet (分割) 标准分割网络 │ │
│ └──────────────────────────────────────────────────────┘ │
│ │
│ [上一步] [下一步] │
└─────────────────────────────────────────────────────────────┘
选择模型架构
AI Studio 提供预置的模型架构库,按任务类型分组:
目标检测模型
| 模型 | 速度 | 精度 | 显存需求 | 推荐场景 |
|---|---|---|---|---|
| YOLOv8n | 极快 | 中等 | 2 GB | 边缘设备、实时检测 |
| YOLOv8s | 快 | 较高 | 4 GB | 通用检测任务 |
| YOLOv8m | 中等 | 高 | 8 GB | 高精度检测 |
| YOLOv8l | 慢 | 极高 | 12 GB | 离线高精度检测 |
| RT-DETR-l | 中等 | 极高 | 10 GB | 需统一检测+分割 |
图像分类模型
| 模型 | 速度 | 精度 | 推荐场景 |
|---|---|---|---|
| MobileNet-V3 | 极快 | 中等 | 边缘设备 |
| ResNet-18 | 快 | 较高 | 通用分类 |
| ResNet-50 | 中等 | 高 | 高精度分类 |
| EfficientNet-B3 | 中等 | 很高 | 精度优先 |
语义分割模型
| 模型 | 精度 | 显存需求 | 推荐场景 |
|---|---|---|---|
| UNet | 高 | 6 GB | 通用分割 |
| DeepLabV3+ | 很高 | 8 GB | 高精度分割 |
| SegFormer-B0 | 中等 | 4 GB | 轻量分割 |
超参数设置
第二步配置训练超参数:
┌─────────────────────────────────────────────────────────────┐
│ 训练配置 — 步骤 2/3 │
├─────────────────────────────────────────────────────────────┤
│ 超参数设置: │
│ │
│ 训练轮数 (Epochs): [100 ] │
│ 批次大小 (Batch): [16 ] 推荐: 16-64 │
│ 初始学习率: [0.001 ] │
│ 优化器: [AdamW ▼] │
│ 权重衰减: [0.0005 ] │
│ 学习率调度: [余弦退火 ▼] │
│ │
│ 数据增强: │
│ ☑ 随机翻转 (水平) │
│ ☑ 随机缩放 (±20%) │
│ ☐ 随机旋转 (±15°) │
│ ☑ 色彩抖动 (HSV) │
│ ☐ 马赛克增强 (Mosaic) │
│ ☑ 混合增强 (MixUp) │
│ │
│ 训练设备: ● GPU (CUDA) ○ CPU ○ 自动选择 │
│ │
│ [上一步] [下一步] │
└─────────────────────────────────────────────────────────────┘
关键超参数说明
| 参数 | 说明 | 调优建议 |
|---|---|---|
| Epochs | 完整遍历训练集的次数 | 小数据集 100-300,大数据集 50-100 |
| Batch Size | 每次迭代处理的样本数 | 根据显存调整,GPU 显存一半即可 |
| Learning Rate | 参数更新步长 | AdamW 推荐 0.001,SGD 推荐 0.01 |
| Weight Decay | 正则化系数,防过拟合 | 默认 0.0005,过拟合时增大 |
数据增强
数据增强通过对训练图像进行随机变换,变相增加训练数据量,提升模型泛化能力。
- 基础增强(默认开启):翻转、缩放、色彩抖动,适用于大部分场景
- 高级增强:马赛克增强将四张图拼为一张,适合小目标检测;混合增强按比例叠加两张图,提升泛化性
提示
数据增强不是越多越好。对于工业场景,过度的几何变换可能导致模型学到不真实的特征。建议从基础增强开始,验证集精度不再提升时再逐步加入高级增强。
训练过程监控
配置完成后,点击"开始训练",系统启动后台训练任务。训练监控面板实时显示进度:
┌─────────────────────────────────────────────────────────────┐
│ 训练监控 — gear_defect_v1 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 进度: ████████████████████░░░░░░░ 65/100 Epochs │
│ │
│ 损失曲线 精度曲线 ([email protected]) │
│ ┌──────────────────────┐ ┌──────────────────────┐ │
│ │ Loss ── Train │ │ mAP ── Val │ │
│ │ ╲ │ │ ╱╲ │ │
│ │ ╲ │ │ ╱ ╲ │ │
│ │ ╲___ │ │ ╱ ╲___ │ │
│ │ ╲___ │ │ ╱ ╲ │ │
│ │ ╲ │ │ ╱ ╲ │ │
│ │ ╲ │ │ ╱ ╲ │ │
│ └──────────────────────┘ └──────────────────────┘ │
│ Loss: 0.032 [email protected]: 0.892 │
│ │
│ 学习率曲线 GPU 利用率 │
│ ┌──────────────────────┐ ┌──────────────────────┐ │
│ │ lr │ │ GPU Util │ │
│ │ ╲ │ │ ████████████ 87% │ │
│ │ ╲ │ │ 显存: 5.2/8.0 GB │ │
│ │ ╲ │ │ 温度: 72°C │ │
│ │ ╲ │ │ 剩余时间: 12:34 │ │
│ └──────────────────────┘ └──────────────────────┘ │
│ │
│ 日志: │
│ [12:34:56] Epoch 065/100 ─ loss: 0.032 ─ [email protected]: 0.892 │
│ [12:30:12] Epoch 060/100 ─ loss: 0.035 ─ [email protected]: 0.887 │
│ [12:25:30] Epoch 055/100 ─ loss: 0.038 ─ [email protected]: 0.881 │
│ │
│ [暂停] [停止] [最小化到托盘] │
└─────────────────────────────────────────────────────────────┘
监控指标
| 指标 | 含义 | 期望趋势 |
|---|---|---|
| Train Loss | 训练集损失值 | 持续下降,最终趋于平稳 |
| Val Loss | 验证集损失值 | 下降后趋于平稳,若上升则过拟合 |
| [email protected] | IoU 阈值 0.5 时的平均精度 | 持续上升,最终趋于平稳 |
| [email protected]:0.95 | 多阈值平均精度(更严格) | 上升,通常低于 [email protected] |
| Learning Rate | 学习率变化曲线 | 按调度策略衰减 |
训练中断与恢复
自动保存检查点
训练过程中每 5 个 Epoch 自动保存检查点(Checkpoint),包含:
- 模型权重
- 优化器状态
- 当前 Epoch 号
- 当前最佳验证精度
手动暂停与恢复
- 暂停: 训练完成后自动暂停;也可手动点击"暂停"
- 恢复: 从最近检查点恢复训练,延续进度,不会从头开始
- 中断处理: 训练过程中 IDE 意外关闭,重新打开 AI Studio 后,训练任务显示"已中断",可一键恢复
提前停止
验证集精度连续 20 个 Epoch 未提升时,系统自动弹出提示建议提前停止训练,避免过拟合。您可以选择:
- 接受建议:停止训练,保留最佳模型
- 继续训练:手动延长训练轮数
硬件要求
训练模块对硬件有较高要求,建议参考以下配置:
GPU 训练(推荐)
| 模型规模 | 推荐 GPU | 显存需求 | 训练时间参考 (1,000 张, 100 Epoch) |
|---|---|---|---|
| YOLOv8n | GTX 1060 | 2 GB | ~1.5 小时 |
| YOLOv8s | RTX 2060 | 4 GB | ~2 小时 |
| YOLOv8m | RTX 3060 | 8 GB | ~3 小时 |
| YOLOv8l | RTX 4080 | 12 GB | ~5 小时 |
CPU 训练
- 支持 CPU 训练,速度约为 GPU 的 1/10 至 1/20
- 推荐使用轻量模型(YOLOv8n、MobileNet-V3)
- 适合小数据集(< 500 张)或模型原型验证
环境检测
开始训练前,AI Studio 会自动检测运行环境,并在训练配置页面显示检测结果:
环境检测结果:
✅ CUDA 11.8 — 可用
✅ cuDNN 8.9 — 可用
✅ GPU: NVIDIA RTX 3060 (12 GB) — 可用
⚠ 显存剩余: 8.5 GB — 足够训练 YOLOv8s
✅ Python 3.10 — 可用
✅ ONNX Runtime 1.16 — 可用
缺少依赖时,系统会引导一键安装所需组件。