跳到主要内容

数据集管理

数据集是模型训练的基础。AI Studio 提供完整的数据集生命周期管理功能,包括创建、导入、标注、版本控制和数据集划分。


创建数据集

在 AI Studio 主界面点击"新建数据集",弹出创建对话框:

┌─────────────────────────────────────────────────────────────┐
│ 新建数据集 │
├─────────────────────────────────────────────────────────────┤
│ 数据集名称: [_________________________] │
│ │
│ 任务类型: ○ 图像分类 ● 目标检测 ○ 语义分割 │
│ │
│ 描述: [________________________________] │
│ [________________________________] │
│ │
│ 存储路径: C:\DarraProjects\datasets\[____] │
│ │
│ [取消] [创建] │
└─────────────────────────────────────────────────────────────┘

字段说明:

  • 数据集名称: 唯一标识,建议使用英文+数字,如 gear_defect_v1
  • 任务类型: 根据项目需求选择分类/检测/分割,创建后不可更改
  • 描述: 可选,记录数据集用途、来源、标注规范等信息
  • 存储路径: 数据集在磁盘上的物理位置,自动生成

创建成功后,数据集显示在左侧数据集列表中,初始状态为"空"。


导入图像

数据集创建后,需要导入图像数据。支持以下导入方式:

从本地文件夹导入

点击"导入图像"按钮,选择包含图像的文件夹。支持格式:

格式说明
.jpg / .jpegJPEG 压缩格式,推荐
.png无损压缩,适合需要透明通道的场景
.bmp无压缩,文件较大
.tiff / .tif多页 TIFF 文件

导入时自动进行以下处理:

  • 校验图像完整性(损坏文件自动跳过并记录日志)
  • 自动转换色彩空间为 RGB
  • 可选统一缩放至指定分辨率(建议 640×640 或 416×416)
  • 文件名冲突自动重命名

从相机采集

连接 USB 或 GigE 工业相机后,可直接在 AI Studio 中采集图像:

┌─────────────────────────────────────────────────────────────┐
│ 相机实时采集 │
├─────────────────────────────────────────────────────────────┤
│ │
│ [ 实时预览画面 ] │
│ │
│ │
│ 相机: [Basler ace acA2440-20gm ▼] │
│ 分辨率: [2448 × 2048 ▼] 格式: [.png ▼] │
│ │
│ 采集模式: ● 单张 ○ 连续 ○ 触发 (外部信号) │
│ │
│ 保存位置: [数据集/gear_defect_v1/raw/ ] │
│ │
│ [采集] [停止] │
└─────────────────────────────────────────────────────────────┘

从外部数据集导入

支持导入标准格式的外部数据集:

  • COCO JSON: Microsoft COCO 标准标注格式
  • VOC XML: PASCAL VOC 标注格式
  • YOLO TXT: YOLO 格式的标注文件
  • Darra 导出格式: 从其他 Darra 数据集导出的压缩包

导入外部标注时,系统会自动匹配图像与标注文件,并验证标注完整性。


数据集标注

标注是监督学习的关键步骤。AI Studio 提供内置标注工具,详见标注工具章节。

此外支持两种非手动标注方式:

外部标注导入

从第三方标注工具(如 LabelImg、CVAT、Roboflow)导出的标注文件,可通过"导入标注"功能直接关联到数据集。

预标注模型辅助

使用已有的训练模型对未标注图像进行自动预标注,工程师只需校正偏差,大幅减少标注时间:

预标注流程:
1. 选择已训练的模型作为预标注器
2. 选中一批未标注图像
3. 点击"预标注" → 自动生成初始标注
4. 逐张审核、微调边界框/掩码
5. 确认后写入正式标注

数据集版本管理

数据集在迭代过程中可能需要多次调整标注或增删图像。AI Studio 支持版本管理,记录每次变更。

创建版本

数据集: gear_defect_v1
当前版本: v3 (2026-07-20)
标注数量: 1,245 张

点击"创建版本"后,系统自动:

  1. 冻结当前所有图像和标注
  2. 生成版本号(自动递增)
  3. 记录版本说明(由用户填写变更摘要)
  4. 计算版本统计信息(图像数、标注数、类别分布)

版本对比

选择两个版本可进行对比分析:

指标v2v3变化
图像总数1,0201,245+225
标注总数2,3102,890+580
类别数55
平均标注/图2.262.32+0.06

版本回滚

如需恢复到历史版本,右键版本列表中的目标版本 → "回滚到此版本"。回滚操作会创建新版本(源版本保留),不会覆盖现有数据。


数据集划分

训练前需要将数据集划分为三个子集:

┌─────────────────────────────────────────────────────────────┐
│ 数据集划分 │
├─────────────────────────────────────────────────────────────┤
│ 数据集: gear_defect_v1 (1,245 张) │
│ │
│ 划分比例: │
│ 训练集: [80]% (996 张) │
│ 验证集: [15]% (187 张) │
│ 测试集: [5]% (62 张) │
│ │
│ 划分方式: │
│ ● 随机划分 ○ 按文件夹 ○ 分层抽样 (保持类别比例) │
│ │
│ 随机种子: [42] (固定种子可复现划分结果) │
│ │
│ [取消] [应用] │
└─────────────────────────────────────────────────────────────┘

划分策略

  • 随机划分: 简单随机抽样,适用于类别均衡的数据集
  • 按文件夹: 按文件夹目录结构划分,适用于已有整理的数据
  • 分层抽样: 按类别比例均匀分配,推荐用于类别不平衡的数据集

划分后操作

应用划分后,数据集的统计面板会显示各子集的详细信息:

数据集: gear_defect_v1
├─ 训练集: 996 张 (80.0%)
│ ├─ 良品: 498 张
│ ├─ 划痕: 249 张
│ └─ 裂纹: 249 张
├─ 验证集: 187 张 (15.0%)
│ ├─ 良品: 94 张
│ ├─ 划痕: 47 张
│ └─ 裂纹: 46 张
└─ 测试集: 62 张 (5.0%)
├─ 良品: 31 张
├─ 划痕: 16 张
└─ 裂纹: 15 张
提示

建议测试集至少保留 50 张以上,以保证评估结果的统计意义。对于小数据集(<500 张),可适当减少测试集比例(如 5%),但不应低于 30 张。