E

AVIA · 数据治理

训练之前先发现数据问题

每个样本都被嵌入同一空间,质量问题清晰可见:与邻居相悖的标签、近重复、离群样本,以及数据集几乎没有覆盖的区域。

质量检查嵌入离群异常浮现于空间稀疏之处图像维度检查过暗模糊重复过曝在进入训练之前就被拦下

质量诊断

四类数据问题尽早发现

疑似错标

与嵌入空间中邻居相悖的标签,会被标记出来等待复核。

近重复

没有新增信息的画面,在影响训练之前就被精简。

离群样本

损坏、误拍或分布外的样本,在空间的稀疏边缘浮现。

覆盖不足

稀疏区域精确指出:哪些场景与缺陷类型你还缺。

同一空间

一眼看全整个数据集

图像与文本映射到同一个共享嵌入空间——用一句话或一张参考图检索,直观查看聚类、缺口与稀疏边缘。

  • 用文本或参考图像检索样本
  • 聚类与稀疏边缘一目了然
  • 诊断结果直接标注在空间中
嵌入地图统一空间 · 向量索引T文本:叉车参考图像由 CLIP · DINO · SigLIP 嵌入 — 用文本或参考图像查询

主动学习

优先标注模型最需要的批次

不确定性与多样性评分为未标注数据排序——让你接下来标注的一批,正是模型最需要的那批。

  • 不确定性挑出模型拿不准的样本
  • 多样性保证批次不自我重复
  • 亲手标注的比例逐轮下降
主动学习循环数据集 · 10 万+ 样本● 已标注 ◦ 不确定 · 多样训练训练快速模型第 1 轮 · 已标注 0.1%每轮比例递减模型重新进入循环 · 不确定性 + 多样性决定下一批

运行方式

从嵌入到选出下一批

01

嵌入

每个样本映射进同一可检索空间。

02

诊断

错标、重复、离群与缺口被标记出来。

03

复核

人工确认或排除每一个标记。

04

选批

主动学习挑出下一批最有价值的数据。

常见问题

常见问题

诊断基于嵌入,而非你的模型。样本被嵌入共享空间后,与邻居冲突的标签、近重复与离群样本,都是这个空间的几何属性。

训练之前先诊断一遍数据

带上一个数据集——一遍跑出它的错标、重复与缺口。