当前位置: 首页 > news >正文

重新标注ImageNet!128万张图像,单标签变多标签!这个预训练模型让COCO暴涨4个点

ImageNet数据集,几乎支撑了整个深度学习时代。

但是,你有没有想过这样的一个问题:

当一张照片里同时出现“猎犬”和“汽车”,AI应该学到什么?

那些在ImageNet上训练的模型,答案是——只能学到猎犬。

汽车?不存在的,尽管它明明就在图像中,而且占据了不少的画面。

每张图像仅标注一个类别,尽管许多图像描绘了多个物体或概念。

这就是统治CV十余年的ImageNet数据集中的单标签问题!问题有多严重?

训练污染:不完整的标签,带来嘈杂的监督,阻碍模型学习真正的视觉表示。

评估失真:标注员检查图像,发现近15%的图像至少包含两个相关类别。

性能误解:在ImageNet-V2准确率骤降14%,但其并非模型退化。

而现在,罗切斯特大学的研究团队干了件大事:他们用一套全自动流程,重新标注整个ImageNet训练集!

共计128万张图像生成了完整的多标签标注,并且该流程是通用的,可以将其他单标签数据集转换为多标签形式。

论文及数据地址:https://arxiv.org/pdf/2603.05729

原文链接:从数据维度入手,我们如何前进?https://mp.weixin.qq.com/s/8Gv1S0lj1dUhUuNu2_CeZA?token=1605914997&lang=zh_CN

一、从数据维度入手,我们如何前进?

1. 自动化打标签这套流程能直接用多模态大模型替换吗?

理论上可行,但实践中未必更优。

在之前的文章中介绍过,GPT-4o等多模态大模型在视觉细粒度任务上,结果并不理想。

图像中的细微差别,需要专门的视觉表征学习,而非通用语义理解。

2. 本文将Imagnet做成多标签标注,还有什么局限?

最大的问题是:仍然框定在1000个固定类别里。

图像中出现一只登山靴,ImageNet没有这个类。怎么办?上述数据训练出的模型只能退而求其次,预测跑鞋。虽然语义相关,但终究不是正确答案。

这就是“封闭词汇”的天花板。未来的方向,必然是开放词汇检测——让模型能识别1000类之外的任何物体,并用自然语言描述它。

3. 瓶颈不在模型,而在数据,如何破?

在实际项目中遇到模型性能无法突破,不妨停下来想一想:

你的数据,真的对吗?你的标签,真的反映了真实世界吗?

更多内容请查阅原文:重新标注ImageNet!

http://www.cnnetsun.cn/news/1333413.html

相关文章:

  • skynet Monitor 线程详解
  • 2026笔记本Windows电源管理:硬盘休眠与PCIe链路
  • Python 实战:基于朴素贝叶斯的中文评价情感分析(好评 / 差评自动识别)| 附完整可运行代码
  • 一文详解Diffusion Policy
  • C++11中智能指针:shared_ptr的引用计数是线程安全的吗?
  • 不懂代码,我用AI编程给5岁女儿开发了个流光画板(带你一步一步设计一个属于自己的流光画板)
  • VScode快捷键
  • 小白从零开始勇闯人工智能:LangChain 入门指南(下)
  • AI时代的教育“外包”:中国家长将作业辅导交给机器
  • 2026年课程论文降AI率工具推荐:便宜好用才是硬道理
  • 软件系统安全赛初赛misc题-steganography wp
  • 东方仙盟・神识共创共生,智启万象—架构思路—未来之窗行业应用跨平台架构
  • linux-安装配置jdk mysql redis elasticsearch
  • Python 之程序截图的几种方式(含chromedriver下载链接)
  • android studio项目 gradle-xx-bin.zip下载失败或很慢的解决方法
  • AperiSolve 开源项目教程
  • 企业决策视角下微服务全链路性能瓶颈分析平台对比及实践指南
  • 【C语言】程序环境与预处理
  • SCUT_thesis项目:解决长章名换行后不居中的排版问题
  • PowerPlatformConnectors三大类型深度对比:自定义、认证与独立发布者连接器怎么选?
  • Pleaserun vs 手动编写init脚本:效率提升10倍的秘密
  • dbblog部署教程:Docker容器化部署与服务器配置全流程
  • AniVu BitTorrent下载功能深度测评:速度与稳定性全面测试
  • DC-TTS语音合成效果对比:LJ Speech与KSS数据集实测
  • 提升Haskell开发效率:ghcid高级功能与实用技巧
  • Saasify:让API变现从未如此简单!一站式实现API商业化的终极指南
  • Ikemen-GO开发者指南:用Go语言构建自定义格斗游戏引擎
  • GoMLX未来路线图:即将发布的5大令人期待的功能
  • lidar_camera_calib常见问题排查:从数据准备到结果验证的全流程避坑指南
  • 如何用tinygrad实现高效目标检测:YOLO和RetinaNet完整指南