当前位置: 首页 > news >正文

监督学习vs无监督学习:AI如何看懂世界

一、监督学习 vs 无监督学习

1. 监督学习(Supervised Learning)

  • 定义:模型从带有标签的数据中学习规律。
  • 关键特征:每条输入数据都有一个“正确答案”(标签)。
  • 目标:学会从输入预测输出。

例子

  • 输入一张猫的图片 → 标签是 “猫”
  • 输入一段话:“这部电影太棒了!” → 标签是 “正面情感”

🧠 常见任务:

  • 分类(Classification):预测类别(如垃圾邮件/非垃圾邮件)
  • 回归(Regression):预测数值(如房价、温度)

💡数据标注主要服务于监督学习,因为标签需要人工或半自动方式提供。


2. 无监督学习(Unsupervised Learning)

  • 定义:模型从没有标签的数据中发现隐藏结构。
  • 关键特征:只有输入,没有“正确答案”。
  • 目标:发现数据中的模式、分组或降维。

例子

  • 给1000个用户行为数据,自动分成“高活跃”“低活跃”等群体(聚类)
  • 把高维数据压缩成2D以便可视化(降维,如PCA)

🧠 常见任务:

  • 聚类(Clustering):如K-Means
  • 降维(Dimensionality Reduction)
  • 异常检测(Anomaly Detection)

❗ 无监督学习不需要人工标注,但效果通常不如监督学习可控。


对比总结表:

表格

特性监督学习无监督学习
是否需要标签✅ 需要❌ 不需要
数据标注角色核心
典型任务分类、回归聚类、降维
应用举例图像识别、语音识别客户分群、推荐系统

二、训练集、验证集、测试集的作用

想象你在教一个学生准备考试:

  • 训练集(Training Set)→ 学生平时做的练习题(用来学习)
  • 验证集(Validation Set)→ 模拟考试(用来调整学习方法)
  • 测试集(Test Set)→ 正式高考(用来最终评估水平)

详细说明:

表格

数据集占比(常见)作用是否参与模型训练?
训练集60%~80%模型从中学习参数✅ 是
验证集10%~20%调整超参数(如学习率)、选择模型、防止过拟合❌ 否(不用于更新参数,但用于决策)
测试集10%~20%最终评估模型性能,模拟真实场景❌ 否(完全隔离,只用一次)

⚠️重要原则

  • 测试集绝对不能在训练或调参时使用,否则会“作弊”,导致评估结果虚高。
  • 数据划分要随机且有代表性,避免偏差(比如所有猫图片都在测试集里)。

三、常见AI任务类型(与数据标注密切相关)

以下是三大主流计算机视觉任务(NLP也有类似分类):

1.图像分类(Image Classification)

  • 任务:判断一张图属于哪个类别。
  • 标注形式:整张图一个标签
    📌 例:image_001.jpg → "狗"

2.目标检测(Object Detection)

  • 任务:找出图中所有目标的位置和类别。
  • 标注形式:每个目标用一个边界框(Bounding Box) + 类别标签
    📌 例:在图中画一个框标出“猫”,另一个框标出“椅子”

3.语义分割(Semantic Segmentation)

  • 任务:对图像中每个像素打标签,标明属于哪个类别。
  • 标注形式:像素级掩码(Mask)
    📌 例:道路像素标为“路面”,行人像素标为“人”

🔍 还有更细粒度的任务,如:

  • 实例分割(Instance Segmentation):区分同一类别的不同个体(如两只不同的猫)
  • 关键点检测(Keypoint Detection):标出人体关节位置(用于姿态估计)

小练习(自测)

  1. 如果你要训练一个识别交通标志的模型,应该用监督学习还是无监督学习?为什么?
  2. 为什么不能用测试集来调整模型参数?
  3. 下面哪种任务需要最精细的标注?
    A. 图像分类
    B. 目标检测
    C. 语义分割

(答案见下方 👇)


参考答案

  1. 监督学习,因为需要明确知道每张图对应的是“停车标志”“限速标志”等标签。
  2. 因为会导致模型“记住”测试集,无法反映真实泛化能力,评估结果不可信。
  3. C. 语义分割(每个像素都要标注,工作量最大)
http://www.cnnetsun.cn/news/594476.html

相关文章:

  • Nodejs和vue的智慧物业缴费报修管理系统 数据分析可视化大屏系统_
  • 从产品经理到型AI产品经理:转型全攻略(建议收藏)
  • 经济学风云:1990-故事完结通知
  • Realtek音频驱动无法启动?操作指南详解
  • MediaPipe本地运行优势:对比云端API的5大核心差异实战
  • HunyuanVideo-Foley可解释性研究:探究模型决策背后的逻辑
  • ASTM D4169标准:医疗健康产品注册合规与安全基石
  • 人体骨骼检测商业化:MediaPipe Pose落地经验
  • 提升设计效率:Multisim14与Ultiboard双向更新操作指南
  • 数字信号处理篇---再看IIR滤波器设计步骤
  • AI骨骼关键点检测如何提升精度?33关节点定位调优实战
  • 减少布线成本:USB设备网络化的工厂改造案例
  • 人脸检测模型鲁棒性测试:极端光照角度下的表现
  • AI骨骼检测用于体感游戏?交互系统搭建部署案例
  • 源-荷-储协同互动的主动配电网优化调度研究(设计源文件+万字报告+讲解)(支持资料、图片参考_相关定制)
  • 谐波电流抑制仿真 补偿电流控制APF并联型有源滤波器仿真模型 MATLAB simulink仿真及报告(设计源文件+万字报告+讲解)(支持资料、图片参考_相关定制)
  • 排查蓝屏问题:基于minidump的WinDbg深度调试
  • Flink Avro Format Java / PyFlink 读写、Schema 细节与坑点总结
  • 性能测试的结果如何解读和分析?
  • AI手势识别在直播带货中的应用:虚拟主播控制案例
  • GLM-4.6V-Flash-WEB省钱部署:低成本GPU推理实战案例
  • MediaPipe Pose从入门到精通:33个关键点检测代码实例
  • AI人脸打码适合自媒体吗?创作者隐私保护方案
  • MediaPipe Pose与Unity集成:虚拟角色控制教程
  • AI手势识别模型更新机制:如何升级至最新版本
  • 揭秘7款AI论文神器:导师不会告诉你的隐藏技巧,轻松搞定毕业论文!
  • 隐私保护必备:AI人脸打码系统部署手册
  • 快速掌握Packet Tracer:基础网络通信验证操作
  • 流批了,吾爱置顶神器
  • MediaPipe Pose部署案例:医疗康复动作标准度评估