当前位置: 首页 > news >正文

BERT 为什么要随机掩盖 15% 的 token 并拆分为 80%/10%/10% 三种处理?

BERT 的 15% 掩盖策略与 80/10/10 拆分:设计动机详解

一、整体策略回顾

BERT 在预训练时,对输入序列随机选择15%的 token 位置进行"掩盖",然后对这 15% 的位置做如下拆分处理:

被选中的 15% token ├── 80% → 替换为 [MASK] ├── 10% → 替换为一个随机 token └── 10% → 保持原 token 不变

这个看似复杂的策略并非随意设计,每一部分都解决了特定的训练问题。


二、为什么是 15%?

平衡训练信号与上下文质量

掩盖比例问题
太低(如 5%)训练信号太少,模型从每条样本中学到的信息不足,预训练效率低
太高(如 50%)上下文被严重破坏,模型难以推断被遮盖的词,且输入与真实文本差异过大
15%经验性平衡点:足够多的预测目标,同时保留足够的上下文信息

15% 是 BERT 原论文通过实验确定的经验值,并非理论最优。后续研究(如 RoBERTa、SpanBERT)也探索了动态掩盖、连续 span 掩盖等改进,但 15% 作为基线比例被广泛沿用。


三、80/10/10 拆分的逐项解析

1. 80% 替换为[MASK]— 主力训练信号

输入: The man went to the [MASK] to buy coffee 目标: 预测 [MASK] → "store"

作用:这是 MLM 的核心任务——根据双向上下文预测被遮盖的词,迫使模型学习语言的深层表示。

为什么不是 100%?

关键问题在于预训练与微调的不一致

预训练阶段: "The man went to the [MASK] to buy coffee" ← 含 [MASK] 微调阶段: "The man went to the store to buy coffee" ← 不含 [MASK]

如果 100% 都用[MASK],模型会过度依赖[MASK]这个特殊标记的存在。而下游任务(分类、NER、QA 等)的输入中永远不会出现[MASK],导致预训练学到的表示在微调时存在分布偏移。

2. 10% 替换为随机 token — 强迫模型保持怀疑

输入: The man went to the pineapple to buy coffee 目标: 预测 "pineapple" 位置 → "store"

作用:模型不能盲目信任输入中的每个词,必须学会判断"这个词可能是错的",并利用上下文来纠正。

解决的问题

如果只有[MASK]和保持原词两种情况,模型可能学到一种捷径:看到[MASK]就认真预测,看到正常词就直接复制。引入随机词后,模型无法确定哪些位置被篡改过,因此必须对所有位置都建立高质量的上下文表示,而不能偷懒。

模型心理活动: "这个位置是 'pineapple'?但上下文是 'went to the ___ to buy coffee', 语义上不合理,应该是 'store'。" → 学会了基于上下文的语义判断,而非机械信任输入

3. 10% 保持原词不变 — 学习"自我校准"表示

输入: The man went to the store to buy coffee 目标: 预测 "store" 位置 → "store"(即原词本身)

作用:让模型对未被修改的真实 token也产生预测梯度,学习"这个位置的信息是正确的"的表示。

解决的问题

如果被选中的 15% 位置要么变成[MASK]、要么变成随机词,模型会形成一种偏见:被选中的位置总是"有问题"的。保留 10% 原词,让模型也处理"这个位置其实是对的"的情况,使表示更加均衡。


四、三者协同的整体效果

┌─────────────────────────────────────────────────────────────┐ │ 15% 被选中的位置 │ │ │ │ 80% [MASK] → "上下文推理"能力(核心任务) │ │ 10% 随机词 → "输入不可全信"的鲁棒性 │ │ 10% 原词保留 → "输入也可能正确"的校准能力 │ │ │ │ 协同效果: 模型对每个位置都建立高质量的、不依赖特殊标记的 │ │ 上下文表示 → 缩小预训练与微调的分布差距 │ └─────────────────────────────────────────────────────────────┘
设计选择解决的问题如果不做会怎样
80%[MASK]提供主要的完形填空训练信号
10% 随机词防止模型只对[MASK]认真,对其他词偷懒模型在非[MASK]位置表示质量下降
10% 原词让模型也学习"正确输入"的表示模型对被选中位置产生"总是有问题"的偏见
整体 80/10/10缩小预训练(含噪声)与微调(无噪声)的分布差距微调性能下降,迁移效果变差

五、一句话总结

80% 的[MASK]提供核心训练信号,10% 的随机词迫使模型不盲信输入,10% 的原词保留让模型也学习正确表示——三者共同作用,让 BERT 对每个位置都生成不依赖[MASK]标记的高质量双向上下文表示,从而缩小预训练与微调之间的分布差距。

这一设计体现了 BERT 论文对"预训练-微调一致性"的深刻思考,也是其能在下游任务上取得优异迁移效果的重要细节之一。

http://www.cnnetsun.cn/news/3920228.html

相关文章:

  • 2026论文降重工具测评:5款打分对比与选择建议
  • Flask构建残障社区服务平台的技术实践
  • 专业二手车网站建设方案解析:如何通过优化内容提升客户信任度与转化率
  • 如何3分钟内在浏览器中使用微信?wechat-need-web插件终极指南
  • Muse Spark 1.2:本地AI绘画一站式工具部署与API集成实战
  • Unity脚本乱码终结指南:5种方法统一编码为UTF-8无BOM
  • iOS导航栏与标签栏图标设计规范与实现技巧
  • SQL注入实战:从手工探测到自动化利用的靶场攻防演练
  • 12 万条消息撑爆 chrome.storage.local:浏览器扩展的本地存储到底该选谁
  • NSDBO算法在微电网优化调度中的应用与Matlab实现
  • 南通网站建设制作:企业数字化转型的必修课与避坑指南
  • RSA加密基础攻击与CTF解题实战指南
  • 开源项目二次开发中的Git代码同步策略与实践
  • Redis缓存雪崩、穿透、击穿,生产环境完整落地方案
  • 基于线程预排思想的多智能体并行协作优化实践
  • 科研文献检索三步法:从海量结果到精准定位
  • 内江市网站建设专业推荐及避坑指南助力中小企业低成本获取精准流量
  • 短视频去水印下载工具功能介绍,抖音快手B站三合一安装包下载
  • 2026随身WiFi/MIFI合规与技术架构分析:3C、SRRC到模组选型
  • 从静态知识库到动态发现引擎:构建AI自主知识发现循环的技术架构与实践
  • 达梦DMHS实现MySQL到DM8异构数据库迁移实战
  • OpenClaw 2026.3.2权限配置实战:解决工具调用失败与安全策略升级
  • 【STM32入门项目】DHT11温湿度监测与声光报警系统
  • VC++操作Excel自动填充:从COM接口到性能优化的完整实战指南
  • 公司网站建设步骤指南:从0到1打造高转化官网的关键策略
  • ROS2介绍与特性:下一代机器人操作系统详解
  • 单畴IPS液晶仿真技术与TechWiz LCD应用解析
  • ANSYS有限元分析自学指南:从入门到实战
  • Sublime Merge:高效Git客户端工具详解与实战指南
  • pion/webrtc v4.2.18发布:SCTP、ICE、Interceptor三大模块升级,RTP写入与RTX资源管理同步优化