当前位置: 首页 > news >正文

FAB智能化的下一站:从自动化到自主决策

一、背景故事:凌晨两点,派工还得靠人的经验

去年冬天,我在一家12英寸Fab跟夜班。凌晨两点,光刻区的一台扫描机报了个套刻偏移的黄灯,不算停机,但需要判断后续批次是继续跑还是转到另一台机。当班的调度员盯着屏幕,把WIP看板、机台状态、批次优先级、后工序缓冲区四个页面来回切了大概八分钟,最后打电话请示了工艺工程师,才决定把三个高优先级批次转走。

这个场景很典型:所有数据都已经在系统里,所有动作都可以由系统执行,但决策本身仍然由人做,而且做得慢、做得不一致。同样的情况白班可能是另一个判断,另一个调度员可能是第三个判断。Fab花了十几年把「执行」自动化了,却把「决策」留在了人脑里,而决策恰恰是波动的最大来源。

我把这件事记在笔记本上,回来做了个粗算:这家Fab光刻区一天大约产生70到90次这类需要人判断的非标准情形,每次平均耗时6到10分钟,一年下来仅决策等待就消耗了大约3000到4500小时的产能窗口,还不算判断不一致导致的额外调机与返工。这就是「自动化」和「自主决策」之间的差距,也是这篇文章要谈的下一站。

二、技术原理:Fab自治能力的五级模型与决策闭环

2.1五级自治模型

L0手工级:数据靠人抄,决策靠人拍,动作靠人做。现在只在少数小型特色工艺线还能见到。L1单点自动级:单台设备或单个系统内部实现自动化,比如设备自动上下料、MES自动记录工步,但系统之间靠人搬数据。L2集成自动级:MES、EAP、AMHS、FDC、SPC打通,标准流程无人干预,异常情形转人工。绝大多数国内12英寸Fab处在这一级。

L3辅助决策级:系统对异常情形给出带排序的建议方案与理由,人做最终确认。这一级的技术门槛不在算法,而在数据可信度与解释能力。L4条件自主级:在划定的边界内(比如指定产品、指定工序、指定时间窗),系统自主决策并执行,人只做事后审计与边界调整。L5全自主级:跨区域、跨工序的全局自主优化,目前还没有可信的规模化案例。

2.2从感知到执行的四段闭环

感知层要解决的是「数据是否可信」。Fab的数据源包括设备端SECS/GEM事件、FDC的传感器时序、MES的工单与工步记录、AMHS的搬运轨迹、量测机台的结果数据。难点在于时间戳口径不统一:设备本地时钟、采集服务器时钟、MES数据库时钟三者若有偏差,事件因果顺序就会错乱。做自主决策之前,必须先把全厂时钟同步误差压到亚秒级,并统一以事件产生时刻而非入库时刻为准。

认知层要解决的是「现在发生了什么」。这一层做的是状态估计与根因归因,典型技术包括基于FDC时序的异常检测(多变量T2统计量、自编码器重构误差)、基于共性分析的机台归因、以及基于数字孪生的产线状态预测。这一层的输出必须是结构化的、可被下一层直接消费的判断,而不是一张需要人去解读的图。

决策层要解决的是「应该做什么」。Fab调度本质是一个带约束的组合优化问题:目标是周期时间与准时交付,约束包括机台资格(Qual)、预防保养窗口、光罩可用性、批次优先级、腔体匹配限制、以及配方切换代价。工程上常见的三条路线是:可解释的启发式规则(Dispatching Rules)、约束规划求解器、以及强化学习。我的建议是从规则起步,用仿真做离线评估,成熟后再引入求解器,强化学习目前更适合做局部策略优化。

执行层要解决的是「怎么安全地做」。决策必须通过标准接口下发到EAP与AMHS,并且每一次自主动作都要留下完整审计记录:决策时间、输入快照、候选方案与得分、最终选择、执行结果、以及是否被人工推翻。这份审计日志既是事后追责的依据,也是模型迭代最重要的训练数据。

1:自主决策的分层架构。感知层保证数据可信,认知层输出结构化判断,决策层做受约束优化,执行层负责安全下发与留痕。

1Fab自治能力五级模型与落地前提

自治等级

决策主体

典型场景

落地前提

L0手工级

人(凭经验)

纸质派工单、手抄参数

L1单点自动

人(系统辅助)

设备自动上下料、工步自动记录

设备联网与基础采集

L2集成自动

人(系统执行)

标准流程自动流转,异常转人工

MES/EAP/AMHS/FDC打通

L3辅助决策

人(系统建议)

异常给出带理由的排序建议

数据可信度达标、模型可解释

L4条件自主

系统(限定边界)

指定产品与工序内自主派工与调机

护栏KPI、审计日志、回退机制

L5全局自主

系统(全局优化)

跨区域跨工序全局动态优化

尚无规模化可信案例

三、现状分析:行业到底走到了哪一步

按上面的模型对照,国内12英寸Fab的主流水平是L2,头部工厂在部分场景摸到了L3。判断依据有三条可观察的指标:一是自动派工覆盖率,也就是不需要人工干预即可完成派工的批次占比,多数厂在65%到85%之间;二是异常自动处置率,即报警发生后由系统按预案自动完成处置的比例,这个数字普遍很低,多在10%到25%;三是决策一致性,同一情形不同班次做出相同决策的比例,很多厂根本没有统计过。

第二个指标为什么低?因为异常处置涉及责任。系统自动把批次转到另一台机,如果后面出了良率问题,责任算谁的?这个问题在技术上早就可解,卡住的是管理机制。我见过技术能力完全达标、但因为没人愿意签字承担边界责任而搁置一年的项目,这比算法难题常见得多。

还有一个容易被高估的东西是数字孪生。很多厂做了漂亮的三维可视化,但那只是「数字镜像」,不是孪生。真正能支撑决策的孪生模型,必须具备离散事件仿真能力,能够在几分钟内回答「如果我现在把这三个批次转走,未来八小时的WIP分布和交付表现会怎样」。判断一个孪生项目是否有价值,就问它能不能做这种前瞻推演,不能的话就是可视化项目。

四、瓶颈问题:卡住自主决策的五道坎

【坎一】数据口径不一致。同一个「设备可用率」,设备部门按运行时间算,生产部门按可派工时间算,财务按稼动率算,三个数字能差5到8个百分点。决策模型如果用了错的口径,输出必然离谱。这不是算法问题,是主数据治理问题,必须先把指标字典与计算逻辑固化到系统里。

【坎二】模型不可解释。工艺工程师不会接受一个「系统建议转机,理由是模型输出0.87」的方案。决策系统必须能给出人能理解的理由链:比如「建议转到CH03,因为CH02在过去4小时的RF反射功率标准差上升到基线的2.3倍,且该腔体距离下次PM仅剩11小时,转机可避免中途中断」。可解释性不是锦上添花,是能否上线的准入条件。

【坎三】异常兜底能力不足。自主系统必须回答一个问题:当它自己出问题(模型崩溃、数据断流、接口超时)时会怎样。正确的设计是快速失败并降级到已知安全状态,也就是自动退回到L2的规则派工,同时告警。最危险的设计是系统带病继续做决策,因为它的错误会被自动执行层放大。

【坎四】权限边界与责任划分不清。这是前面提到的管理坎。解决思路是把边界写成可配置的策略而不是口头约定:哪些产品、哪些工序、哪个时间窗、单次影响多少片wafer以内允许自主,超出边界自动转人工。边界清晰了,签字的人才敢签。

【坎五】组织信任建立需要时间。技术上线只是开始,真正让调度员和工艺工程师相信系统,通常需要三到六个月的并行运行。这段时间不要急于扩大范围,要把系统建议与人工决策的差异逐条复盘,让一线看到系统在哪些情形比人强、在哪些情形不如人。信任是靠差异复盘建立的,不是靠汇报PPT。

五、解决方案:分级放权的四步路线图

5.1第一步:影子模式(Shadow Mode),只算不发

系统与真实产线并行运行,对每一次需要决策的情形同时产生系统建议,但不下发执行,只记录。运行4到8周后,做三项统计:系统建议与人工实际决策的一致率、不一致情形的事后优劣评估、以及系统响应时间。一致率通常从60%起步,通过持续修正规则与约束可以提升到85%以上。这一阶段的目的不是证明系统更强,而是暴露模型没考虑到的现场约束。

5.2第二步:建议模式,人点确认

把系统建议推送到调度台,附带理由链与备选方案,人点击确认后执行。这一步的关键设计是「确认成本要低于自己想的成本」,否则调度员会绕过系统。实践中的做法是:默认选中最优方案,一键执行;如果人选择了其他方案,弹出一个只有一行的原因选择框(下拉选项不超过6个),这行原因就是最宝贵的模型改进输入。

5.3第三步:受限自主,划边界放权

选一个风险可控的场景先放:建议从「同型号机台之间、同配方、非首批次、单次影响不超过2个lot」这样的窄边界开始。同时设置三条护栏KPI:如果连续2小时内该区域的X-factor劣化超过5%、或自主决策被人工推翻率超过15%、或出现任一等级A异常,系统自动降级回建议模式并告警。护栏必须是自动触发的,不能靠人盯。

5.4第四步:审计与迭代闭环

每一次自主决策都要落一条审计记录,包含决策ID、时间、输入数据快照哈希、候选方案与得分、执行结果、后续8小时的关键指标变化。每周做一次决策复盘会,重点看三类记录:被人工推翻的、执行后指标劣化的、以及系统主动降级的。这三类记录构成了下一轮迭代的需求清单,比任何需求调研都准确。

六、实战案例:某12英寸Fab光刻区派工自主化试点

试点对象是一家月产能约3万片的12英寸Fab的光刻区,共14台扫描机,覆盖3个产品族。试点前的状态:自动派工覆盖率78%,异常情形完全依赖调度员判断,日均人工介入约80次,区域X-factor(周期时间与理论加工时间之比)为2.85,准时交付率91.2%,光罩切换次数日均46次。

第1到4周跑影子模式。初始一致率只有58%,复盘发现三个主要原因:模型没有考虑光罩在库房与机台之间的实际搬运时间(约12到18分钟,模型按固定8分钟算);没有纳入操作员对特定机台的资格限制(部分夜班人员未取得两台新机的操作资格);以及优先级规则中的客户紧急插单没有对应字段。修正这三项后,第4周一致率升到81%。

第5到8周跑建议模式。调度员采纳率从初期的72%升到89%,未采纳原因统计里排前两位的是「工艺工程师有临时口头要求」和「该机台今天有厂商工程师现场作业」。这两项后来分别通过增加临时约束录入界面和对接设备维护工单系统解决。这一阶段最有价值的产出,是把过去存在于人脑和微信群里的隐性约束,变成了系统里的显性字段。

第9到12周跑受限自主。边界设定为:仅限成熟产品族A、仅限非首批次、仅限同型号机台之间调度、单次影响不超过2个lot、每小时自主决策不超过12次。护栏设三条:X-factor两小时滑动劣化超5%降级、人工推翻率超15%降级、任一A类异常立即降级。12周内共触发降级3次,其中2次是数据采集短暂中断,1次是模型对新导入光罩的处理时间估计偏差过大,均按预案自动回退,未造成产出损失。

212周试点的三条主线指标。X-factor2.85降到2.43,人工介入从日均80次降到26次,系统一致率从58%升到93%

七、实施效果:数据、成本与可复制性

12周结束时的量化结果:区域X-factor从2.85降至2.43,改善14.7%;准时交付率从91.2%升至95.8%;日均人工介入从80次降至26次,调度员的注意力从「频繁做小决策」转向「处理真正的复杂异常」;光罩切换次数从日均46次降至38次,按单次切换平均占用机台11分钟估算,相当于每天释放约88分钟的光刻产能。

2:光刻区派工自主化试点前后关键指标对比(12周)

指标项

试点前

试点后

变化与说明

区域X-factor

2.85

2.43

改善14.7%,周期时间显著压缩

准时交付率

91.2%

95.8%

提升4.6个百分点

日均人工介入次数

80

26

下降67.5%,调度员转向复杂异常处理

系统建议一致率

58%

93%

影子模式暴露并补齐了隐性约束

光罩切换次数

46/

38/

每天释放约88分钟光刻产能

决策一致性(跨班次)

64%

91%

产线行为可预测性大幅提升

自动降级触发次数

不适用

12周共3

均按预案回退,未造成产出损失

成本方面,试点期间的投入主要是三块:数据治理与时钟同步改造约占40%的工作量,规则引擎与仿真评估环境搭建约占35%,界面与审计模块约占25%。值得强调的是,算法本身的开发量远小于数据治理,这也是很多项目失败的根本原因——把预算全押在算法上,结果模型跑在一堆口径混乱的数据上,输出自然不可信。

可复制性方面,这套路线图在刻蚀区和薄膜区做了小范围验证,结论是:越是机台同质化程度高、配方切换代价明确、量测反馈快的区域,自主化收益越大;反之,像离子注入这种机台差异大、资格矩阵复杂的区域,需要先把机台资格管理数字化,否则模型会频繁给出不可执行的方案。

最后说一个容易被忽略的效果:决策一致性。试点前,同一情形在不同班次的决策一致率约为64%(通过历史回放评估);试点后升至91%。一致性提升带来的隐性收益是可预测性——当产线行为变得可预测,后续的产能规划、交期承诺、甚至设备保养排程都能做得更紧凑。这部分收益很难单独量化,但长期看可能比X-factor的改善更重要。

八、常见问题答疑:工程落地里最常被追问的几件事

Q1:我们厂连MES数据都经常对不上,是不是根本没资格谈自主决策?

恰恰相反,数据对不上正说明治理该做了,而自主决策项目是推动治理最好的抓手,因为它把数据质量问题变成了可量化的业务损失。建议的做法是:不要一上来做全厂,选一个数据质量相对最好的区域做影子模式,用影子模式暴露出来的数据问题清单去推动治理。这样治理有明确目标,也有业务方买单。

Q2:强化学习在Fab调度里到底能不能用?

能用,但要选对位置。全局派工用强化学习目前风险太高,因为奖励函数很难覆盖所有约束,而且训练环境与真实产线的差距(sim-to-real gap)会被自动执行层放大。更现实的用法是局部策略优化,比如单区域内的批次排序、或者PM窗口的动态选择,把动作空间限制在几十个离散选项内,并且始终保留规则引擎作为兜底。

Q3:自主决策上线后,调度员会不会被裁掉?

从我看到的案例看,人数变化不大,但角色变了。原来调度员80%时间在做重复性的小判断,20%处理复杂异常;上线后大致反过来。他们的新职责包括:维护约束与规则库、审计系统的异常决策、处理系统主动降级后的复杂情形。这个转变需要培训,也需要岗位说明与考核指标同步调整,否则一线抵触会很强。

Q4:护栏KPI的阈值怎么定才合理?

不要一开始就追求精确。建议用影子模式期间的自然波动数据来定:取该指标在正常生产状态下的两小时滑动窗口标准差,把护栏阈值设在均值加两倍标准差的位置作为起点,然后观察四周内的误触发次数。误触发过多说明阈值太紧,一次都不触发说明太松(这更危险)。理想状态是每两到四周触发一次,既能验证降级链路有效,又不干扰生产。

Q5:这套东西是买商用软件还是自研?

分层看。感知层与执行层的接口标准化程度高,优先用成熟商用产品(EAP、FDC平台);认知层的异常检测可以用商用加定制;决策层的约束与规则强烈建议自研或深度定制,因为约束条件是每家Fab独有的竞争力,也是最需要频繁迭代的部分。把决策逻辑完全外包,等于把工厂最核心的运营知识交给了供应商。

九、配套资料与实战工具包

本文涉及的脚本、模板、检查清单已整理成配套资料包,均为可直接在工厂落地使用的版本,拿到后按自己产线的实际参数替换即可,不需要从零搭。

点击文章上方「VIP资源」下载区,即可获取以下5项配套资料(持续更新MES/SPC/EAP/良率实战资料):

  • Fab自治能力五级评估表(含23项可观测指标与打分口径)
  • 派工规则引擎配置模板(含光罩、资格矩阵、PM窗口三类约束示例)
  • 影子模式一致性分析脚本(Python,输出差异明细与归因分布)
  • 自主决策审计日志表结构设计与SQL建表语句
  • 护栏KPI阈值标定工作表(含自动降级链路测试用例)

────────────────────────────────────────

本文首发于博客:半导体智能制造| MES工程师实战笔记

你在自己的产线上遇到过类似情况吗?是怎么处理的?欢迎在评论区留下你的做法,我会挑典型问题在后续文章里展开。

标签:智能制造| Fab自主决策| CIM |派工调度|数字孪生| APC

http://www.cnnetsun.cn/news/3987763.html

相关文章:

  • 【ORC】 ORC 的零拷贝(Zero-Copy)读取机制是如何实现的?在 Arrow 集成中起到什么作用?
  • 探秘广西建设教育协会网站:助力建筑人才成长与行业发展的核心平台
  • Unity 2D物理触发器深度解析:从原理到实战应用
  • 上海jsp网站建设:从入门到精通,揭秘高端企业官网背后的技术逻辑与用户体验优化策略
  • 揭秘网站建设需要做些什么:从底层逻辑到落地执行的完整指南
  • 海康威视Web3.2无插件开发实战:从RTSP到浏览器播放全解析
  • FlowMarket 智能工作流自动化落地指南
  • 免费开源AI软件.桌面单机版,可移动的AI知识库,察元 AI桌面版:国产化支持下的首启动 麒麟桌面安装察元AI的几个坑
  • O2O网站建设需要多少钱:揭秘价格背后的真相与避坑指南
  • 瓶盖螺纹设计分享
  • 开源免费的WPS AI 软件 察元AI文档助手:链路 057:buildPlainChunkUserPrompt 分段自然语言提示
  • 沈阳网站建设找哪家:揭秘正规服务商与劣质外包背后的真相,助你避坑指南
  • 网络原理03(http协议详细解析2)
  • CesiumJS 笔记 - CesiumJS 相机瞬间跳转、lookAt 方法、Point 高度无效、椭圆与图片图层、椭圆调整
  • 动态规划解三角形牧场:从信奥题看DP状态设计与优化
  • ​轮胎三维轮廓检测怎么选?从测量范围到黑色橡胶成像
  • 上海网站建设公司大全:从选型避坑到落地执行,揭秘上海优质建站服务商的全景指南
  • 东莞网站建设优化技术全面解析:如何通过专业策略提升企业排名与流量增长
  • IEC 61960-3:2011 完整权威解读
  • (论文速读)Multinex:基于多优先Retinex的轻量级微光图像增强
  • 企业做 Data for AI,应该如何选择云上数据底座?亚马逊云科技五层架构与选型路径
  • 基金申请书框架:把研究构想搭成基金申请书框架:立项依据、研究目标内容、方案、特色创新、基础与可行性。
  • 揭秘上海网站建设渠道的隐藏陷阱与避坑指南:从零基础到上线的全流程解析
  • 构建健壮业务循环:从设计模式到生产级实践
  • 上海红酒网站建设:打破同质化困境,打造有灵魂的品牌数字化名片
  • 中小团队低成本做好GEO优化!2026高性价比GEO查询工具选型攻略
  • 我用4个AI搭了一个“虚拟开发团队“,真实完成了项目迭代
  • Unity动态数据可视化实战:基于XCharts实现实时折线图
  • Utilizing Large Language Models for Zero-Shot Medical Ontology Extension from Clinical Notes
  • Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation