当前位置: 首页 > news >正文

一文读懂MonkeyOCRv2核心基础知识

写在前面

欢迎大家关注Rocky的公众号:WeThinkIn
欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~

Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章:深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群(涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

核心导读

这篇论文叫MonkeyOCRv2: A Visual-Text Foundation Model for Document AI,arXiv 编号是2607.11562,作者在论文中提出了一个专门面向文档图像的视觉-文本基础模型 MonkeyOCRv2,并构建了一个 113M 图像、覆盖 17 种语言的文档预训练语料 MonkeyDoc v2。

Rocky 认为,这篇论文真正值得讨论的,并不是“又一个 OCR 模型把某个榜单刷高了”。更本质的变化是:文档智能正在从“拿自然图像视觉编码器来凑合用”,走向“为文字笔画、版面结构、阅读顺序、公式和表格专门训练视觉底座”。

过去很多 Document AI 系统的底层视觉编码器,来自 ImageNet、CLIP、DINO、SAM 这类自然图像或通用视觉模型。它们很强,但强在对象、场景、区域边界、全局语义对齐;而文档图像真正难的地方,是极细粒度的字符差异、笔画结构、密集文本、版面关系、跨语言书写系统、公式符号和表格结构。两者不是同一种视觉统计。

MonkeyOCRv2 的核心判断很直接:文档不是“带很多字的图片”,文档本身就是一种独立视觉模态。

论文做了三件事:

  1. 构建 MonkeyDoc v2:113M 文档图像样本,17 种语言,包含 8M 页级图像和 105M 裁剪文档元素。
  2. 提出双目标预训练:一边做 image-to-text generation,让视觉表征对齐文本内容;一边做 pixel-level document reconstruction,让编码器保留笔画、字形和版式细节。
  3. 在文本识别、公式识别、文本检测、文档篡改检测、重叠文本分割、文档解析、文档理解等任务上验证迁移能力。

如果只看结果,论文确实给了很亮眼的数字:CRNN 的总体识别准确率从 58.7% 提升到 67.3%;110M 的 UniMERNet-T + MonkeyOCRv2 超过 325M 的 UniMERNet-B;0.7B 的 MonkeyOCRv2-Parsing 在 MDPBench 上达到 83.3,总体分数超过 3B dots.mocr 2.8 个百分点,而且视觉编码器大约小 11 倍;在受控文档理解比较中,MonkeyOCRv2-B 达到 57.2,超过 OpenVision-B 的 44.0 和 RADIOv2.5-B 的 37.5。

但 Rocky 更关心的不是这些分数本身,而是这些分数背后的机制:当模型需要读清楚“眼睛看见的字”,而不是根据语言常识猜测“这里大概是什么字”时,文档原生视觉预训练的价值会明显放大。

一、问题背景:文档智能长期借用了一双“不适合读字的眼睛”

很多人容易把 OCR 看成一个老问题:文字识别嘛,深度学习已经做了很多年,剩下的只是工程细节。但从今天的 Document AI 看,问题已经不再是单行文本识别那么简单。

企业知识库、科研论文、法律合同、财报、病历、扫描票据、手写笔记、技术标准、低清拍照文档,本质上都在把知识压缩进一种“视觉-文本混合结构”里。文档智能要做的,也不只是把图像里的字转成字符串,而是要同时处理:

  • 字符级视觉辨别;
  • 公式、表格和版式结构;
  • 多语言、多脚本、多字体、多分辨率;
  • 扫描、拍照、遮挡、弯曲、噪声、篡改;
  • 阅读顺序和层级结构;
  • 与语言模型衔接后的解析、问答和理解。

这里真正尴尬的地方在于:很多系统在视觉编码器上仍然沿用自然图像预训练模型。ImageNet 教会模型识别物体类别,CLIP/SigLIP 强调图文全局语义对齐,DINO 学跨视角稳定语义,SAM 强在区域边界和可分割对象。它们对自然图像非常有效,但这些目标天然会鼓励模型忽略局部细节。

而文档图像恰恰相反。

一个字母、一个数字、一个公式符号,甚至一个笔画的微小差异,都可能改变语义。0O1l、阿拉伯语从右到左的阅读顺序、中文票据里的小号数字、公式里的上下标结构,都不是高层语义可以轻易补回来的。

这就是 Figure 1 想表达的 “representation mismatch”:自然图像视觉模型把主要能力用在对象语义和区域边界上,而 Document AI 需要的是字符笔画、字形细节、版面、阅读顺序和细粒度文本。

Rocky 认为,这个判断很重要,因为它把文档智能从“应用层 OCR pipeline”重新推回到“基础模型预训练”层面。换句话说,文档 AI 的瓶颈不只是解码器、不只是后处理规则,也不只是再堆一个更大的 LLM,而是视觉编码器本身是否真的学过文档。

二、核心思路:不是让模型更会猜,而是让模型更会看

MonkeyOCRv2 的技术路线可以压缩成一句话:

用大规模文档图像语料训练一个文档原生视觉编码器,并通过“文本生成 + 图像重建”的双目标,让它既理解文本语义,又保留字符级视觉证据。

这件事的关键不在“生成文本”本身。很多 OCR-free 或文档 VLM 也会做图像到文本生成。MonkeyOCRv2 更有意思的地方,是把 pixel-level reconstruction 放进预训练目标里。

直觉上,如果只让模型从图像预测文本,它可能会学会一种捷径:当视觉信息不清楚时,依靠语言上下文去补全。比如在英文句子中,一个模糊的单词可以靠语境猜出来;在表格或票据中,一个常见字段也可能被语言先验补齐。短期看,这会提升一些自然文本场景的准确率;长期看,它会制造“看不清但猜得像”的文档幻觉。

而图像重建目标逼迫编码器保留更多底层视觉信息。论文中的预训练流程是:

给定输入文档图像I II,视觉编码器先产生视觉 token:

z = E v ( I ) \mathbf{z}=E_v(I)z=Ev(I)

视觉 decoder 尝试从这些 token 还原原图:

I ^ = D v ( z ) \hat{I}=D_v(\mathbf{z})I^=Dv(z)

基础像素重建损失是:

L p i x = 1 3 H W ∥ I ^ − I ∥ 2 2 \mathcal{L}_{\mathrm{pix}}=\frac{1}{3HW}\left\|\hat{\mathbf{I}}-\mathbf{I}\right\|_2^2Lpix=3HW1I^I22

文本 decoder 则基于同一组视觉 token 自回归生成图像中的文字内容。最后总预训练目标是:

L p r e t r a i n = L t e x t + λ L r e c \mathcal{L}_{\mathrm{pretrain}}=\mathcal{L}_{\mathrm{text}}+\lambda\mathcal{L}_{\mathrm{rec}}Lpretrain=Ltext+λLrec

这里的机制非常朴素,但也非常本质:文本生成目标负责“把图像和文本内容对齐”,图像重建目标负责“别把笔画、字形、局部视觉证据丢掉”。

论文还探索了更结构化的重建损失:通过 Sobel 梯度构造软边缘图,再用距离到边缘的结构图约束重建结果。这部分不是所有实验默认使用,但在文档理解实验中带来了额外增益。它背后的思想依然是同一个:文档图像里的边缘和笔画不是噪声,而是信息本身。

Rocky 认为,这一点和很多通用 VLM 的训练偏好正好相反。通用视觉模型希望学到对光照、纹理、局部扰动不敏感的高层语义;文档视觉模型则要在很多时候对局部扰动高度敏感。因为对文档来说,“细节”不是干扰项,而是答案所在。

三、数据不是附属品:MonkeyDoc v2 才是这篇工作的底层基础设施

很多论文会把数据集描述写得像附录,但 MonkeyOCRv2 里,数据本身就是方法的一部分。

MonkeyDoc v2 包含 113M 样本,覆盖 17 种语言:简体中文、繁体中文、英语、阿拉伯语、德语、西班牙语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、俄语、泰语和越南语。其中 8M 是页级图像,105M 是裁剪后的文档元素。真实样本 61M,占 54%;合成样本 52M,占 46%。

论文把数据构建拆成三块:

第一,专家模型标注。它不是依赖单个 OCR 模型,而是用多个互补专家模型独立转写,再通过预测之间的相似度选择平均一致性最高的标签。这种方式的目标,是降低单个模型的偏置和系统性错误。

第二,多语言语料合成。作者从覆盖 17 种语言的 LLM 语料中采样文本,结合字体、样式、分辨率渲染成图像;对低频字符和稀有符号,还会抽取完整字符集做随机组合渲染;表格数据则结合真实模板和自动生成结构;公式部分从 arXiv 论文中收集公式并渲染,大约形成 0.8M 公式样本。

第三,数据过滤。对于报纸、手写笔记等复杂来源,作者用版面检测结果遮挡已检测区域,再让强文档多模态模型判断是否仍能识别残余文字;如果能,说明布局标注可能漏检。阅读顺序也会通过文本拼接后的逻辑一致性来过滤。最终,来自这些挑战来源的 1.2M 初始页面中约 0.9M 被保留。

从数据规模上看,论文给出的对比也很直观:

模型 / 数据数据规模数据类型语言覆盖
CLIP400M自然图像N/A
SigLIP 2>40B自然图像N/A
SAM11M自然图像N/A
DINOv2142M自然图像N/A
oCLIP450K场景文本图像2
DiG35.6M场景文本图像1
DiT42M扫描文档1
Donut13M扫描 / 合成文档4
Pix2Struct80M网页截图1
MonkeyOCRv2113M多类型文档17

这张表的意义不是简单说 MonkeyOCRv2 数据最大。SigLIP 2 的数据规模远大于 113M,但那是自然图像,不是文档图像。真正的差异在于数据分布和监督密度:文档智能需要的是密集文本、布局结构、公式表格、多语言字符和视觉细节,而不是自然场景里的对象语义。

Rocky 认为,这里真正有跨周期价值的是“数据引擎”而不是某个单点模型权重。文档智能如果要进入企业知识、科研、金融、法律、医疗这些高价值场景,最终竞争不会只发生在 decoder 规模上,而会发生在谁能持续构建高质量、多语言、结构化、可过滤、可迭代的文档视觉数据资产上。

四、实验结果:强的不是一个任务,而是跨任务迁移

MonkeyOCRv2 的实验设计有一个很清楚的思路:它不是只做一个端到端文档解析模型,而是把视觉编码器迁移到多个已有系统里,看替换 backbone 后是否稳定提升。

这点很关键。因为如果一个新系统只在自己的 pipeline 上好,可能是任务后处理、训练数据或解码策略的贡献;但如果同一个视觉编码器被替换进文本识别、公式识别、检测、篡改定位、分割、解析、理解等任务后都有效,就更能说明它学到的是通用的文档视觉表征。

论文中的关键结果可以压缩成下面这张表:

任务论文中的主要证据Rocky 解读
文本识别CRNN 总体准确率 58.7% → 67.3%;PARSeq + MonkeyOCRv2 达到 84.3低配识别器也能显著受益,说明 encoder 本身提供了更强字符级视觉表征
公式识别110M UniMERNet-T + MonkeyOCRv2 总体 ExpRate 66.4,超过 325M UniMERNet-B 的 64.5公式不是自然语言,靠局部结构和二维关系,视觉底座比单纯扩大模型更关键
文本检测在 ICDAR2015、ArT、Total-Text、CTW1500 上多模型稳定提升文档原生表征不仅服务识别,也能迁移到定位与多尺度边界任务
篡改检测FFDN + MonkeyOCRv2-AS 总体 IoU 78.2、F1 87.5,高于 ViTAEv2 版本篡改检测需要捕捉细粒度视觉伪影,重建式预训练天然有帮助
重叠文本分割MOT 数据集上 mIoU 提升,论文概览给出 +5.3对遮挡、重叠、笔画边界的分割,依赖的不只是语义,而是像素级细节
文档解析MDPBench 上 MonkeyOCRv2-B-Parsing 达到 83.3,高于 dots.mocr 80.5frozen encoder + 轻量 LLM 仍能赢,说明视觉侧贡献足够强
文档理解受控比较中 MonkeyOCRv2-B 达到 57.2,高于 OpenVision-B 44.0在相同 LLM、训练数据和流程下,只换视觉编码器仍显著提升

这张表里最值得看的是两个“反直觉”结果。

第一个是公式识别。论文里 110M 的 UniMERNet-T 换上 MonkeyOCRv2-S 后,总体 CDM 达到 90.9、ExpRate 达到 66.4;而 325M 的 UniMERNet-B 是 89.5 和 64.5。这说明在公式这种高结构、强视觉细节任务上,更合适的视觉编码器可以弥补模型容量差距。

第二个是文档解析。MonkeyOCRv2-B-Parsing 是一个 0.7B 模型,视觉编码器约 0.1B,在 MDPBench 上拿到 83.3,超过 3B dots.mocr 的 80.5。论文强调它的视觉编码器大约比 dots.mocr 小 11 倍。这里不能简单解读为“参数越小越好”,但至少说明一件事:如果视觉底座学对了文档分布,后面的语言模型不一定要无限堆大。

Rocky 认为,这也是 Document AI 工程落地里非常现实的点。企业不一定永远愿意为文档解析调用超大 VLM,尤其是有大量合同、发票、投研报告、病历、合规材料需要批处理时。一个更强的文档视觉 encoder,可能意味着更小的模型、更低的成本、更可控的延迟,以及更少的语言幻觉。

五、最有价值的实验:把语言上下文拿掉,看模型还会不会读

这篇论文最有意思的部分,不是常规 benchmark,而是对语言上下文依赖的分析。

高准确率并不总等于强视觉能力。一个文档模型可能不是“看清楚了”,而是“猜对了”。当一句话语义连贯、上下文强时,语言模型可以补很多东西;但真实文档场景里,我们经常面对的是编号、金额、公式、序列号、人名、地址、表格字段、扫描噪声和非自然语言片段。这里如果模型靠猜,就会出事。

论文设计了一个 scrambled text 实验:把文本字符打乱,破坏自然语言上下文,让模型更依赖视觉证据。同时逐步降低输入分辨率,从 1288 降到 448,观察 scrambled-text recognition accuracy 和语义文本 / scrambled 文本之间的准确率差距。

结果很有解释力:

  • 对 MonkeyOCRv2-S-Parsing,如果没有重建目标,scrambled-text accuracy 从 99.7% 降到 55.4%,下降 44.3 个百分点。
  • 加入重建目标后,最低分辨率 448 下仍有 72.1%,下降缩小到 27.6 个百分点。
  • 在 448 分辨率下,语义文本与 scrambled 文本之间的差距,从无重建的 29.3% 缩小到有重建的 15.3%。

论文也很谨慎地说明:这个 gap 只是语言上下文依赖的 operational proxy,不是完整的幻觉度量,因为字符打乱会引入分布偏移,也可能影响 tokenization 和 decoding。

这个边界要讲清楚。Rocky 不认为一个 scrambled 实验就能完全证明模型“不幻觉”。但它提供了一个非常有价值的方向:评价文档模型时,不应该只看它在自然文本里的转写准确率,还要看它在语言先验失效时是否仍然忠于视觉证据。

这和企业场景非常相关。合同编号、账户数字、实验参数、药品剂量、财务金额、公式符号,本来就不是靠语言常识能安全补全的内容。模型在这些地方“猜得顺”反而危险。

论文进一步用 CHAOS-Bench 检验视觉证据和语言先验冲突时的忠实度。MonkeyOCRv2-B-Parsing 的 page-average recall 达到 17.9,高于 HunyuanOCR-1.5 的 14.2,也明显高于 PaddleOCR-VL-1.6 的 6.0。MonkeyOCRv2-S-Parsing 加入重建目标后,从 baseline 的 12.1 提升到 14.7。

Figure 6 和 Figure 7 的质性对比也很直观。阿拉伯语文档里,阅读顺序是右到左,模型如果只是“泛化地理解文本”,很容易在顺序上犯错;中文拍照说明书里,表格结构、局部遮挡、拍照畸变都会放大视觉编码器差异。

这类例子对产业落地很有启发:Document AI 真正难的不是 demo 里识别一页清晰 PDF,而是对低质、多语言、复杂版式、关键字段保持忠实。

六、文档理解:同一个 LLM 下,只换视觉 encoder 还能提升多少?

为了隔离视觉编码器的贡献,论文在文档理解任务里做了一个很重要的受控比较:所有视觉编码器都接同一个 Qwen3-1.7B LLM,训练数据、优化流程、解码设置保持一致,视觉 encoder 冻结,只看不同 encoder 的影响。

结果非常直接:

视觉编码器参数量8 个文档理解 benchmark 平均分
CLIP-B86M16.0
SigLIP 2-B93M24.9
DINOv3-B86M16.1
SAM-B90M25.2
OpenVision-B87M44.0
RADIOv2.5-B98M37.5
MonkeyOCRv2-S baseline28M50.7
MonkeyOCRv2-S MSE only28M51.7
MonkeyOCRv2-S 结构化重建28M55.9
MonkeyOCRv2-B 结构化重建113M57.2

这里最有说服力的是:CLIP、DINO、SAM 这些在通用视觉领域非常强的模型,在文档理解受控设置下并不强。原因不是它们“不聪明”,而是它们的训练目标没有把字符级视觉证据当成第一等公民。

Figure 8 展示的例子很典型:通用视觉模型能看出图像大概是什么,但在数字、姓名、电话号码、中文标签等精确文本上容易出错。Document AI 不只需要“知道这是一张表”,还要读准表里的每一个关键字段。

Rocky 认为,这里有一个对 AI 产品团队很重要的判断:在文档场景里,模型能力不是“大语言模型 + 任意视觉塔”的简单叠加。视觉塔如果没有文档原生能力,后面的 LLM 会被迫承担太多本不该由语言先验承担的工作。

这会带来三个产品后果:

  1. 准确率瓶颈会卡在视觉侧,而不是提示词侧。
  2. 幻觉风险会以“看起来合理的错误字段”形式出现。
  3. 成本会被迫向更大模型转移,但更大 LLM 未必能弥补视觉证据缺失。

七、这篇工作的边界:它不是万能文档解析系统,而是文档视觉底座

严谨地看,MonkeyOCRv2 也有明显边界。

第一,论文的 MonkeyOCRv2-Parsing 采用的是比较克制的监督微调流程,并且视觉 encoder 冻结,没有使用一些领先专用解析系统里的渐进后训练和复杂工程策略。因此在 OmniDocBench 这类相对饱和的 benchmark 上,它仍然落后于 GLM-OCR、MinerU2.5-pro、PaddleOCR-VL-1.6、HunyuanOCR-1.5 等更强的专用解析系统。

这不是一个小问题。它说明 MonkeyOCRv2 不是“一个模型解决全部文档解析”的故事。它更像一个强视觉底座,能让不同系统受益,但完整产品仍然需要 layout 策略、区域 refinement、后处理、任务数据、延迟优化和工程闭环。

第二,文档解析架构本身偏自回归,逐元素识别更利于准确率和结构保真,但不一定利于低延迟部署。大规模企业批处理场景里,吞吐和成本会成为非常现实的约束。

第三,论文证明了 reconstruction-aware objective 有价值,但还没有完全拆开 decoder 设计、重建权重 schedule、结构化损失各部分的独立贡献。这意味着后续仍需要更系统的消融。

第四,尽管 MonkeyDoc v2 覆盖 17 种语言,但论文也承认数据仍偏向高资源文字系统。低资源语言、历史文字、特殊行业文档的覆盖,仍然是未来问题。

Rocky 认为,这些边界并不削弱论文价值,反而让它的位置更清楚:MonkeyOCRv2 的价值不是宣称端到端文档解析终局,而是证明“文档原生视觉预训练”本身可以成为 Document AI 的基础设施层。

八、对产业的启发:Document AI 的竞争,会从“会不会 OCR”转向“能不能忠实读复杂知识载体”

文档智能是一个非常容易被低估的方向。因为“识别文字”听起来像旧任务,没有生成视频、Agent、世界模型那么性感。但在产业一线,文档是知识、流程和交易的主要载体。

企业里面大量有价值的信息,不在结构化数据库里,而在 PDF、扫描件、合同、报表、检测报告、财务票据、医疗文书、会议纪要、工程图纸、技术标准里。AI 如果不能稳定理解这些文档,就很难真正进入企业核心流程。

从这个角度看,MonkeyOCRv2 提供的不是一个单点 OCR 工具,而是一种 Document AI 基础设施路线:

  1. 先承认文档图像是一种独立视觉分布;
  2. 再用大规模、多语言、多类型、高密度标注的文档语料训练视觉底座;
  3. 用文本生成对齐语义,用图像重建保留视觉证据;
  4. 让这个视觉底座迁移到识别、检测、分割、解析、理解多个任务;
  5. 最后接入轻量或中等规模 LLM,形成更低成本、更可控的文档智能系统。

这件事真正给 Rocky 的启发是:AI 应用的下一阶段,不一定只是把更大的通用模型塞进更多场景,而是为高价值场景构建更专业的数据、感知和工作流底座。

通用模型会继续变强,但产业落地不会只奖励“谁调了最大模型”。很多时候,真正有商业闭环的项目,来自对某个复杂场景的视觉统计、数据资产、可靠性边界和交付流程的深刻理解。

Document AI 就是这样的场景。

九、给不同读者的建议

对算法工程师来说,这篇论文值得学习的不是某个单一 benchmark,而是它的研究问题定义:不要默认通用视觉 encoder 足够好,要先问目标场景的视觉统计是否一致。文档图像要求字符级保真,自然图像预训练目标未必合适。

对多模态团队来说,MonkeyOCRv2 提醒我们,VLM 不是“LLM + 视觉塔 + projector”这么简单。视觉塔学到什么,决定了后续语言模型是在读证据,还是在用语言先验补洞。

对企业 AI 产品来说,这篇论文的商业含义是:文档智能的价值不在 demo,而在忠实、稳定、可审计地处理复杂文档。如果模型把合同编号、金额、药品剂量、公式参数“猜顺了”,那不是智能,是风险。

对创业者和投资人来说,Rocky 会关注两类能力:一类是能持续构建高质量文档数据资产和评测体系的团队;另一类是能把文档视觉底座接入真实业务流程、形成成本与可靠性优势的团队。单纯包装一个 OCR API,不会形成长期护城河。

十、结论:文档不是自然图像的附庸,文本本身正在成为第一等视觉模态

MonkeyOCRv2 的核心贡献,可以用一句话概括:

它把 Document AI 的底层问题,从“怎么让模型读文档”推进到“文档视觉本身应该如何预训练”。

这不是一个小变化。

在过去的技术周期里,很多文档系统默认借用自然图像视觉编码器,再靠任务微调、规则后处理和更大的语言模型补齐能力。MonkeyOCRv2 的结果说明,这条路并不总是最优。文档图像里的字、公式、表格、版面和阅读顺序,本身就需要一套文档原生视觉表征。

Rocky 认为,MonkeyOCRv2 的长期价值不在于某一个榜单分数,而在于它明确提出并验证了一个方向:文本不是附着在图片上的语义标签,而是一种需要被视觉模型认真学习的结构化视觉信号。

工具会迭代,模型会换代,榜单会刷新。但这种对问题本质的重新定位,往往更有跨周期价值。

推荐阅读

Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:

深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:

深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

Rocky对AIGC时代“中场时刻”之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:

入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

5. 深入浅出完整解析DeepSeek系列核心基础知识

Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析DeepSeek系列核心基础知识

6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识

Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion(SD)核心基础知识

9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:

深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

对于AIGC时代中的“ResNet”——LoRA模型,Rocky进行了深入浅出的全面讲解:

深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

11. 深入浅出完整解析ControlNet核心基础知识

AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。

ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中

深入浅出完整解析ControlNet核心基础知识

12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析

深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

13. 深入浅出完整解析AIGC时代Transformer核心基础知识

在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

深入浅出完整解析AIGC时代Transformer核心基础知识

14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的“PyTorch”、Stable Diffusion WebUI就是AIGC时代的“TensorFlow”、Diffusers就是AIGC时代的“Caffe”

深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?

Don‘t worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:

手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!

16. AIGC产业的深度思考与分析

2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

17. AI算法工程师的独孤九剑秘籍

为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:

【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)

18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的“得力助手”,广泛活跃于AlGC图像创作的产品与工作流中:

深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

http://www.cnnetsun.cn/news/4038721.html

相关文章:

  • 【AI智能体速通】08.用护栏降低AI 智能体安全风险
  • # 一个JSP打天下:47KB万能表单引擎
  • MCP-uplift:无缝桥接新旧MCP协议,平滑迁移AI工具生态
  • 汽车行业客户体验管理系统推荐:基于AI大模型的VOC智能归因与改善工单自动分类实践
  • 微信聊天记录如何免费完整导出?WeChatExporter 开源备份工具全攻略
  • TVA具身智能技术图谱(1):系统安全防护与对抗鲁棒性
  • 《代码随想录》刷题打卡day31:动态规划-背包问题part02
  • 老电脑装不上 Windows 11?这份绕过 TPM 的完整方案请收好
  • Linux线程调度策略与优先级设置实战指南
  • 被 300MB 的 Shapefile 折磨一整天后,我靠 Mapshaper 十分钟交付了秒开的 Web 地图
  • 域内信息搜集实战:从零构建内网渗透侦察地图
  • 网盘下载速度慢到怀疑人生?这款免费油猴脚本让下载速度快10倍
  • MySQL数据库增删改查入门:从基础语法到实战应用
  • SMUDebugTool完全指南:AMD Ryzen系统调试入门的7个实战技巧
  • 抖音批量下载与直播回放保存保姆级指南:douyin-downloader 从入门到顺手
  • CNKI-download:5分钟上手知网文献批量下载的全能助手
  • CAD 优化:跳过 AcConnectWebServices.arx 加载
  • HoRain云--NumPy 从数值范围创建数组
  • 200SMART项目迁移G2全攻略:从V2.8到V3.1,模块与变量规则详解
  • MEMS技术深度解析:从物理原理到工程实践的全链路指南
  • Wacom数位板驱动安装失败全攻略:从根源排查到彻底解决
  • Jellyfin Android TV 完全实战手册:从第一次开机到搭建私人影院的进阶全攻略
  • BetterJoy实战终极指南:免费把Switch手柄变成PC游戏万能适配神器
  • 从收藏夹空转到本地整库:抖音视频批量下载的开源方案实测记录
  • 告别“蜗牛下载“:网盘直链下载助手帮你解锁八大网盘的真实下载链接
  • 从上下文管理到Runtime操作系统:构建高效LLM应用的新范式
  • 被官方放弃的旧 Mac 如何重装新版 macOS?OpenCore Legacy Patcher 完整实操指南
  • MySQL进阶:约束、多表设计、多表查询与事务
  • 无线网络协议栈仿真技术与NS-3实战指南
  • ToolJet AI:开源基础助力构建内部工具,多版本功能丰富开启快速部署!