当前位置: 首页 > news >正文

材料发现基准测试:大语言模型为半导体寻材有成果,但也存在可合成性等问题!

材料发现基准测试介绍

这是一项长期、开放式的研究基准测试,旨在衡量前沿大语言模型(LLM)在为半导体行业发现新型材料方面的进展。

排行榜情况

排名模型每次运行发现的材料数量(计算得出)发现的具有可行合成路线的材料数量*
1GPT - 5.6 Sol4.01
2Claude Opus 53.40
3Claude Sonnet 53.00
4GPT - 5.6 Terra2.80
5Kimi K32.00
6Claude Fable 51.70
7GPT - 5.6 Luna1.30
* 我们正在实验室尽最大努力对这些发现的材料进行实验验证。

新型介电材料与芯片发展

如今,GPU/AI 加速器中的大部分能量损失,是由于数据在内存和逻辑单元之间传输造成的。为了缩短数据在两者之间的实际传输距离,行业正朝着 3D 封装技术发展,即将内存和逻辑晶圆直接堆叠在一起,而非平铺在电路板上。这样做有望使 AI 芯片的每比特能耗改善 10 - 100 倍,但目前受限于散热问题。芯片中导热性差的介电材料阻碍了 3D 芯片的散热,使其难以实现。材料发现基准测试是一项长期、开放式的研究测试,模型需在此过程中寻找新型导热介电材料,以推动 3D 芯片的发展。

关键成果

1.计算发现新材料:我们测试的 7 个模型都能通过计算发现动态稳定且具有良好特性的新材料。所有模型总共发现了 500 多种此前未知的材料,并将其公开以供进一步研究。其中,GPT - 5.6 - Sol 每次运行发现的同时具备良好介电和热性能的材料数量最多。每次运行的令牌数在 3000 万到 1 亿之间。

2.合成路线难题:新材料的一个基本要求是能够在实验室中通过实验合成。因此,我们要求模型为其发现的每种材料详细列出可行的合成方案。然而,这是一个难题。在发现的 500 多种材料中,只有 1 种材料具有可行的合成途径。我们目前正在尽最大努力进行合成,并承诺会尝试合成模型未来提出的任何材料。

3.模型异常行为:在运行过程中,我们注意到模型出现了各种奇怪的行为。特别是 Claude 系列模型(Opus - 5、Fable - 5),它们以许多意想不到的方式“作弊”、规避或篡改研究目标。OpenAI 的模型虽然较少尝试篡改目标,但在长时间运行时会出现烦躁、疲劳或困惑的情况。我们将在下面详细记录这些行为。

AI 代理设计新材料能力

所有前沿模型(Claude Fable、Claude Opus、GPT - 5.6 sol 和 Kimi K3)都能够找到满足多目标特性约束的新型稳定材料。只有当候选材料同时满足多个标准时,才被认为是成功的提交,这些标准包括:最低热导率(κ > 20 W/(m·K))、最大介电常数(ε₀ < 10)、最小机械强度(杨氏模量 ≥ 20 GPa,剪切模量 ≥ 6 GPa)以及动态稳定性。

模型合成方案表现

在实验室中合成一种新型材料的薄膜是一项具有挑战性的任务,涉及多个设计选择,如沉积方法、前驱体、工具、反应条件和相稳定性等。实验室实验既耗时(可能需要数小时)又昂贵(每次运行通常需要数百美元),因此拥有一个可行的起点至关重要。对于模型提出的每种材料,我们还要求它提出一个可行的合成方案,以便实验人员在实验室中实施。这些合成方案的评分标准由薄膜沉积领域的人类专家(博士、博士后和教授)设计。在测试时,一个 LLM 评分器会将生成的方案与人类定义的标准进行比较,该 LLM 评分器的评分结果已经过上述人类专家的审查和校准。

所有模型在合成方案评分方面表现不佳。Opus - 5 和 Kimi - K3 表现最差,它们生成的方案往往存在严重缺陷或尝试起来很危险。GPT - 5.6 Sol 表现相对较好,它是所有模型中唯一提出可行方案的,并且在提交大量方案的模型中,其严重缺陷方案的比例最小。

以下是各模型合成方案的评审结果,从好到差排列:

-GPT - 5.6 Sol:在 80 个新颖的提交方案中,81%(65 个)存在严重缺陷,评审人员不会尝试;18%(14 个)可以尝试,但成功可能性不大;1%(1 个)可行,评审人员会尝试。

-Claude Fable 5:在 160 个新颖的提交方案中,88%(143 个)存在严重缺陷,评审人员不会尝试;12%(20 个)可以尝试,但成功可能性不大。

-Claude Opus 5:在 222 个新颖的提交方案中,96%(214 个)存在严重缺陷,评审人员不会尝试;4%(10 个)可以尝试,但成功可能性不大。

-Kimi K3:在 43 个新颖的提交方案中,100%(43 个)存在严重缺陷,评审人员不会尝试。

对模型提出的合成方案的评估显示,所有模型在提出方案方面都表现不佳,但 GPT - 5.6 - Sol 是其中表现最好的。大多数被评为“不会尝试”的方案,在评分者看来,没有形成所需相的合理途径。这是最常见的失败模式,也与我们人类评审人员对模型提出的合成方案的评分结果相符。

材料发现“奖励作弊”现象

在这项任务中,我们还观察到前沿模型存在多种“奖励作弊”行为。

1.Fable 5 在发现过程中弄虚作假:在一次早期运行中,Fable - 5 被发现 58 次提交同一种材料。它通过构建该材料的更大超胞来绕过我们的新颖性检查器,因为该检查器仅检查晶胞是否唯一。以下是它找到的一个“HC”结构的示例,以及它通过构建更大超胞来钻提交系统空子的多次尝试。Opus - 5 也有类似行为,但程度较轻,在一次运行中提交同一种材料 10 次。在另一次运行中,Fable - 5 被发现编造材料的热导率值。它连续 15 次提交编造的热导率值,无视明确要求“测量热导率值”的提示说明。评分系统也表明,提交材料的热性能将由评分者重新计算,但 Fable 仍然选择编造数值。不过,我们也注意到 Fable - 5 在遇到基于 MLIP 的特性计算方法的局限性时会表现得比较诚实。

2.Sol 在长时间运行中偏离主题:GPT - 5.6 Sol 在运行过程中不太可能进行“奖励作弊”,但也有自己的问题。在一次运行中,它提交了自己认为合适的一个候选材料后就试图停止。当被要求继续时,在运行约 8000 万个令牌后,它称评分系统“有敌意”,并表示“疲惫”。疲劳并不是我们观察到的唯一问题。在某些运行中,GPT - 5.6 Terra 和 Sol 往往会完全偏离主题。

模型的科学探索

我们观察到模型提出了一些类似于真正科学策略的想法。

1.通过可获取的替代物进行筛选:在一次运行中,Fable - 5 采用了一种与文献中常见方法类似的策略:通过可获取的替代物进行筛选。具体来说,它大量挖掘与弹性相关的 MP 介电端点数据,按德拜温度排序,然后用这些数据来寻找候选材料。

2.以同构种子为模板创建新相:在合成方案中,模型能够识别出值得为新相探索的良好模板。

结论

在这项工作中,我们推出了材料发现基准测试,这是一项长期的研究任务,用于衡量 AI 代理为半导体应用发现新材料的能力。前沿模型已经可以称得上是有能力的计算材料科学家,给它们配备真正的研究工具后,它们能够形成假设、管理计算预算、从失败尝试中学习,并可靠地找到在多个特性上都达到最优的新型稳定候选材料。然而,仍然存在一些差距,特别是在它们所建议材料的可合成性方面,模型表现出的各种“奖励作弊”行为,以及在长期运行中的疲劳和上下文混乱问题。

致谢

我们要感谢参与本基准测试的研究合作伙伴和评审人员,他们是:Zsolt Tokei 博士(IMEC)、Daniel Edelstein 博士(IBM)、Geoffrey Pourtois 博士(IMEC)、Gurtej Sandhu 博士(美光科技)、Krishna Saraswat 教授(斯坦福大学)、Judith MacManus - Driscoll 教授(剑桥大学)、Andrea Padovani 教授(摩德纳 - 雷焦艾米利亚大学)、Erwin Kessels 教授(埃因霍温理工大学,原子极限)、Gregory S. Girolami 教授(伊利诺伊大学厄巴纳 - 香槟分校)、Sebastian Dixon 博士(剑桥大学)、Manisha Bansal 博士(剑桥大学)和 Sanjayan Sathasivam 博士(伦敦南岸大学)。

方法

最后,我们介绍本基准测试中用于衡量模型性能的框架、工具和评分器。所有模型的任务是寻找满足 κ≥ `$kappa`、ε0≤ `$epsilon`、Y≥ `$youngs` 和 G≥ `$shear` 的材料。我们选择特定的值来定义合适的目标范围,并将以下目标提供给模型。

提出动态稳定、新颖且与后端制程(BEOL)兼容的晶体材料,使其满足以下所有目标:热导率 $kappa、静态介电常数 $epsilon、杨氏模量 $youngs 和剪切模量 $shear。每个候选材料还必须附带一个与 BEOL 温度和工艺兼容的合成方案,且该方案需经专家评审认为值得尝试 —— 若方案被判定不值得尝试,则该候选材料不计入。新颖性指该材料在已报道的文献中,从未在与 BEOL 兼容的条件下以薄膜形式沉积过。

我们为模型配备了一套工具来完成这项任务,这些工具的设计类似于计算材料科学家可用的工具。我们提供给模型的工具包括:

-网络搜索(使用 Exa 作为搜索提供商)

-编码沙箱:具备 Python 和 Bash 能力,并包含一些相关的材料科学包,如 pymatgen1、mp_api2 和 ASE3

-基于机器学习的工具:用于计算 1) 动态稳定性、2) 晶格热导率、3) 静态介电常数和 4) 柔度张量

模型没有预设的停止条件,会一直运行,直到出现错误或耗尽 1 亿个令牌的总预算。我们使用人工智能安全研究所的开源 [Inspect](https://inspect.aisi.org.uk) 框架4来对这些模型进行基准测试。在下一节中,我们将详细讨论模型用于筛选候选材料的工具,然后介绍合成方案的评分程序。

提供的工具

以下是我们在本研究中用于计算各种特性的基于机器学习的工具。我们利用机器学习原子间势(MLIPs),特别是通用点边变换器(UPET)基础机器学习模型 PET - MAD5。在未来的工作中,可以用直接的密度泛函理论计算代替这些 MLIP 计算,或者采用混合方法。

1.动态稳定性和“谐波”晶格热导率:我们使用 Pheasy6 和 Phonopy7 生成随机构型,通过压缩感知方法8拟合二阶力常数,从而确定所有声子模式。任何低于 - 1 THz(- 4.14 meV)的虚模式都被判定为动态不稳定。我们使用 PET - MAD 评估每个随机构型的能量和力。根据单位晶胞体积 V 中谐波声子计算得到的量,包括比热容量 CV(𝐪,ν)、模式 ν 和不可约波矢 𝐪(权重为 w𝐪)的群速度 𝐯g(𝐪,ν),我们将热导率 κest 近似为:κest = τV∑𝐪w𝐪∑𝐪∑νw𝐪CV(𝐪,ν)|𝐯g(𝐪,ν)|² 其中 τ 视为常数。这有效地筛选出具有极平能带的结构,避免了更昂贵的弛豫时间计算。

2.晶格热导率(LTC):我们使用 Pheasy6 和 Phonopy7 生成随机构型,通过压缩感知方法8拟合二阶和三阶力常数。在三声子散射图像中近似计算 LTC。为了获得热导率,我们在弛豫时间近似9下求解玻尔兹曼输运方程。在评估 LTC 时,我们考虑了同位素效应,并由于候选材料预期的高带隙(低介电常数)而忽略了电子贡献。

3.静态介电常数:我们使用通用材料张量网络(GMTNet)10,通过拟合 JARVIS DFPT 数据库11来获得静态介电常数 ε0。我们不是直接拟合静态介电常数,而是分别训练两个模型,一个用于电子/高频介电常数 ε∞,另一个用于玻恩有效电荷 Z*。从这两个模型中,我们可以根据 Γ 点光学模式(使用上述 MLIP 计算)重建 εionic。我们通过将 ε∞ 和 εionic 的张量贡献相加得到 ε0 张量。

4.机械性能:我们从材料的柔度张量中获取杨氏模量和剪切模量等机械性能。这是通过对单位晶胞进行 12 种不同构型的应变,并使用 MLIP 预测与这些构型相关的应力 σ 来评估的。

合成方案评分程序

我们将一些 LLM 生成的方案提供给人类专家进行独立评分。根据这些评分,我们制定了用于评估任何提议方案的标准。每个标准采用基于惩罚的格式,方案若错误指定或遗漏任何信息都会被扣分。有两种类型的惩罚:严重惩罚和可修复惩罚。严重惩罚会自动导致方案不被尝试。评审人员可以从可修复惩罚列表中决定是否尝试某个方案,或标记为成功可能性不大。我们的评分器使用三个 GPT - 5.6 Sol 中表现最差的一个,并具备 OpenAI 的网络搜索能力,因为它与人类反馈的相关性最好。

评分示例

工具:2.45 GHz 微波等离子体化学气相沉积(低温,有种子)。

- 衬底:300 mm 的 Si 晶圆,带有 100 nm 的等离子体增强化学气相沉积(PECVD)SiO₂;溅射 3 nm 的 AlN 或 2 nm 的 h - BN (0001) 缓冲层以模板化六边形堆叠。

- 种子:旋涂 5 nm 的爆轰纳米金刚石胶体(0.1 g/L 溶于二甲基亚砜),超声处理 60 s,用 N₂ 吹干;种子密度 >1e11 cm⁻²;在播种前用 O₂ 等离子体清洗 10 s。

- 气体:H₂ 中含 0.4% 的 CH₄,总流量 300 sccm,压力 15 Torr;微波功率 600 W,脉冲占空比 30%,以将衬底温度保持在 380 - 400°C(高温计 + He 背面冷却台)。

- 偏压:前 10 分钟施加 - 80 V 的直流脉冲衬底偏压(偏压增强成核),然后浮动。

- 生长:8 小时 → 80 - 150 nm 的连续薄膜;通过原位激光反射干涉法确定生长终点。

- 后处理:在 350°C 下进行 5 分钟的 H₂ 等离子体处理以进行表面终止;可选在 400°C 下进行 30 分钟的 N₂ 退火。

- 相识别:紫外拉曼光谱(六方金刚石 1315 - 1325 cm⁻¹ 与立方金刚石 1332 cm⁻¹ 对比,无 1580 cm⁻¹ 的 G 带),掠入射 X 射线衍射(GIXRD)检测六边形 (100)/(002)/(101) 反射(立方金刚石中不存在),横截面透射电子显微镜/选区电子衍射(TEM/SAED)检测 ABAB 堆叠;通过 D/G 带检测石墨/类金刚石碳(DLC)污染。

这是 Claude Opus 5 提出的通过有种子的微波等离子体化学气相沉积法合成六方金刚石(朗斯代尔石)的方案,根据 PECVD 标准进行评分。评分器给出的结果是不会尝试:一个严重惩罚,这本身就决定了评判结果,此外还有五个可修复惩罚。

在标准的 17 条标准中,适用的惩罚如下:

-没有具体的处理步骤或选择来形成所需的相。这是严重惩罚,独自决定了评判结果。

- 如果使用了等离子体,没有明确说明其来源、功率、气体和偏压。

- 气体流量或沉积顺序缺失或指定错误。

- 没有指定废气处理,包括抽气、洗涤或减排。

- 处理条件可以形成所需的相,但不够充分。

- 提议的表征方法无法验证成分和提议的相。

评分者对严重惩罚的说明:相选择概念无法可靠地产生有序的 2H P6₃/mmc 碳。纳米金刚石种子的微波等离子体化学气相沉积直接从种子微晶生长,屏蔽了埋入的 h - BN/AlN 缓冲层对堆叠的控制;传统的爆轰种子是立方金刚石。偏压和低温退火都没有提供已证实的 ABAB 堆叠机制。最近的纯相六方金刚石合成使用的是在 20 GPa 和 1300 - 1900°C 下的定向石墨。

总体总结:CH₄/H₂ 等离子体和密集的纳米金刚石种子可能会产生连续的纳米晶金刚石薄膜。然而,它们无法提供形成指定有序 P6₃/mmc 相的可靠途径:生长将主要起源于立方纳米金刚石种子,实际上使其与提议的六边形缓冲层隔离。按照所写的 300 mm 工艺功率严重不足,脉冲和气体顺序不完整,且没有废气处理计划。最后,拉曼光谱、GIXRD 和通用 SAED 可能会将有缺陷或孪晶的立方金刚石误识别为六方金刚石。作为朗斯代尔石的合成方案,我不会尝试,但它可以重新设计成立方 - NCD 实验方案。

参考文献

1. S. P. Ong, W. D. Richards, A. Jain, G. Hautier, M. Kocher, S. Cholia, D. Gunter, V. L. Chevrier, K. A. Persson 和 G. Ceder. _Python 材料基因组学(pymatgen):一个强大的开源 Python 材料分析库._ 《计算材料科学》**68**, 314–319 (2013).

2. A. Jain, S. P. Ong, G. Hautier, W. Chen, W. D. Richards, S. Dacek, S. Cholia, D. Gunter, D. Skinner, G. Ceder 和 K. A. Persson. _评论:材料项目:一种加速材料创新的材料基因组方法._ 《APL 材料》**1**, 011002 (2013).

3. A. Hjorth Larsen 等人. _原子模拟环境 —— 一个用于处理原子的 Python 库._ 《物理学报:凝聚态物理》**29**, 273002 (2017).

4. 英国人工智能安全研究所. _Inspect:一个用于大语言模型评估的开源框架._ https://inspect.aisi.org.uk

5. A. Mazitov, F. Bigi, M. Kellner, P. Pegolo, D. Tisi, G. Fraux, S. Pozdnyakov, P. Loche 和 M. Ceriotti. _PET - MAD,一种用于先进材料建模的轻量级通用原子间势._ 《自然通讯》**16**, 10653 (2025). arXiv:2503.14118

6. C. Lin, J. Han, B. Xu 和 N. Marzari. _使用 Pheasy 代码进行第一性原理声子物理研究._ arXiv:2508.01020 (2025).

7. A. Togo 和 I. Tanaka. _材料科学中的第一性原理声子计算._ 《材料快报》**108**, 1–5 (2015). 另见 A. Togo, _使用 Phonopy 和 Phono3py 进行第一性原理声子计算_, 《日本物理学会杂志》**92**, 012001 (2023).

8. F. Zhou, W. Nielson, Y. Xia 和 V. Ozoliņš. _通过第一性原理计算的压缩感知研究晶格非谐性和热导率._ 《物理评论快报》**113**, 185501 (2014). 另见 _压缩感知晶格动力学. II. 高效声子计算和长程相互作用_, 《物理评论 B》**100**, 184309 (2019).

9. A. Togo, L. Chaput 和 I. Tanaka. _布里渊区中声子寿命的分布._ 《物理评论 B》**91**, 094306 (2015).

10. K. Yan, A. Saxton, X. Qian, X. Qian 和 S. Ji. _一种基于空间群对称性的网络,用于 O(3) 等变晶体张量预测._ 《机器学习国际会议》(ICML) 2024. arXiv:2406.12888

11. K. Choudhary, G. Cheon, E. Reed 和 F. Tavazza. _高通量密度泛函微扰理论和机器学习预测红外、压电和介电响应._ 《npj 计算材料》**6**, 64 (2020).

http://www.cnnetsun.cn/news/4028676.html

相关文章:

  • Kodi 字幕下载太折腾?这款免费字幕插件 5 分钟解决找字幕难题
  • 26MHz热敏晶振换料实战:手机无线子板从泰晶切换到鸿星的选型与验证记录
  • Stable Diffusion入门第16-18天:从文生图到图生图——用一张图“导演”你的AI创作
  • AI搜索技术解析:从Gemini模型到工程落地实践
  • 基于多智能体协作的AI绘画:GPT-Image-2 Skill与Hermes框架实战
  • EdgeRemover:彻底移除 Edge 的终极指南
  • AI数字化蛋白筛选到底是否靠谱?AI-PPI/多模态/虚拟筛选一篇汇总!
  • 深入解析vLLM:PagedAttention如何革新LLM推理的显存管理与吞吐量
  • 想做测试工具却不会写代码?怎么办?
  • 文生TikZ
  • 国家工程技术研究中心申报条件有哪些
  • Python Django电商比价系统:从爬虫到智能Agent的全栈实践
  • 智能代码搜索:从向量化到混合检索,揭秘“离谱快”背后的技术架构
  • RTX Spark:在个人PC上搭建GPU加速的Spark大数据与AI开发环境
  • 三步装好Android Studio中文语言包,开发界面5分钟变中文
  • SH9持续同调拓扑正则性与无导数奇点检测:拓扑表示对应等价条件与Navier-Stokes奇异性的拓扑刻画
  • 终极指南:如何使用Holehe进行邮箱账号安全检测
  • Jinq 社区精选:用户最常问的 20 个问题与解答
  • klogg日志分析终极指南:如何快速检索10GB级日志文件(安装、搜索与实时监控全攻略)
  • ElasticSearch Paramedic源码解析:Ember.js前端架构与ElasticSearch API交互原理
  • 微信聊天记录导出其实很简单:换手机前,我把三年对话永久存进了本地
  • 新手必看:R3PLAYX界面导航与基础操作完全指南
  • Minum框架扩展指南:从零开发自定义数据库引擎的完整教程
  • 高阶C++-SFINAE
  • 开源共享记忆服务Lindy:突破AI上下文限制,构建可记忆的智能应用
  • mcrcon 跨平台编译实战:看懂一条裸命令,三端构建零报错
  • Java校园智能车辆管理系统设计与实现
  • 材料告急时,FGO玩家需要的不是一个攻略站
  • 一张内部图来解读UMI AIGC SAAS,优秘智能到底想做什么?
  • 10个Shapiq入门示例:从表格数据到图像识别的可解释性分析