来源:Advanced Powder Materials 发布时间:2026/8/11 15:25:30
选择字号:
机器学习驱动电催化剂设计:从数据挖掘到智能发现的新范式

论文题目:Data-driven design of electrocatalysts: Machine learning workflows, paradigm shifts, and applications

期刊:Advanced Powder Materials

DOI:https://doi.org/10.1016/j.apmate.2026.100433

微信链接:https://mp.weixin.qq.com/s/-dKYB_RjW0UxbO0bYrCj9A

1. 文章摘要

在“双碳”战略和能源转型背景下,开发高效、稳定且低成本的电催化剂已成为能源材料领域的重要研究方向。然而,传统催化剂开发高度依赖实验试错和密度泛函理论(DFT)计算,不仅研发周期长,而且难以应对庞大的材料设计空间。针对这一挑战,机器学习(Machine Learning, ML)正逐渐成为推动电催化材料创新的重要工具。本文系统总结了机器学习在电催化剂设计领域的最新研究进展,重点介绍了从大语言模型(LLM)辅助文献挖掘到图神经网络(GNN)材料表征的两大技术变革,并梳理了主动学习、符号回归、强化学习等先进算法在析氢反应(HER)、析氧反应(OER)、氧还原反应(ORR)以及二氧化碳还原反应(CO2RR)中的应用实例。文章进一步讨论了数据质量、模型可解释性以及实验验证等关键问题,并展望了自主实验室与人工智能深度融合背景下电催化剂智能设计的发展方向。

2. 研究背景

电催化技术是实现可再生能源高效存储与转化的重要支撑,其核心涉及水电解制氢、燃料电池以及二氧化碳资源化利用等关键过程。尽管过去几十年中研究人员开发了大量催化材料,但高性能催化剂的发现仍然主要依赖经验指导下的实验探索和理论计算。面对超过1060数量级的潜在材料组合,传统研发模式已难以满足快速筛选和精准设计的需求。与此同时,DFT虽然能够揭示催化反应机理,但其计算成本随体系复杂度急剧增加,难以支撑超大规模材料筛选。因此,如何利用数据科学和人工智能技术加速催化剂发现,成为当前电催化领域的重要发展方向。

图1. 科学研究范式的发展历程。

近年来,机器学习凭借其强大的数据处理与模式识别能力,逐渐成为继实验研究、理论分析和数值模拟之后的“第四科学研究范式”。通过建立材料结构与催化性能之间的映射关系,机器学习能够在极短时间内预测催化活性,实现从“经验发现”向“数据驱动设计”的转变,为下一代高性能电催化剂开发提供了全新的研究思路。

3. 创新点

(1)构建了机器学习驱动电催化剂设计的系统分析框架,从数据获取、特征工程、模型构建到主动学习和实验验证,全面梳理了电催化领域的数据驱动研究范式及其发展脉络。

(2)系统总结了大语言模型辅助文献挖掘、图神经网络材料表征、符号回归和主动学习等机器学习关键技术在析氢反应(HER)、析氧反应(OER)、氧还原反应(ORR)和二氧化碳还原反应(CO2RR)中的应用进展与作用机制。

(3)从数据质量、模型可解释性、物理约束融合以及自主实验平台建设等多个维度分析了机器学习辅助电催化剂设计面临的关键挑战,并展望了智能化、自动化催化材料研发的发展前景。

4. 文章概述

4.1 两大范式转变加速催化剂发现

传统电催化剂研发长期受困于“试错实验周期长”与“密度泛函理论计算成本高”的双重瓶颈。文章系统揭示了机器学习如何推动该领域实现两大根本性范式转变:从手动摘录到大语言模型驱动的智能提取:传统手动文献摘录难以应对逐年呈指数级增长的学术论文,而基于大语言模型(如MaTableGPT)的智能代理可在数小时内从海量论文中自动提取结构化催化性能数据,突破人工构建数据集的效率瓶颈,实现知识驱动的加速探索。

从人工设计描述符到图神经网络自动表征:传统描述符难以全面捕捉催化剂的复杂化学环境与电子结构特征。以图神经网络为代表的学习表示方法将晶体结构建模为“原子-键”图,通过信息传递自动习得深层特征,结合Open Catalyst Project等万级密度泛函理论数据集与物理信息机器学习架构,大幅拓展了高通量筛选的化学空间边界。

4.2 可解释符号回归与闭环主动学习

传统特征选择(如LASSO)仅能筛选或线性组合已有变量。而SISSO与符号回归能够从基本物理量出发,自动生成并筛选数亿个非线性候选公式,提炼出简洁、透明的分析型描述符。这不仅提升了预测精度,更重要的是将黑箱关联升华为可解释的物理定律,为打破电催化反应中的标度关系提供直接理论指导。

高斯过程回归等模型同时输出预测值与不确定性。主动学习算法利用不确定性度量智能平衡“开发”(利用已知高活性区)与“探索”(探索不确定区),以最少实验/计算次数获得最大信息增益。案例中,AI化学家平台将单一样品研发周期从20小时缩至78分钟,成功筛选出462种高熵催化剂,验证了闭环系统的强大能力。

针对纯数据驱动模型“不可解释”的痛点,理论注入神经网络(TinNet)将d带理论等电化学原理嵌入网络架构,使模型先学习中间物理量再输出吸附能。这保证了预测结果物理一致且可溯源,研究人员可直接追踪活性来源至具体电子结构特征。机器学习作为“第四研究范式”,能从有限数据中快速学习非线性构效关系,将DFT级预测提速至毫秒级,成为突破瓶颈的必然选择。

图2. 算法示意图。(a)线性回归;(b)支持向量机;(c)k近邻算法;(d)决策树;(e)神经网络算法

4.3 关键催化反应中的应用

文章以四个对能源技术至关重要的电催化反应为案例,全面验证了机器学习在实际催化瓶颈破解中的核心价值。

在析氢反应中,传统理论依赖的单一描述符已无法满足日益复杂催化中心的计算需求。机器学习辅助的特征重要性分析指出:Bader电荷、第二壳层电负性及界面水网络的极化响应是关键动力学描述符,为理性设计高性能析氢催化剂开辟了新视角。

图3. 机器学习在析氢反应的相关研究。(a)不同金属在各结构的析氢反应活性图;(b、c)SVR、KRR、RFR、XGBR、LASSO和ANNs算法的R2和RSME值

在析氧反应中,四电子转移的动力学迟滞是电解制氢的核心瓶颈。研究发现,传统的d带中心模型在复杂配位环境中往往失效。基于机器学习的系统性数据分析揭示:轨道能级比平均d带中心更为精准地反映了氧中间体(*OH、*OOH)的吸附活性,为打破OER中的线性标度关系、逼近理论最低过电位提供了电子结构层面的解释工具。

图4. 机器学习在析氧反应的相关研究。(a)吸附质和过渡金属之间相互作用的示意图;(b)位于八面体晶场内的3d轨道的能级分裂;(c)RF模型预测的过电位和真实值的对角线散点图;(d)RF模型预测不同组分的过电位等高图

在氧还原反应中,宏观的随机森林与梯度提升回归模型分析表明:ΔGOOH*是主导活性的关键热力学指标,并且第二壳层杂原子掺杂可非对称地偏移中间体能量,使Fe、Co等金属中心逼近火山图顶点。进一步结合符号回归与深度学习的学习回路,可迭代筛选出打破*OH与*OOH标度关系的双金属位点(如Fe-Fe双核催化剂),使氧还原过电位显著降低。

图5. 机器学习在氧还原反应的相关研究。(a)使用GBR算法得到的特征重要性排序;(b)iModelN训练结果和DFT计算结果之间的RMSE;(c)BGP算法和神经网络的数据融合示意图;(d)机器学习调查的工作流程;(e)17个特征的重要性与相应占比;(f)GBF算法的训练集和测试集的对角线散点图。

在二氧化碳还原反应中,反应网络的复杂性使传统描述符难以支撑精确预测。机器学习方法通过将密度泛函理论与微观动力学建模深度融合,并利用大语言模型驱动的环境智能调控,揭示了较高pH条件下*OCHO结合能被减弱的关键影响,显著提升甲酸选择性及周转频率。此外,图神经网络与最大增益动态微环境算法的结合,可自动发现超出传统描述符表达能力的稳定表面构型,突破了复杂多金属催化表面的探索极限。

图6. 机器学习在二氧化碳还原反应的相关研究。(a)电场控制恒电位计算模型图示;(b)酸性(虚线)和碱性(实线)条件下,CO2RR转化HCOOH的决速步分析;(c)四种机器学习模型的R2和RSME值

4.4 机器学习驱动电催化剂设计的未来发展方向

尽管机器学习在电催化领域已展现出颠覆性潜力,但其从学术研究走向实际应用仍面临数据质量、模型可解释性以及合成?性能鸿沟等多重挑战。文章指出,未来数据驱动电催化剂的发展迫切需要材料科学、计算化学、人工智能、自动化实验及系统工程等多学科的深度协同。仅依靠单一算法的改进或单一数据源的扩充难以支撑产业化落地,必须建立从数据采集、特征工程、模型构建到高通量实验验证的全链条闭环体系。

在数据质量与标准化方面,当前数据集普遍受“出版偏倚”影响——仅报道高性能催化剂的倾向导致负样本缺失,严重限制了机器学习模型对真实化学空间边界的认知能力。为此,需开发基于大语言模型的自动化文献挖掘工具,不仅提取正面结果,更要系统收录无效或失败的实验数据,构建均衡、可复用的标准化数据库。同时,应建立跨计算与实验的数据协议,通过主动学习和不确定性采样主动填补数据空白,利用迁移学习融合不同精度的密度泛函理论数据与实测电化学性能,从而缩小理想模型与工况固液界面之间的“保真度缺口”。

在模型可解释性与物理一致性方面,高精度的图神经网络和深度学习模型往往沦为“黑箱”,其预测结果难以转化为普适、可迁移的设计规则。未来的核心方向是发展物理信息机器学习,将电化学基本原理、电子结构理论及热力学约束直接嵌入网络架构。结合符号回归方法自动发现简洁的分析型描述符,使模型不仅“会预测”,更能“讲道理”——输出透明的物理定律,从而真正揭示多电子转移过程中打破标度关系的内在机制。此外,可解释人工智能工具的应用将帮助研究人员在全局和局部层次上理解特征与活性的因果关联。

在闭环验证与规模化应用方面,机器学习预测与真实催化性能之间的“合成-性能鸿沟”亟待弥合。传统的“预测-计算”范式忽略了催化剂的可合成性、稳定性及工况下的结构演变。未来的突破点在于构建“自动驾驶实验室”——集成高通量机器人合成、自动结构表征、电化学快速筛选及实时数据反馈——与主动学习算法深度融合,形成“预测→合成→表征→验证→再训练”的完整学习回路。这一闭环系统不仅能自动迭代优化催化剂成分与形貌,还可主动探索高不确定度区域,最大化每次实验的信息增益。

5. 启示

本文全面展示了人工智能技术正在如何重塑电催化材料研发模式。从传统依赖经验积累和反复试错的研究方式,到如今能够依托海量数据和智能算法实现精准预测,机器学习正在显著缩短催化剂开发周期,提高研发效率。尤其值得关注的是,大语言模型、图神经网络和自主实验平台的融合正在推动材料科学进入“智能发现”时代。在这一新范式下,人工智能不仅是辅助工具,更逐渐成为科学发现的重要参与者。

对于能源催化领域的科研工作者而言,未来的竞争优势将不仅来源于实验能力和理论分析能力,更来源于数据获取、模型构建以及人工智能工具的综合运用能力。随着自主实验室和闭环研发平台的不断成熟,材料研发有望从过去以年为单位的探索过程缩短到以月甚至以周为单位的快速迭代过程,为实现碳中和目标和发展新型能源技术提供重要支撑。

引用信息:Ziwei Liu, Hanqing Gu, Liwei Yang, Wencheng Wu, Zhong Huang, Haozhi Wang, Yang Wang, Yida Deng, Data-driven design of electrocatalysts: Machine learning workflows, paradigm shifts, and applications. Adv. Powder Mater. 5(2026)100433. https://doi.org/10.1016/j.apmate.2026.100433

扫二维码 查看全文

原文链接:https://www.sciencedirect.com/science/article/pii/S2772834X26000412

 
 
 
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。
 
 打印  发E-mail给: 
    
 
相关新闻 相关论文

图片新闻
狗能识别人类的恐惧与悲伤 科学网2026年7月十佳博文榜单公布!
“科学”号西太平洋科考收官 中国科学家首次认证胶球存在
>>更多
 
一周新闻排行
 
编辑部推荐博文