DASyR-LLM:用领域感知符号回归发现动力学模型
原标题:DASyR-LLM: Domain-Aware Symbolic Regression with LLMs for Kinetic Model Discovery
动力学模型发现是化学工程领域的一项核心挑战,因为准确的速率表达式对于理解和控制化学与生物过程至关重要。符号回归(SR)已成为识别可解释动力学模型的一种强大数据驱动方法,但其通常不利用领域知识,因此常常会探索出在物理化学上不合理的模型。大语言模型(LLM)为将领域专业知识注入这一搜索过程提供了一条有前景的途径。本文介绍了一种由 LLM 引导的 SR 框架:将 LLM 模块嵌入迭代式 SR 算法,用于自动发现动力学模型。在每次迭代中,LLM 承担两项任务:(1)对 SR 得到的最佳候选模型进行定性物理化学评析;(2)结合 SR 生成的模型与内置的化学知识,提出新的候选速率表达式。我们在四个复杂度递增的计算机模拟案例研究中评估了该框架,涵盖多相催化和生物过程系统。结果表明,与当前最先进的 SR 框架相比,LLM 引导的框架将识别真实模型所需的迭代次数减少了 $41.7-79.3%$;在超过一半的引导运行中,LLM 直接提出了正确的模型结构。在实际应用中,每次迭代通常都需要开展一次新的湿实验,这意味着实验工作量可以显著减少。在独立验证集上的预测性能方面,两种方法表现相当,所有案例研究中的 $R^2$ 均高于 $0.98$。消融研究表明,SR 组件和 LLM 规模因素都对这一性能有所贡献,而缩小规模的 LLM 仍能基本保持模型发现效率。这些发现表明,LLM 能够有效地将领域知识注入科学模型发现过程,为构建完全自动化、具备领域感知能力的动力学建模流程铺平了道路。
为什么值得读
当科学建模从离线拟合走向自动实验闭环时,这项工作给出了LLM减少动力学模型搜索与湿实验轮次的具体证据。