启动晶体结构预测|OA|GN模型|计算老本比基于DFT方法低三个数量级|数据库 (启动晶体结构是什么)
本文目录导航:
「数据库+GN模型+OA」启动晶体结构预测,计算老本比基于DFT方法低三个数量级
晶体结构预测(CSP)旨在应用给定分子(包括中性分子和离子)的结构预测在特定温度和压力条件下的热稳固性最佳晶体结构。
这一迷信畛域常年存在应战,近期,龚新高院士与尹万健传授率领的钻研团队,驳回了一种机器学习方法,联合图网络(GN)和提升算法(OA),在数据库中建设了晶体结构与构成焓之间的相关模型,减速寻觅具备最低构成焓的晶体结构。
该钻研以“应用图网络与提升算法启动晶体结构预测”为题,于2022年3月21日宣布在《Nature Communications》上。
经过这种方法,钻研人员构建了一个灵敏的框架,该框架包括数据库、图网络和提升算法三个局部,准许资料数据库、晶体图示意和提升算法的调整,以顺应不同需求。
钻研团队应用开明量子资料数据库(OQMD)版本1.3和Matbench构成能数据集(MatB)训练了图网络模型。
随机搜查(RAS)、粒子群提升(PSO)和贝叶斯提升(BO)作为提升算法成功,钻研不同组合对29种二元化合物晶体结构预测的功能。
结果显示,联合MatB训练的BO提升算法与图网络模型(GN(MatB)-BO)在预测精度和计算老本上体现最佳。
经过比拟两种数据库训练的图网络模型(GN(OQMD)和GN(MatB))在预测晶体结构的功能,发现虽然GN(OQMD)的平均相对误差(MAE)较低,但在CSP功能上不如GN(MatB)。
这或者是由于GN(OQMD)适度拟合了数据。
在运行GN-OA方法识别29种化合物的晶体结构时,钻研人员发现,无论是经常使用OQMD还是MatB训练,CSP的提升算法精度顺序为BO > RAS > PSO。
在MatB上训练的GN模型通常在预测准确性上优于在OQMD上训练的模型。
与基于密度泛函切实(DFT)的方法相比,以前方法在预测精度和计算老本方面均有所限度。
虽然GN模型基于DFT计算训练,因此其准确度不可超越DFT结果,但与基于DFT的CSP相比,GN(MatB)-BO方法的计算老本清楚降落三个数量级。
综上所述,该钻研提出了一种灵敏的框架,联合图网络与提升算法启动晶体结构预测,相较于基于DFT的方法,其预测晶体结构的计算老本大幅降落。
但是,该方法仍存在局限性,须要进一步开展晶体结构表征、结构搜查和算法并行化等方向,以更有效地预测复杂和未知结构。
这一钻研为数据驱动的晶体结构预测开拓了新路径,有望在无需低廉的DFT计算的状况下提高预测效率。
布鲁克海文蛋白质数据库文件结构
在蛋白质晶体结构数据库PDB中,蛋白质分子结构以独立的文件方式记载,这些文件被称为PDB的入口文件。
每一个文件对应一个大分子结构,经过惟一的ID码启动识别。
早期,每一种大分子对应一个文件,后在1997年,每一种动物大分子有了三个相关文件:全文文件、书目文件和图形文件。
每个PDB入口文件蕴含多个局部,包括题目、注释、一级结构、异质、二级结构、连通性注释、各种个性、结晶学、坐标变换、原子坐标、化学衔接和簿记等。
文件中的每行被称为一条记载或入口,共80列,最后一个字符为行完结符。
PDB文件被视为记载类型的汇合,不同于相关数据库的库文件,后者每条记载由不同数据类型和数据格局的多个字段组成,一切记载的字段结构相反。
PDB文件蕴含多种记载类型,每类记载都有不同的格局。
基于记载类型在一个PDB入口文件中产生的次数,可将记载分为六类:单次记载型、单次接续型、屡次记载型、屡次接续型、分组记载型和其余记载型。
单次记载型如HEADER、END和CRYST1仅产生一次性,没有接续局部。
单次接续型如AUTHOR、CAVEAT和COMPND在概念上存在一次性,内容超越一行时有接续批示字段。
屡次记载型如ATOM、CONECT和HELIX在文件中屡次产生。
屡次接续型如FORMUL、HETATM和HETNAM在概念上存在屡次,每条记载内容超越一行的局部有接续批示字段。
分组记载型如ENDMDL、MODEL和TER用于其余记载类别的分组。
其余记载类型如JRNL(文献援用)和REMARK(普通注释)。
每个记载类型由固定的列数宰割成多个字段,每个字段蕴含数据类型、字段名和字段定义。
转载请注明出处:https://www.twgcw.com/gcsc/107436.html
