Ex11.1 常用数据库总结
汇集本人日常学习中接触到的一些数据库。如果你有好的数据库、链接、推荐的书籍,欢迎加大师兄微信:BigBroSci
需要注意的是,本人推荐的主要有The Materials Project,Meta FAIR Chem 和 Catalysis-Hub。因为它们的数据量很大,完全可以满足我们的科研需求,如果没有,就自己算。
除了上面推荐的三个,本文中列举的其他数据库我只有ioChem-BD 和 Chem Spider 的使用经验,就不再啰嗦了。\但凡能做开放数据库的,大家都要抱着尊重的态度。如果感兴趣,去官网浏览学习即可。
另外提前声明一点: 请不要再回复什么网址没法打开等傻问题。
打不开就不要去看,就不要去了解,该干嘛就干嘛,没有数据库照样能活,就是这么简单而已。
The Materials Project https://www.materialsproject.org/
由美国劳伦斯伯克利国家实验室牵头的多机构国际合作项目,旨在通过高通量 DFT 计算无机材料的性质,系统性探索和存储所有无机材料的性质并将相关数据与分析算法免费提供给每一位材料科学研究者。该项目的最终目标是:通过将昂贵且耗时的实验工作集中在那些在计算中最具潜力的化合物上,从而大幅缩短新材料发明所需的时间。免费开放,支持 API 访问,适用新材料设计、催化剂筛选、电池材料探索。
**Meta FAIR Chem **
由 Meta AI(原 Facebook AI Research, FAIR)主导的研究项目,旨在将先进的人工智能方法引入化学与材料科学领域,加速分子与材料的发现与优化。FAIR Chem 通过构建大规模高质量的化学数据集,训练通用的机器学习与深度学习模型,实现分子性质预测、反应路径探索和材料性能筛选等关键任务。该项目的最终目标是:降低实验与高精度计算的成本门槛,推动药物研发、新能源材料和绿色化学的发展。项目免费开放,支持 API 与模型调用,适用于药物设计、催化剂探索以及分子模拟等前沿研究。FAIR Chem 的数据主要有OMol25,OMC25,ODAC25, OMat24,OC20 / OC 系列(Open Catalysts / 催化体系)。此外,FAIR Chem 还有各种图神经网络 (GNN) / 等变网络(equivariant networks)模型,用于从结构预测性质,比如:UMA(Universal Model for Atoms),eSEN(equivariant Smooth Energy Network)等,有兴趣的可以去浏览Git-Hub的介绍。
Catalysis-Hub :www.catalysis-hub.org
一个面向计算催化 (“heterogeneous catalysis”) 研究的开放电子结构数据库平台,专注于在催化表面上发生的反应的第一性原理计算数据。它提供了一个统一的界面来浏览、检索、分析以及上传催化反应能量、吸附能、过渡态能垒等数据,同时保留原子结构和计算详情以保证可重现性。最初由 SUNCAT(Stanford / SLAC 的催化中心)等机构推动,是 CatApp 等早期催化数据库的升级版本。其理念类似 Materials Project 在材料结构/性质上的开放库,但专注于“催化反应”这个更具专业性的子领域。
ioChem-BD http://www.iochem-bd.org/
ioChem-BD 依托于一个独特的软件平台,该平台以模块化的方式构建,以满足各类需求:数据的生成与管理、发布、存储、数据索引以及搜索引擎服务。
网络的主节点运行 Find 模块,该模块作为中央服务器,接收并整合在各个数据仓库中发布的新数据。Find 模块提供快速的、面向化学的搜索引擎公共服务,并由巴塞罗那超级计算中心(BSC)托管。同时,BSC 也提供了首个可供公众访问的节点。其他 ioChem-BD 模块自动化了重要的数据提取过程,并将原始数值数据转化为数据库中的标注数据。它为科研人员提供了验证、丰富、发布和共享信息的工具,以及用于访问、后处理和可视化数据的工具。其用户包括全球范围内的计算化学研究团队、大学图书馆及相关服务机构,以及高性能超级计算中心。
ChemSpider http://www.chemspider.com/
ChemSpider 是由英国皇家化学学会(RSC)维护的一个免费的化学结构数据库,收录了超过 1 亿个分子结构,并且持续更新扩展。它不仅提供分子的二维、三维结构,还包含物理化学性质、光谱数据、实验文献以及与其他数据库的交叉链接。研究人员可以通过 名称、分子式、InChI、SMILES 等多种方式检索,快速找到目标分子,并下载对应的结构文件(如 .mol、.sdf 等)。ChemSpider 还支持用户提交数据,促进社区共建。 在计算化学、材料科学和药物设计中,ChemSpider 是一个高效的 分子检索与数据整合工具,特别适合在进行结构建模、数据库交叉比对和实验数据验证时使用。
ICSD http://www2.fiz-karlsruhe.de/icsd_home.html ICSD 数据库,需要账号密码。
团簇数据库 https://www-wales.ch.cam.ac.uk/CCD.html
The Cambridge Energy Landscape Database (CELDB) 是由剑桥大学开发和维护的一个开放数据库,该数据库包含了原子团簇、分子以及材料体系在势能面上的不同构型及其对应的能量信息。
AFLOW http://aflowlib.org/
AFLOW (Automatic FLOW for Materials Discovery) 是一个面向 高通量材料计算 的开放数据库和软件框架,由杜克大学 Stefano Curtarolo 课题组开发和维护。它通过自动化流程运行大量 DFT(密度泛函理论)计算,并系统性地收集材料的结构、对称性、热力学、电子、力学及输运性质等信息。
AFLOW 的主要特色包括:
- 庞大的数据库:包含数百万个化合物的计算数据,并不断更新扩展。
- 标准化计算协议:所有数据均来自统一标准下的 DFT 计算,确保可比性。
- API 接口:提供强大的 API 访问功能,方便研究者自动获取数据并与 Python、Matlab 等工具结合。
- 材料设计与筛选:支持按能带结构、态密度、热力学稳定性、晶格对称性等条件进行筛选,非常适合材料筛选与机器学习应用。
AFLOW 在 新材料发现、热电材料设计、半导体研究、磁性材料筛选 等方向中都有广泛应用,是目前国际上重要的材料数据库之一。
OQMD http://oqmd.org/
OQMD (Open Quantum Materials Database) 是由美国西北大学(Northwestern University)和阿贡国家实验室(Argonne National Laboratory)合作开发的 开放量子材料数据库。它基于 DFT(密度泛函理论) 高通量计算,旨在系统性探索并存储无机材料的性质。
OQMD 的主要特色包括:
- 大规模数据集:包含超过 100 万种材料结构,并持续扩展。
- 热力学性质:提供大量材料的形成能、稳定性、相图信息,可用于预测材料能否合成。
- 实验数据整合:与 ICSD 等实验数据库相结合,增强可靠性。
- 材料设计:支持研究人员进行 新材料发现、相图计算、合成可行性预测。
- API 与数据接口:方便程序化访问与高通量计算工作流对接。
OQMD 在 能源材料(如电池、电催化)、合金设计、无机固体新材料探索 等领域都有广泛应用,是目前国际主流的计算材料数据库之一。
Materials Cloud https://www.materialscloud.org/
Materials Cloud 的建立旨在实现计算材料科学资源的无缝共享与传播,提供教育、科研与存档工具;仿真软件与服务;以及经过整理的和原始的数据。这些内容既支撑了已发表的科研成果,也推动了基于数据的发现,并且符合数据管理计划和 FAIR 原则(可查找、可获取、可互操作、可重用)。
在 Materials Cloud 中,你可以:
- 浏览、探索、下载或存档 原始与整理后的数据(Discover、Explore、Archive 模块);
- 访问云端或可重新部署的仿真服务(如 AiiDAlab 的一键仿真、Quantum Mobile 虚拟机、AiiDA 插件和工作流注册库,以及 OSSCAR notebooks,均位于 Work 模块);
- 使用教育资源(Learn 模块),包括教材、教程和讲座。
Materials Cloud 让科研成果的共享具备以下特性:
- 全面性:不仅共享输入和输出文件,还能共享整个工作流和计算的溯源图。
- 可下载:点击按钮即可下载单个文件或整个数据库。
- 可浏览:直接在网页浏览器中查询和浏览计算结果。
- 可重用:下载并导入任何数据库,从原作者停止的地方继续计算。
Materials Cloud 由 AiiDA 提供支持。AiiDA 是一个开源的 Python 基础设施,旨在管理和持久化计算科学中不断增长的工作流和数据的数量与复杂性。
其他
如果有推荐的,i)加微信留言: BigBroSci ii)底部留言。 后面会慢慢更新,感谢。