上海交通大学团队建立全球最大蛋白质序列数据集第1页-IT在线_ITOL.com.cn

上海交通大学团队建立全球最大蛋白质序列数据集

2025-03-24 10:33:54 | 中国新闻网 | 许婧郑莹莹

上海交通大学洪亮教授团队22日发布其最新成果：建立了全球最大的蛋白质序列数据集，并利用其训练了Venus(启明星)系列模型。

肉、蛋、奶，这些食物中含有丰富的蛋白质，可以提供人类身体所需营养。但天然的蛋白质难以发挥这些功能，科研人员需要对天然蛋白质的功能进行设计和改造，才能使它成为满足应用需求的产品。长期以来，蛋白质设计改造一直面临时间长、成本高等难题。

据介绍，洪亮团队建立了全球最大的蛋白质序列数据集，包含36.2亿条陆地微生物蛋白质序列、26.4亿条海洋微生物蛋白质序列、24.3亿条抗体蛋白质序列，以及0.6亿条病毒蛋白质序列。

研究团队表示，基于该数据集训练的模型，可以把蛋白质生产从“缓慢的试错”变为“高效率的精准设计”。

研究团队基于该数据集训练了Venus系列模型，该系列模型有“AI定向进化”与“AI挖酶”两大核心功能。

“AI定向进化”指 Venus系列模型可以对一个不尽如人意的蛋白质产品的多种性能进行优化。

“AI挖酶”则指 Venus系列模型基于该数据集可精准找到具备超常规功能的蛋白质，比如极度耐热、耐酸、耐碱、耐胃肠消化的蛋白质等。而这些超常规功能的蛋白质在生物技术、医药研发和工业生产中具有可观的应用潜力。中新社上海3月22日电 (记者许婧郑莹莹)

本文共1页