人工智能正在科研规模的利用正迈背一个新的转合点。6月18日,阿里 ATH-Token Foundry 分离中国人民年夜教高瓴人工智能教院正式公布公布,开源了一款名为 LOGOS 的多规模科教生成根底模子。那款模子的降生,标识表记标帜着科教界末于具有了一套能够通用的“科教语法”。

经久以来,差异科教分收之间存正在着深不见底的“语止鸿沟”。卵白量、小分子以及复纯质料,正在AI眼中常常是机关悬殊、难以兼容的数据孤岛。为了让那些科教工具能够“对话”,过去的研讨常常需求依赖复纯的3D坐标或专门设念的几何神经汇集,不但计较本钱高昂,且模子通用性极差,换一个研讨环节就得重起炉灶。


LOGOS 的中心立同正在于突破了那种壁垒。它设念了一套共享词表,将卵白量、抗体、小分子及 MOF 质料等同构工具,经由过程统一的离散 Token 序列截至编码。那意味着,模子不再依赖高贵的3D空间疑息,而是经由过程相似“读文字”的序列预测格式,间接构建出复纯的3D空间互做纪律。那种“科教语法”的建立,让差异窗科的数据正在底层实现了知识共享。
正在参数效率上,LOGOS 展示出了惊人的暗示。LOGOS-1B 版本仅用1/56的参数量,就正在多项代表性科教使射中实现了对微软 NatureLM 的逾越。别的,LOGOS 完整处理了预锻炼取下流任务之间的“目的误差”成绩,使得模子无需繁琐的微调适配,即可间接激活生成才气,年夜幅降低了科研人员的开发门槛。
今朝,LOGOS 已构建起搜罗7类模态、总计44.87B tokens 的超年夜规模预锻炼语料库。项目组已将相关模子权重、推理代码及详尽的手艺述说全面开源,开发者可经由过程 HuggingFace 或 GitHub 访谒获取。
那一突破性功效不但为科研主动化供给了强力引擎,也为将来多模态科教年夜模子的开发树立了全新的手艺范式。跟着 LOGOS 的开源,科教界的“语止”或许将变得史无前例的统一取高效。