一个模型能不能同时读懂蛋白质的折叠、台风的走向,还有CT片上的病灶?上海科学智能研究院直接把答案开源了出来——名为“神珍”的多模态基础模型,总参数约110亿,一口吞下DNA、RNA、蛋白质、小分子、地球系统与医学影像六类异构数据。它不搞花哨的垂直堆砌,而是用一套权重打通生命科学与地球科学,对交叉学科的研究者来说,这意味着终于可以扔掉在多个专用模型间反复切换的手册。
卷性能数据从来不是靠嗓门大。“神珍”在生物序列相关的20项任务中摘下9项最优,拉出来比一比就知道这不是虚晃一枪。更狠的是医学影像分割,平均Dice得分冲到91.20,直接在7种参评方法里拿下第一。没有藏着掖着,模型权重和完整代码同步上架星河启智、Hugging Face和GitHub,训练细节、推理脚本全部摊在桌面上。这种全开放的做法,把以往需要几套工具才能拼凑的实验变成了开箱即用。
科学计算圈苦“模型孤岛”久矣。过去做蛋白设计要调一个模型,看遥感影像要切另一个,想跨模态整合还得自己写胶水代码。“神珍”这种一盘棋式的设计,让单一模型同时处理多尺度、多模态科学数据成为日常操作。它不是替代最强的专用模型,而是把准度、泛化与上手成本重新摆了一遍——尤其对产品和技术选型的人,这份免切换、免对齐的开源工具包,比任何评测报告都更值得上线跑一遍。

