神珍模型:AI 科学范式的隐秘转折点
就像当年互联网从文本走向多媒体,AI 科学模型正在经历一场从单模态到多模态的静默革命。7月20日,上海科学智能研究院开放的科学多模态基础模型“神珍”,这个看似技术参数的新闻背后,藏着一条值得行业深思的线索。
这条新闻值得关注的原因,不在于它有多少亿参数,而在于它一次打包了六类科学数据:DNA、RNA、蛋白质、小分子、地球系统和医学影像。这不是简单的模型规模扩张,而是对科学发现范式的釜底抽薪。
行业趋势来看,过去两年,AI 在单一科学领域的突破已经很多。AlphaFold 解决了蛋白质折叠,RNA 预测模型也层出不穷。但真正的科学发现从来不是孤立的。一个药物研发链条,需要同时理解蛋白质结构、小分子相互作用、医学影像数据,甚至患者的基因组信息。过去,这些数据各自被不同的模型处理,信息在传递中丢失,效率极低。
神珍的逻辑是,在一个统一框架下,让这些不同维度的科学信息彼此对话。就像人类科学家需要跨学科协作,AI 模型也需要跨模态理解。模型总参数约 110 亿,这个量级在通用大模型里不算大,但针对科学数据的精准性可能更高。本质上,这是把科学知识图谱架在了多模态对齐的底座上。
[!quote] 一位长期关注科学 AI 的从业者告诉我,真正有价值的不在模型本身,而在于训练数据的质量和多模态对齐方式。如果神珍能有效打通这些数据壁垒,它可能打破当前科学 AI 各自为战的局面。
当然,这不是神珍一家的独角戏。谷歌 DeepMind 在尝试多模态科学模型,国内的 BioMap 等在蛋白质-小分子联合建模上也有积累。但神珍的一个独特之处在于,它覆盖了地球系统数据,把天气、气候这类宏观系统纳入统一框架。这暗示着上智院的目标不只是药物研发,而是更宏大的科学发现,比如疾病与环境的关系、蛋白质与地球系统的相互作用。
某种意义上,这像一个科学界的“操作系统”。过去,每个科学领域有自己的专业软件和模型,现在,神珍试图提供一个统一的底层接口,让不同领域的科学家用同一种语言提问。这种统一的代价是,单个领域的表现可能不如专业模型,但长期来看,跨领域的碰撞可能产生更有价值的发现。
结尾给出一个明确的趋势预测:未来三年内,AI 科学模型的竞争将从“单一领域精度竞赛”转向“多模态跨域能力竞赛”。单一指标的刷新会越来越不值钱,谁能打通 DNA、蛋白质、小分子、地球系统之间的数据暗河,谁就能在 AI 驱动的科学发现中占据先机。神珍可能是这个转折点的第一声号角。
物界前沿