王坚:大“语言”模型没前途,科学数据才是AI突破口
2026-07-21 15:47:05 世界浙商
让思想被听见,让价值被传递。潮新闻《声动》栏目聚焦社会各界名家大咖、领军人物的声音,为时代留声。
今天为您带来中国工程院院士、阿里云创始人、之江实验室主王坚在2026世界人工智能大会暨人工智能全球治理高级别会议主论坛上的演讲。他提出,人工智能正在迎来一次新的范式转折,而这一次推动变化的,不再只是语言数据,而是科学数据。

7月17日,在2026世界人工智能大会暨人工智能全球治理高级别会议主论坛,中国工程院院士王坚在发表演讲。图源新华社
基础模型为什么重要
在人工智能领域,大约在2021年,斯坦福的一组教授写过一篇文章,第一次明确提出了今天大家都在使用的一个概念:Foundation Model,也就是基础模型。
我们今天讲模型、讲大语言模型,但“基础模型”这个概念,是到2021年才被这样明确提出的。
它的重要性在于,它让我们意识到:数据不是简单地喂给模型的材料,而是模型能力形成的根基。
这也是我今天为什么要讲,科学数据应该被放进基础模型。今天我们说“大模型”,在中文语境里,很多时候会把“大语言模型”里的“语言”两个字省掉。
但事实上,完整地说,大语言模型是建立在文本数据上的基础模型。它的根本能力,来自人类对文本数据的长期积累和处理。但处理文本这件事情,并不是人工智能出现以后才有的。
我们作为在中文环境里读书的人都知道,中国古代的典籍,最初是没有标点符号的,甚至也没有今天意义上的空格。
中文是到一百多年以前,才逐渐开始系统使用标点符号。古拉丁文在早期也是如此,没有空格,也没有标点符号。
没有标点符号会带来什么影响?一个人如果不把这句话读出来,就很难完成阅读和理解。
所以,对文本进行处理这件事,早在人类文明史中就已经存在。用今天的观点看,在文本之间加入空格和标点,某种程度上也可以理解为一种早期的Tokenization。
今天的大语言模型,把人类对文本的处理带到了一个前所未有的高度。
Tokenization是其中非常关键的一环。
科学不应该只停留在论文文本里
再回到科学。
很多年前,我就开始和一些地球科学家讨论:我们怎样用人工智能帮助地球科学?事实上,早在十几年前,也就是人工智能还没有像今天这样流行的时候,科学家们就已经提出过三个非常朴素、但极其重要的要求。
第一,科学家需要获取所有相关的科学数据。
第二,科学家需要获取相关领域的研究文章和论文。
第三,科学家需要一个基础设施。如果换一个说法,也可以把它叫作公共设施。
今天回过头来看,人工智能其实远远没有满足第一个条件。我们今天大多数所谓“AI帮助科学研究”的工作,仍然停留在文本层面。
也就是说,我们更多是在让模型读论文、读文章,最多再看一看论文附带的代码,而不是让模型真正触碰科学数据本身。
代码是一个很好的例子。如果你学习编程,最早接触代码的时候,可能也是在一个文本编辑器里。
但为什么Coding在今天变得这么重要?因为在模型里,代码没有被简单地当成另一种普通文本。
大家可以想一想:中文和法语之间的差别,中文和英语之间的差别,可能都没有英语和代码之间的差别那么大。代码作为一种数据,恰恰展示了数据如何驱动AI的思考。
所以今天我们要问:当人工智能帮助科学研究时,它到底是在理解科学,还是只是在理解科学论文?如果只是把科学论文的文本读一读,把论文里的代码看一看,那它仍然没有碰到科学数据本身。
它理解的仍然只是人类已经写出来的科学知识,而且是被论文形式表达出来的那一部分。
你可以想象,这后面还有多大的空间。在地球科学里,70%以上的重要信息并不在文本中。比如光谱、地震波、地层、化石、岩石样本,它们都不是传统文本。
我们常说多模态模型,“一张图胜过千言万语”。但在科学里,可能一段光谱、一段地震波,就胜过千万张图。
这件事非常有意思。
什么是科学基础模型
所以,几年以前,我们定义了一个概念:科学基础模型。所谓科学基础模型,就是建立在科学数据基础上的模型,而不是建立在科学论文文本基础上的模型。
它的目标非常清楚:让科学数据成为大模型的源头。这里面当然有一个很直接的工作,就是要把科学数据做Tokenization。可是最终,我们要做的不只是把科学数据切成token。
真正的科学基础模型,是要把文本、代码以及科学数据放到同一个空间里,放进同一个模型里,让模型能够统一处理这些信息。
从这个意义上说,科学基础模型不是一个vertical model,不是一个简单的垂直模型。今天我们一讲到某个具体领域,就很自然地想到:这是不是一个垂直模型?但我今天讲的不是这样一个独立的、狭窄的技术模型。
科学基础模型应当改变我们对科学数据的整体理解。
让石头“说话”:地球科学里的例子
我很快举一个例子。这个故事还在进行当中。大家都知道,地球科学很大一部分是在研究石头。石头是不会说话的,但所有这些工作,其实都希望石头能够“说话”。
石头说话的目标也很简单:我们想知道这个世界是怎么演进的。
地球已经有几十亿年的历史。生命什么时候出现,恐龙什么时候出现,人类什么时候出现,这些问题都放在一个非常巨大的时间尺度里讨论。这里的时间精度,往往是以百万年为单位来计量的。
和地球科学家打交道以后,我逐渐明白了一件事情:人类最基本的目标之一,是能够在地球上生活得更长久一点。
但要做到这一点,我们必须更好地理解地球的长时间尺度。这很难。
所以,地球科学家和人工智能合作的一个基本目标,就是把对地质时间的认识精度,从过去常见的百万年尺度,推进到万年尺度。这是几个数量级的提升。大家都知道,在科学里,精度提升几个数量级,是非常重大的事情。
我们和南京大学、中科院南京地质古生物研究所等团队合作,做了一个地球科学模型。这个模型规模并不大,但已经做出了一些很有意思的工作。
要理解这项工作,首先要理解化石。化石里既有时间信息,也有空间信息。但化石记录有一个重要问题,古生物学里叫Signor-Lipps effect。简单来说,最后一个消失的物种,不一定会留下最后一个化石。
一个生物能不能变成化石,本身是随机的。我们找到的某个物种最后一件化石记录,并不意味着那就是它真正消失的时间。
所以,当你根据化石推断年代时,并不能简单地说:它就是在那个时间点消失的。
这种效应使得我们对时间的确定变得非常困难。这恰恰是人工智能可以帮助的地方。
今年7月1日,在一次地质学会议上,相关团队展示了一项工作:参考十万种不同生物的种类、近两万多个地层剖面的数据,用模型把这些信息真正放到一个统一的时间轴上。
这大概是目前世界上最完整、也最精确的相关时间轴之一。
大家可以想象,如果我们最终能够把百万年级别的精度推进到万年级别,我们对这个世界的理解会变得完全不一样。
我们也很高兴,这项工作近期入选了联合国“科学促进可持续发展国际十年”相关认可清单。大家可以由此看到,人工智能对基础科学的推动,已经不是一个抽象的口号。
科学基础模型也需要全球治理
当然,要完成这样一个全球性的事情,治理结构非常重要。
尽管这只是地球科学这样一个领域里的人工智能模型,但我们在将近四年多以前,就建立了一个全球治理结构的委员会。这些专家和机制,对这项工作在全球范围内产生影响,发挥了非常重要的作用。
这也说明,科学基础模型不是某一个机构、某一个实验室、某一个国家可以单独完成的事情。它需要科学共同体、数据共同体、模型共同体和治理共同体一起参与。
人工智能会像数学一样基础
最后我想说一句话。因为有了科学基础模型,人工智能到了一个非常不一样的转折点。
这个转折点就是:人工智能会变得像数学一样基础。它不再只是某一个领域里的独立工具。
大家可以想一想,数学在人类科学史上起了什么作用。未来五十年,人工智能对科学研究所起的作用,可能也会像数学一样深远。
(内容来源世界人工智能大会,有删改)
