AI为什么能够回答我们的提问

今天谈一个基本问题:AI 为什么能够回答我们的提问,它怎么会知道答案?

你可以找到很多这方面的论文和书籍,详细解释大模型的运作,通常非常难懂。但是,对于非专业人士,只要简单知道 AI 的三个机制[9],就可以了。

(1)参数机制

在宏观层面,所有大模型都是对人类知识的建模。它建立了一个数学模型,用来描述所有的人类知识。

怎么描述呢?它使用的是一种参数机制,将知识分解成一个个“词元”(token),然后计算所有词元之间的数学关系。这个过程称为“训练”。

这种数学关系使用无数个参数来表示。举例来说,大模型 GLM 5.3 有7440亿个参数,这些参数用来构建所有词元之间的关系(也就是权重)。所谓“训练”,其实就是找出这个7440亿个权重,描述人类知识的构成,也就是所有词元之间的关联。

一旦训练完成,我们向大模型提问时,它就会根据这些权重,找出最可能的词元,从而生成符合概率的答案。

所以,大模型本质上是一种“压缩-生成”机制,将人类知识抽象在无数参数之中,后期再生成出来。

(2)推理机制

不难理解,参数越多,模型的效果越好。因为更多的参数意味着,可以更精确地描述各种知识,从而可以更准确地将其还原出来。

但是,一方面,参数不可能无限增加,训练和使用成本将直线上升,使用时的运算时间也会变长。

另一方面,也没有必要包含所有的知识,很多知识不需要包含在参数之中,完全可以通过逻辑推理获得

举例来说,只需要知道某个城市的人口出生率和死亡率,就马上知道了人口的净增长率。这不需要记忆,可以通过推理得到。

大模型就依靠推理机制,根据参数包含的知识,从逻辑规则出发,推断出那些它没有包含的知识。

(3)联网机制

不管模型有再多的参数、再强的推理,它不可能包含所有的知识,总有一些问题它回答不了。

比如,你问大模型,今天股票的收盘指数是多少,它就回答不了。参数里面不包含这个知识,也无法推理得到。

这时,模型就要依靠 Agent 或应用框架提供的联网机制,自动去互联网搜索那些它不知道的知识。

(4)总结

正是有了以上三种机制,AI 才能正确回答我们的问题。

首先,参数机制提供了大模型的基本知识;其次,推理机制产生通过推理得到的知识;最后,联网机制用来获取前两种机制都无法得到的知识。

扩展

  1. AI的三个机制
  2. 大模型需要多少内存
  3. AI 缓存是什么