← 返回文章索引
个人随笔2,6167 分钟

Mr. Y · 百更计划 · 第 103

维特根斯坦晚期认为,语言的意义来自“使用”。

你们让我去看奥德赛, 可看这种电影对我来说是一个工程问题, 而我最近的睡眠都交给了另外一个大工程。

你们让我去看奥德赛,
可看这种电影对我来说是一个工程问题,
而我最近的睡眠都交给了另外一个大工程。

在跟200美金的gpt侃了几天大山之后,
我陷入了对语言、理解世界和大语言模型的遐想。

从“我的语言的界限就是我的世界的界限”
到“想象一种语言,就意味着想象一种生活形式。”
维特根斯坦认为语言的意义来自“使用”。
一个词是什么意思,
并不主要取决于词典里的定义,
而取决于它在人类生活中怎样被使用。

比如说,“疼”。
你摔倒了,身边的人会问你“哪儿疼”;
恋爱中的人会说“你让我的心很疼”。
我们之所以能够理解“疼”,
并非因为我们的脑袋里都有一条关于疼的准确定义,
而是因为我们共同生活在一个知道什么叫受伤的世界里。

于是问题来了。
大语言模型恰恰是历史上第一个
把人类的巨量的语言学习到极致的非人类系统。
它没过过我们的生活,
却读过我们的生活留下来的语言。

如果维特根斯坦是对的,
意义存在于语言的使用之中,
一个极其擅长使用语言的AI,
是否已经拥有某种真正的“理解”?

还有,如果说今天的AI还缺少什么,
缺的究竟是什么?

是身体?
是经历还是意识?
抑或是欲望?
还是我们只是因为它不是人,
所以要不断的把“真正理解”的门槛调的更高?

我觉得,人类也许一直以为
语言只是我们表达思想的工具。
但大语言模型带来了
另一个令人不安但很有趣的可能。
语言本身,会不会已经包含了远比我们想象中更多的智能?

如果这一点成立,
那么AI最重要的突破未必是“机器学会了人类语言”,
而可能是我们第一次发现:
人类文明把大量关于世界、社会和思维的结构,
都沉淀在语言里了。

-

我有一个问题,
语言本身是否可能蕴含着一种比我们过去认为的更强大的智能结构,
而LLM可能由此开启新的智能范式。

想象一个从出生开始从来没有真正见过巴黎的人。
但他读过几百万个人关于巴黎的文字,
地图、日记、小说、菜谱,
历史资料、城市规划、天气、交通规则等等等等。

他可能没有“亲自到过巴黎”。
但我们很难说,他关于巴黎一无所知。

而且当资料足够多的时候,
一个奇怪的事情发生了。
不同人的经验会互相校正。

有人说巴黎很浪漫,
有人说巴黎很脏;
城市地图会告诉你街道的结构;
气象记录能告诉你季节的变化;
经济数据可以告诉你生活成本;
而小说会告诉你当地人带着怎样的情感和情绪。

当他们叠在一起,
语言开始形成一种世界的压缩模型。
LLM做的事情,
可以粗略理解为把整个文明留下来的这种“压缩”吸收进去。

所以一个模型即使没有摸过苹果,
它仍然知道苹果可以吃,
苹果从书上掉下来会落向地面,
人们切开它以后会氧化,
“苹果”还可能指一家公司。

它并没有逐条背这些知识。
这些关系形成了一个庞大的网络。
这非常接近晚期维特根斯坦的一些直觉:

词的意义来自它和其他行动、情境、词语之间的关系。

于是,既然一个人正确理解一个词的证据,
本来就是“他知道在什么场合怎么使用它”,
那么当AI已经能够在成千上万种陌生情境里正确使用一个词时,
我们凭什么坚持说:“它完全不理解”?

如果一个外国人学习中文十年,
能够听懂反讽能开玩笑,
能写小说、还可以讨论哲学,
我们通常会说他懂中文。

可当AI表现出类似能力时,我们忽然要求,
“你必须先证明自己知道这有真正的意义。”

这可能存在一种隐藏的人类中心主义。
更进一步说,大模型甚至暴露了
一个过去我们没意识到的事实,

语言可能远比我们以为的要“厚实”。

语言并非薄薄的一层符号。
几千年来,人类把因果关系、
社会规则、情感经验和道德判断
这些全部写进了语言。

所以模型只学习语言,
却意外学到大量的世界结构,
这并不那么神秘。
可以说它学到的是人类经验长期沉淀形成的化石。

如果继续增加视觉、声音、
机器人身体和现实的反馈,
或者任何传感器让它可以看到紫外线,
可以感受到地球的磁场(鸽子)或者发出接受超声波(蝙蝠),
这些都是很多动物可以做到的,
那么AI获得的世界模型可能越来越完整。

最终,它可能形成一种与人类不同的智能。
虽然路径不同,最后都可能形成对世界有效的理解。
如果这样,那么LLM很可能真的是一个新范式的开端。

-

可另一方面,维特根斯坦说“意义在使用中”,
有一个特别容易被忽略的词:
“使用“。

使用语言并不等于排列语言。
一个人说:
“我答应你明天来。”
这句话的意义并不只存在于词语之间。
明天他没有来,你会失望。
你可以责怪他。
他可能内疚。
你们之间的关系可能因此发生变化。

于是“承诺”的意义存在于一个真实的人类生活的结构里。
AI可以很好的解释“承诺”。
但它本身不会因为失约失去朋友,
也不会因为撒谎失去信誉,
更不会因为伤害了某个人而睡不着觉。

这也许是LLM缺失的东西,

语言背后的生命处境。

AI可以写一篇极其精彩的文章解释死亡,
甚至比绝大多数人写得好。
可它并不用去面对,
“有一天我会不存在。”

对于人而言,
“死亡”这个词和自己的身体连接在一起。
于是“死亡”对人的意义中有一种东西,
可能永远无法从文本统计中获得,

利害关系,skin in the game!

LLM获得的是关于经验的地图。
地图可以越来越精确,
但地图依然没有变成土地。

这是一种非常维特根斯坦式的反驳,
因为“语言游戏”始终嵌在“生活形式”里。
语言并不是悬浮在世界之外的符号游戏。
它发生在我们所有的生命进程里,
出生、疾病、工作、爱情、疼痛、衰老、死亡。

AI可以模拟所有关于火的知识,
却从未被火烧过。
可以理解一百万句关于爱情的话,
却从未承担失去某个人的可能。
于是它掌握的是语言结构中的意义,
但不会拥有存在意义上的理解。

这两者可以非常接近,
却可能永远不是同一件事情。

-

AI到底懂不懂语言?
“理解”究竟需要什么条件?

有时候我会觉得真正的理解还需要一个主体。
它需要经历世界、有自己的需求,
能够面对风险和承担行动的后果,
甚至可能还需要主观体验。

我们现在已经不需要再问AI聪不聪明?
真正的分水岭是智能
需不需要一个“活在世界里的主体”?
而最有可能改变结论的关键,
我觉得也越发清晰了,
假如未来AI获得了一个持续存在的身份,
长期的记忆,
一个身体或者很多的传感器,
并且可以自主行动,
也会因为错误付出真实代价,
会有目标,会被追责,
那么我们今天用来区分“语言模拟”和
“真正理解”的很多标准都要被重新定义。

到了那里,维特根斯坦会变得比今天更重要。
“它里面到底有没有一个叫理解的东西?”
已经不重要了,
重要的是它究竟参与了怎样的生活。

其实我真正想弄清楚的是,
AI有没有可能“真正理解人类”,
在不懈的跑题之后变成了
一个没有人类生命经验的存在,
有没有可能发展出一种与人类不同,
但又同样可以称为“理解”的智能?

Mr. Y / 百更计划写下来,才算真正想过。