关于AI和知识之间关系的讨论

关于AI和知识之间关系的讨论

2026年8月9日,和毕业的研究生相聚甚欢,但由于个人状态原因,当时未能进行深入讨论。经过反思,有一个关键问题仍需阐明,现将整理后的思考分享如下

各位,昨天见到你们特别高兴,不过因为一些其他原因,我当时深度讨论问题的兴致其实并不高。今天回想起来,其他都无所谓了,但有一个关键问题还是想提一下。下午花了点时间写了些废话,有点长,贴给你们。

记得A当时问过一个问题:现在有没有什么App可以推荐的?我随口说了一个Reddit,也没深聊。对于我给出的这个"答案",估计你们所有人都会下意识地理解为一款软件,但我完全不是这个意思——我想说的是,类似于Reddit这样的开放知识社区类的知识载体。

为什么这么说呢?

以往我们获取知识、拓展思维框架的过程中,来源和驱动力更多来自作品、论文、专著等这些完成度非常高的对象和传统渠道。但我们会面临两个关键问题。

第一个问题:这些内容需要被你看到(发现壁垒)。 这取决于太多偶然因素——时机、渠道、内容的完善程度(是完善程度,不是价值本身),甚至当时的学术研究和文化的风向偏好等等知识触达条件。只有这些条件都凑齐了,有价值的内容才会摆到你面前。否则,再好的东西也无法成为当下的价值,而更有可能像梵高、巴赫一样成为后世的发现。

第二个问题:即使通过传统渠道摆到了你面前,个体精力、自由支配时间和认知宽度的局限性又会进行一次筛选(吸收瓶颈)。 只要你还是个人,这个天花板就无法改变——这是生理层面的硬约束。时间精力分配与跨领域学习能力存在不可突破的上限,简而言之,“深度专业化"与"广度拓展"是本质互斥的。

那么,现在的大模型到底给我们带来了什么?

绝大多数人会下意识地把大模型看作无所不知、高高在上的知识权威(这也是我昨天为什么说,绝大多数人把大模型当成一个数据库——是同一个判断)。但事实完全不是这样。大模型在训练阶段被喂入的数据(确实是我们传统意义上的知识内容),经过embedding、reranking、向量化之后,它获取到的是知识内部无处不在的关联性,即知识关联网络。而这种关联性,恰恰是我们研究问题时所需要的那种在总结、归纳、分类、概括、演绎、类比、推理、判断等过程中所需要的,最基础、最核心的思维范式和“洞察力”。一句话总结:大模型提供的不是知识,而是逻辑推理能力。

回学校的车上我们聊起过关于B论文的事。C,你的判断和思路已经很好地走在了深入研究的道路上。这个题目肯定能写,而且能写得很好。需要的逻辑和路径其实不复杂:把作品视为所有政治、经济、文化等领域各种影响合力的终点,而不是在作品内部去寻找它自身的规律和进化路径。

为什么这么说?因为有一个逻辑我无法否认——艺术作品作为社会、政治、经济、文化等因素最终相互影响和相互作用结果的呈现末端,前面所有的原因,一定能从作品里找到证据,无论是草蛇灰线还是一目了然。做好这类研究只需要一种东西:知识的宽度

说个题外话。我自认为学习速度比较快——不仅是在我这个年龄的老登群体内,甚至和比我小一代两代的人比起来,也常常跑在前面。很多时候我和其他人(包括你们)同时切入一个新问题或新领域,我可能也会阶段性领先(当然最终可能有另外的结果,但这大概率是因为我没有耐心坚持——这种基因带来的性格很难超越)。这不是信口开河,我很严肃地在很多事情上做过阶段性对比。之所以能做到这一点,原因其实只有一个:在思维能力成熟后,我尽自己所能不断尝试在各个不同的知识领域之间横跳。你们从我的受教育经历可能也会发现这一点,所以在我看来,跨领域迁移学习显著提升可认知效率和认知深度,即:知识的宽度,是决定知识高度的唯一因素。

回到正题,我为什么提Reddit?

D论文答辩前,我被逼着又啃了一次符号学。在这个过程中,给我最大启发的不是某篇学术论文或专著——那些都不陌生——而是一篇中文博文。它推着我对电影符号学的理解和思考往前跳了一大步。结果就是我从根本上否定了她这篇论文的理论适用性和方法适用性(当然她最后也顺利通过了答辩,这个我不评价)。

E论文答辩前,类似的情况。我被逼着去深入研究布迪厄的场域、惯习和资本,这在当时我的知识结构里是缺少的一块拼图。过程中最大的收获来源同样不在论文和专著上,而来自一组Reddit上的讨论。也正是因为这个讨论的帮助,让我快速找到了论文中的一些根本性逻辑错误。

这种好事并不是常态。我能看到这些东西,是偶然而不是必然。从另一个角度看,我在生理层面完全没有能力从类似渠道常态化地挖掘这些内容。

但是,在今天的信息内容构成生态上,这些东西的价值量可能远超过常规渠道和路径中我们熟悉的内容。做个不恰当的比喻:上面提到的这两条信息或知识尚且处于刚刚萌芽的阶段,在影响力、传播范围以及从个人观点到知识共识的过程中需要走的路还很长。在没有走完我们熟悉的知识生长周期之前,这些内容永远会被淹没在信息的背景噪声中而不为人所知和不为人所见。

从我个人的感受:如果我没偶然看到它们,我的损失难以衡量。当然,另一种可能是,如果我在常规知识管道传递出来的东西上深入研究,可能也会得出类似的结论或判断——但是,效率呢?

我很害怕这种推演出来的结果。哪怕抛开功利性的目的(比如抢先一步提出更新更深入的观点、抢先一步发论文等等),即使单纯从知识学习的角度,这种FOMO(错失恐惧)的感觉实在太糟糕了——真的有种在某个"赛道"上被人抛弃的恐惧。

前面提到的大模型的逻辑能力,也许可以从根本上改变这种状况。

从90年代末开始,互联网带来的一个结果就是知识下沉——但它依然没有改变知识迭代和更新的基本模式,因为它所依托的,依然是上百年来建立起来的"学术体系”。

但现在的情况不同了。如果利用上大模型的逻辑能力,前面说的那些淹没在信息本底噪声之下、人力所不能及的内容,可以很轻易地被提取和固化,第一时间成为自己知识结构、知识高度和知识宽度中的一块砖头,最终高效率高质量地搭成完全属于自己的、类似于Minecraft里华丽的高楼大厦。那些有知识宽度习惯、因为生理极限而不得不向知识深度妥协的人,或者有知识深度习惯、同样因为生理极限而不得不向知识宽度妥协的人,都会借力于大模型,完美地补上自己的短板。

这半年AI给我的感受,就像昨天和你们开玩笑说的那样:我自己感觉"接不住"了。这种接不住并不是内容层面上蹦出来的"大词",而是数量层面的。它的逻辑能力和输出的质量对我的诱惑,让我在时间的占用至少超过了以往的10倍而欲罢不能。换句话说,如果我可以不顾及基本的吃饭睡觉和工作上的牵扯,它可以完全勾引和占用我的所有时间——而且我依然觉得远没到它能输出的上限。

那上限在哪呢?我个人的判断是:目前还没有看到Scaling Law钝化的迹象。如果真到了那一天——我随口说个结论吧——假如把大模型将来的逻辑能力看成地球那么大,在这个坐标里,一个完美无缺的理想人的生理极限可能连地球上的一粒尘埃都算不上。

我很认同一个观点:大模型会加剧人的分层。会用的人和不会用的人,用API去有针对性地实现自己目的的人和只在聊天框里问问豆包、ChatGPT的人,会成为将来社会里两种不同的物种。利用好大模型逻辑能力的人,就像开着联合收割机,一上午几百亩地收割完毕,而另一群人还弓着背弯着腰、汗流浃背拿镰刀守着三分地劳碌不停。想想这种降维场景,既让人激动万分,又让人脊背发凉。

又回到话题的起点上——推荐什么软件?

一年前有过一个观点:模型即软件,所有软件都会消失,模型会替代一切。我当时对这个判断是存疑的。原因很简单:模型提供的是超越人生理极限的逻辑能力,但它并不会成为"知识库+逻辑能力"的结合体——这违背了大模型训练的基本架构。无论是Transformer还是后来引入的Mamba,以及尚未成为主流,前景不明的RWKV、BASED、xLSTM等,都不支持上述结论。

但今年上半年提出的另一个概念——Agent即软件——虽然是从商业逻辑出发的结论,但我认为它指对了未来的方向。在模型的能力和人的需求之间,用Agent去建立一个"执行"的中间层,这种架构符合我对AI模式的所有美好想象。

所以,现在有什么传统意义上的软件/App可以推荐?我的答案是:没有

但是,我建议你们开始借助大模型去了解和初步运用Agent。

需要做的,并不是去某个平台上找一个别人已经做好的Agent拿来就用——譬如腾讯平台上的Workbuddy之类。那样的话,本质上依然是在使用"传统软件",因为它的内部过程是“黑盒化”的,对理解新的方法和路径没有太大的帮助。

我建议你们做的是:

  1. 购买并订阅一些模型的API——例如Anthropic、ChatGPT,或者开源的DeepSeek、智谱、千问等。如果一开始处在纯粹熟悉阶段,可以去一些聚合平台购买API,方便在不同模型之间切换;

  2. 尝试使用一些基础的开放性前端工具——例如Open WebUI、Lobe-Hub,或者更纯粹的Agent(如著名的Open-Claw、Hermes等),甚至于真正的开放性框架如 LangChain、LlamaIndex、AutoGen等。在这些工具和框架里尝试进行本地知识库的搭建,以及在联网状态下对海量信息进行知识提取和加工。

自己做出来的东西,负责任地说,肯定远远不如将来由专业软件维护团队做出的产品质量高、体验好。但是,亲自去熟悉这个过程的价值和意义在于:你可以非常深入地了解自己的需求,看到各种不同想法和思路落地的方向和路径,感知到自己个性化需求的甜点和痛点……所有这些,都会成为将来选择更好的Agent(或者抽象一点说,叫"模型与需求的中间层")的针对性判断,以及对你所选工具进行个性化调优、提高准确性和效率的重要依据。

啰嗦了一大堆,今天就到这里吧。希望明年有机会能再坐在一起好好聊聊——一年可以发生很多事情的。

本文由作者按照 CC BY 4.0 进行授权