译文 ·

学习内驱力的最优性

就像种植一样,我们只能播种思想的种子,播种目标的种子,而无法强行给大脑设定一个外在的目标,然后期望大脑通过理性控制自动达成这个目标。

学习中的目标问题

全世界的教育工作者都在尝试为普通智力水平的孩子设计最佳的学习课程。在这个过程中,成年人想要运用人类积累的所有知识和经验,为孩子们制定最好的学习目标。

但这种做法存在一个根本问题:人脑中的知识体系是通过一个叫做”概念化”的自然过程逐步建立起来的。这个概念化过程受到三个因素的影响:个人的各种需求、与周围环境(特别是知识环境)的互动,以及个人的目标。

虽然我们可以向孩子解释某些学习目标,希望他们朝着这个方向努力,但是孩子最终真正重视的目标,往往取决于他们大脑自然的概念化过程会朝哪个方向发展。

就像种植一样,我们只能播种思想的种子,播种目标的种子,而无法强行给大脑设定一个外在的目标,然后期望大脑通过理性控制自动达成这个目标。如果一个目标没有在孩子的知识价值体系中扎根,就不可能真正激发他们内在的学习动力去追求这个目标。

在自由学习中,想要从外部为发展中的孩子大脑设定学习目标几乎是不可能的。

自由探索的重要性

孩子大脑的概念化过程是一种自然涌现的现象,就像植物的生长一样,它只能通过环境条件和内在需求来引导,而不能被强制控制。打个比方,我们可以在孩子的房间里放满各种书籍,但我们无法强迫孩子一定要去读这些书。

任何外在的控制手段都不能干扰这个过程的核心——也就是孩子内在的学习驱动力。如果强行干扰这种内在驱动力,就会在孩子的大脑中造成冲突,抑制他们天然的学习欲望,最终让整个学习过程偏离正轨。

通过奖励和惩罚来干预孩子的需求,也可能让概念化过程发生扭曲。举个极端的例子,如果我们用美食做诱饵引导孩子学习,让他们长期处于饥饿状态,他们确实会产生强烈的动机,但这种动机会把大脑的注意力引向满足身体营养需求,而不是学习。这种激励方式并不利于培养高水平的智力能力。

在极端情况下,我们确实可以在孩子5岁之前就把他们训练成一个”完美的斯巴达战士”。但是,一个专注于战斗技能的大脑,在后来面对抽象思维和复杂知识时,就很难再有突破性的发展了。

当孩子的基本生活需求得到满足后,获取知识就会自然而然地成为他们的主要动力。让孩子自由地接触世界上各种各样的知识,可能是帮助他们高效建立知识体系最公正、最有效的方式。

从旁观者的角度来看,成年人可以适当地”设置一些诱饵”来激发孩子的探索兴趣。这些”诱饵”可能是给未来科学家准备的显微镜,也可能是给未来体育明星准备的棒球棒。如果运气好的话,这些诱饵确实可能会影响孩子的发展轨迹。但是,关键在于所有的探索都必须是自由的,只有这样才能达到最佳效果。

自由探索是高效建立知识体系的必要条件。虽然可以通过一些幸运的引导偶尔调整探索的方向,但绝不能强制。

强制干预的危害

成年人每次试图为孩子确定”最佳”教育目标时,往往忽略了一个重要事实:孩子的学习过程实际上是基于对每一个具体知识点的价值判断,进行逐步优化的过程。

那些看起来很高大上的教育目标,很可能因为预先设计的学习路径中包含了太难或太简单的学习步骤而轻易失败。每一次不够理想的学习选择,都会拖慢整个学习进程,让孩子天然的学习动力被逐渐排挤掉。更糟糕的是,如果一直强迫孩子在过于困难的学习台阶上反复跌撞,必然会让他们产生痛苦的学习记忆,从而对学习本身产生厌恶情绪。

在学习过程中进行强制性干预,必然会抑制孩子内在的学习驱动力,阻碍他们进一步的自主探索。

学习如同登山探险

孩子的学习驱动力是怎样工作的呢?它会通过比较周围环境中不同知识的价值来做出选择。通过评估各种知识片段的价值,以及不同信息来源的学习效率,大脑会形成一套选择标准,从环境中高效地挑选出最有价值的知识进行学习。

这个过程可能会导致”局部最优”的情况——就像登山时可能会被困在一个小山头上,以为已经到达了最高峰。在数学优化算法中,通常需要一些随机的”扰动”来帮助跳出这种局部最优。同样地,孩子的学习驱动力也会带有一些随机性和创造性,这使得学习的过程充满了不确定性和惊喜。这种随机性的累积效应很有趣:即使是两个完全相同的大脑,在完全相同的环境中,最终也会产生截然不同的学习结果。

在一群孩子中,每个人都会找到属于自己的最佳发展位置。这会让整个群体的技能分布达到一种和谐的平衡——有人擅长数学,有人精通艺术,有人热爱运动。成人在这个过程中的作用应该仅限于:用令人信服的方式为孩子们描绘远大的愿景,对那些可能陷入不太有趣的局部最优的孩子提供非强制性的帮助。

孩子的学习驱动力在探索过程中的引导作用,就像数学优化中的”爬山算法”一样,总是朝着价值更高的方向前进。

为什么学习驱动力是最佳指导

在建立高效知识体系的过程中,新学到的知识必须能够与之前掌握的知识相互配合——就像拼图一样,每一块都要找到合适的位置。这意味着外人根本不可能提前预测哪些知识片段会形成这样的匹配。

有经验的辅导老师在识别合适的知识片段方面确实可能相当有效,但是,整个学习过程必须在孩子自身学习驱动力的监督下进行。举个例子,一个辅导员可能很擅长解释某个数学问题的复杂性,但孩子的学习驱动力可能会要求转向另一种学习形式或学科领域(比如因为在某个特定领域已经感到疲劳了)。

孩子的学习驱动力具有比较不同知识价值的能力,它使用自己的知识价值评估系统来做判断。它还能够评估各种信息渠道的学习价值和效率。有了这些能力,学习驱动力就像嗅觉一样,能够敏锐地察觉环境中各种信息的价值。

正是因为学习驱动力依赖于个人已有的知识基础,并且拥有独特的知识价值评估体系,所以它是不可替代的。因此,它能够在学习过程中提供最佳的指导。

学习驱动力的引导是最优的——从学习的角度来说,孩子总是对的

需要澄清的重要限制

说学习驱动力是”最优的”,这个表述很容易被误解。学习驱动力确实是一个有效的控制系统,它能够监督孩子选择哪些知识片段以及从哪些信息渠道学习。但这并不意味着孩子可以完全依赖学习驱动力而忽略其他因素。

学习驱动力需要与其他各种内在驱动力竞争,比如对食物、安全、社交的需求等。从这个意义上说,纯粹的学习选择可能是不够理想的,特别是当某些基本需求长期得不到满足时,被压抑的需求会变得特别强烈,从而干扰正常的学习过程。

此外,即使学习驱动力能够最优地选择知识和信息渠道,也不能保证所获得的知识本身是最优的。在极端情况下,孩子可能会学到错误的知识,这甚至可能带来危险。学习驱动力的”最优”仅仅限于学习过程中的选择,而不是其他方面。

总之,学习驱动力的最优并不意味着决策的最优,更不意味着行为的最优,更不意味着最终结果的最优。

群体最优的智慧

在学习驱动力的指导下,每个孩子知识体系的形成过程,可以比作生物进化中不同物种的出现。这种最优标准确保了每个人都能找到属于自己的最佳发展轨迹,从而形成一个多样化、平衡的知识生态系统。就像自然界中没有”最优”的物种一样,人类的知识也没有单一的”最优”模式。

正如学者Georgios Zonnios所说:

“生物进化天然地朝着不同组成部分之间高度相互依存的状态发展。对于知识而言,这意味着每个学习者都会学习与自己的背景和兴趣相关的内容。对于整个社会而言,这意味着知识的各个方面将被不同的人以不同的方式掌握和发展。在机会多、资源充足的地方,这种分化可能会很快发生。例如,当某个特定领域严重缺乏人才时,自然会有更多的个人被吸引到该领域,社会也可能会增加该领域的激励措施。”

传统的课程设计者试图扮演”上帝”的角色,想要设计出一个完美的”单一物种”——也就是一套标准化的课程,希望能够最佳地利用所有教育资源。这是一种徒劳的努力,反而破坏了教育的崇高目标。打个比方,这就像把大学阶段才进行的专业分化,推迟到”恐龙时代”才开始一样荒谬。

一个简单而生动的登山比喻

这里有一个简单的登山比喻,可以很好地说明学习驱动力相比直接教学的优越性。

在登山过程中,成年人可能能够看到远处的山顶(学习目标),但孩子却能够看清脚下的路径(通过内在的学习驱动力)。成年人总是试图直接、确定地朝着眼前看到的高峰前进。而孩子却可能通过自己的探索攀登到全新的高度(也就是做出新的发现)。

孩子用”视线”选择路径,这保证了个人攀登的局部最优性,也保证了整个登山群体的全局最优性。这样,每个人的攀登之路不需要追求全局最优,也不需要确定性,反而能达到更好的整体效果。

知识结构的个体差异

自由学习的强大力量来源于一个重要事实:同样的抽象知识可以通过不同的知识网络结构来表示,而这些不同的结构在价值评估、稳定性、可提取性等方面都不相同。

不同的知识网络结构可能对相同的信息产生不同的理解。它们可能会对同一个问题提出不同的解决方案。最重要的是,面对相同的证据,它们可能会倾向于选择不同的理论模型。

即使两个人的知识网络基本结构相同,最终结果也会因为连接方式的细微差别和一定程度的创造性随机性而有所不同。思维过程的结果会反馈到知识网络中,导致进一步的个性化发展。即使环境输入和大脑状态完全相同,这种个性化分化也是不可避免的。

举个例子,一位从人工神经网络领域转向研究大脑的科学家,可能会对大脑的工作方式产生”连接主义”的理解。而我是通过研究长期记忆的双组分模型进入同样的研究领域,所以我立刻倾向于支持”祖母细胞理论”。这个理论又支持了我对大脑概念化过程的看法,进而支持了教育中应该重视个体差异的观点,这些观点环环相扣,最终让我狂热地支持自由学习。

如果存在一本完美的《大脑学》教科书,就不会有不同的学派之争,也就只会有教科书中定义的”标准”学校模式了。

正是由于这些知识结构上的差异,学习的顺序决定了知识的层次和最终架构。传统学校追求同质化学习,目标是让所有学生形成相同的思维模式和知识架构。但现实中,由于每个人的知识网络结构都会自然分化,这种标准化教育注定会失败。与其在这种分化过程中逆流而上,不如让每个学生为每一个抽象概念建立属于自己的理解框架。这正是人类创新的关键所在。

即使环境输入、大脑状态和知识网络结构在起点上完全相同,概念化过程也总是会分化的。

关于电子游戏的讨论

对学习驱动力优化理论最常见的质疑是:如果让孩子们自由选择,他们会不会整天玩电子游戏而不学习呢?

家长们的担心确实有道理,孩子们在刚获得自由的初期确实可能会疯狂地玩游戏。但这种狂欢状态会因为游戏奖励的逐渐消耗而自然缓解,孩子们会开始重新评估其他活动的价值:比如交朋友、运动、看YouTube视频、社交媒体等等。

实际上,传统学校教育是造成这种游戏狂欢现象的主要原因。年幼的孩子可能从小就接触父亲的游戏机,但正是在学业压力下,他们才真正开始沉迷游戏。在某些情况下,还有一个加重因素:父母前后不一致的管理方式——时而禁止、时而允许使用电子设备,这种不规律的”可变奖励”可能会真正演变成成瘾行为。当孩子最终获得完全自由时,可能需要相当长的时间才能从这种成瘾状态中恢复。

即使是简单而一致的游戏时间限制,如果相对于孩子的实际需求来说过于严格,也可能适得其反。如果不让孩子充分体验游戏,得不到满足,游戏的奖励价值反而会因为”饥饿效应”而增加。这就像我们只被允许满足80%的渴求一样——这会导致对水的敏感性增强,对其他活动的兴趣相对降低,即使这些其他活动是可以自由参与的。下次感到渴求时,我们可能会更早、更迫切地寻求满足。通过设置过于狭窄的时间限制,即使持续限制,也可能会增加对游戏的渴望。

这样的干预会破坏学习驱动力的优化效果,就像一个外来的害虫物种会破坏原本完美和谐的生态系统一样。即使是对大脑奖励系统进行看似合理的小干预,也可能会压过学习驱动力的自然奖励机制,破坏其优化效果。

关于局部最优的担忧

在优化过程中,确实存在一些”诱人的死胡同”,可能会将孩子引向电子游戏的”歧途”。理论上,似乎可以设计出一个学习环境,让人在某个虚拟现实的”局部高峰”上停滞不前。但考虑到网络上可以获得的无限多样的探索机会,这样的设计实际上是不太可能成功的。不过,从理论角度来说,这确实是一个有趣的问题。

如果真的有人在虚拟现实中发现了一个”虚假的顶峰”,那么强制学习恰恰是社会应该避免的错误做法,因为它可能会让这种虚假的发现永远延续下去。学习驱动力本身带有一定的随机性,它的最优性必须从群体的角度来看待。

学习驱动力的”优化”是指它是比较知识价值和信息渠道效率的最佳工具。但这并不意味着学习驱动力可以不受其他奖励机制(如赌博、酒精、性等)的竞争。和谐发展的关键在于自由。正是由于对自由的限制导致了奖励剥夺,才可能引发成瘾(包括游戏成瘾)。

如果说学习驱动力可能让人陷入”局部最小值”,那么探索的自由就是跳出这种局部陷阱的最好机会,至少从群体的角度来说是这样的。

一个讽刺的控制理论故事

学习驱动力概念及其在教育中的应用有一个非常讽刺的故事。在我22年的求学生涯中,最后一次遭受强制教育是在理工大学与普查尔卡教授的冲突。1986年,我终于可以自由地按照自己的意愿学习了。解决了兵役问题后,我有了自由退出大学的选择。但是,我选择了一条特殊的道路:使用所谓的”个人学习计划”来攻读计算机科学硕士学位。我可以从课程清单中自由添加和删除科目。

但有一个条件。我的新学习计划必须得到学院的批准,普查尔卡教授同意批准,但有一个要求:他自己的控制理论课程必须保留在清单上,这仍然是必修课(如果我想获得学位的话)。

普查尔卡教授说:“控制理论就是一切。任何工程师都不可能在不了解这门学科的情况下毕业。“他说得对:控制理论确实支配着科学的许多分支,没有它,我们就会到处选择错误的策略。但普查尔卡教授也错得很离谱——恰恰是控制理论应该告诉他,你无法控制学生的学习驱动力。

从控制理论的角度来看,(1)拥有学习驱动力的大脑与(2)环境之间的相互作用,正是一个持续运行的动态系统的完美例子——这恰恰就是普查尔卡教授要我研究的那类系统。

稳定而有效的控制建立在自由选择的基础上。学习驱动力引导系统实际上就是学习过程中的最优控制器。学习驱动力使用个人的知识价值评估体系作为”传感器”,来过滤接收到的各种输入信息。这些过滤后的信号会进入一个”信号比较器”。被控制的过程变量是环境中各种可用信息渠道的学习效率。这个效率会与基于输入价值评估得出的学习动力期望值进行比较。当信号值降到某个水平以下时,学习驱动力系统就会启动寻找新知识来源的过程。

只有学习驱动力系统能够使输入信号的学习效率最大化。而老师的介入会在系统中引入控制误差,学习者的反应就是控制器对这种误差的响应。自由是高效学习的必要条件——包括跳过控制理论课程的自由。反正我迟早会回到控制理论的学习,在合适的时间、合适的环境下。

如果不在学生自己的知识价值评估体系中建立基础,你就无法让学生高效学习。更糟糕的是,强迫会导致反抗,可能会损害整个学习过程。

1986年,我急切地想学习编程,把编程放在优先位置是正确的选择。编程不仅为我后来更好地理解控制理论打下了基础(算法比微积分更直观),更重要的是,编程引导我走上了SuperMemo的道路,彻底改变了我的人生轨迹。

普查尔卡教授虽然是控制理论方面的专家,但这并没有帮助他理解学习过程的最佳控制理论。我在那门课的考试中作弊了(可能是我一生中唯一的一次),离开学校时对控制理论的理解很不透彻,在后来相当长的时间里,我对这门学科都有一些负面的情绪联想。

幸运的是,在知识世界的自由探索中,我不得不重新回到了这个学科。正是控制理论为学习驱动力的优化提供了理论基础。

这个故事的寓意是:教师千万不要强迫学生学习。越是聪明的孩子,反抗得越厉害,对自己学习自主权的捍卫也越激烈。33年后,普查尔卡教授早已退休,而我觉得自己得到了彻底的”平反”。他对控制理论价值的判断是对的,但我对自己学习条件的坚持也是对的。

我自己的这段经历,为我今天争取年轻一代教育解放增添了额外的动力:强制教育必须结束。

嗨呦嘿喂汉化组译制

感谢主要译者 o3,校对 嗨呦嘿喂

原文:Optimality of the learn drive

作者:Dr Piotr Wozniak