最新网址:m.leshugu.info
讲到这儿,台下的学生就有点撑不住了。
他们才大二啊。
这帮人虽说不少都已经上手做起了自己的AI项目,模型调起来一个比一个溜,可姚先生今天讲的这个,实在太特麽垂直了。
这已经不是“会不会用”的层面。
这是得专门钻进深度学习的数学理论里头,整天跟损失景观、隐式偏置、泛化边界这些东西打交道的人,才跟得上的东西。
随着姚先生的讲解,黑板上的公式越堆越多。
【Θ(x,x′)=??f/?θ,?f/?θ?……】
底下勉强还能跟上的人,越来越少。
有人已经开始小声地议论了起来。
“姚先生今天这……跟平时不太一样啊?”
这话说到了点子上。
平时姚先生上课,是出了名的深入浅出。
再难的东西,他总能用一些大家听的动的例子来讲解,把学问讲得有趣,好懂。
可今天他讲的这些什麽过参数化的损失景观,梯度下降的隐式偏置,还有那个懒惰训练背後的 NTK机制……
这根本就不是给一群大二智班学生准备的东西。
这像是讲给同行听的。
然而坐在後排的李东,却听得津津有味。
这些东西,有一些他也不是全懂。
哪怕这一个礼拜,他几乎把市面上能找着的AI论文、文献、测评,一篇不落地全塞进了记忆宫殿。
可记忆宫殿这玩意儿,说到底只是个仓库。
它能存,却不能替李东啃透。
那些论文这一篇是讲损失景观,那一篇是讲泛化,另一篇又在讲什麽核方法,李东完全没办法将它们有序的关联起来。。
而姚先生此刻在台上讲的这些,就像一根针线,终於将这些串联了起来。
损失景观为什麽会连成片,连成片之後梯度下降凭什麽偏心,偏心又怎麽扯到了核方法的头上……
原来,它们讲的是同一件事。
……
就在李东顺着这根线往下捋的时候。
台上的姚先生,忽然停了下来,低头看着教案,似乎是在等底下的同学消化。
教室里,一下子就静了。
李东还沉浸在刚才的思路里没出来,姚先生讲的那个懒惰训练有个地方他一时没搞明白。
於是他下意识地就喃喃自语了一句。
“……可它要是一直这麽懒,那它到底是从什麽时候起,才真正学到东西的呢?”
声音不大。
可教室太静了,这一句话就显得格外的清楚了。
姚先生本来还低头看着教案,听见这一声,他抬起了头。
目光落到後排的李东身上,他笑了笑。
“李东教授,你这个问题,问得很好,”老人慢条斯理地说道,“网络要是真就一直这麽懒、一直围着起点打转,那它顶多算个换了身皮的核方法,谈不上学到什麽新东西。它真正开始学,是从它肯挪窝、肯把那些旋钮往远了拧、在底层自己长出一套有用特征来的那一刻起的。”
“这中间隔着的那道坎叫逃离 NTK机制,进入特征学习。”
“至於这道坎卡在哪儿,又该怎麽迈过去……”
姚先生笑着摇了摇头。
“这恰恰是现在还没有几个人能说清楚的事。”
姚先生话音一落,李东却愣在了那里。
周围几个学生偷偷瞄他,心里都犯起了嘀咕。
好家夥。
这个问题难成这样了?连东神都被说懵逼了?
然而李东并没有被说懵。
他愣住的原因只是因为……刚才他的脑子里毫无征兆地冒出来一些更深的东西。
【当网络宽到极限的时候,不再被看成一堆死板的旋钮,而是化作了一片连续的“概率分布”】
【每一个神经元,都成了这片分布里的一粒尘埃。】
【训练也不再是苦哈哈地一个个拧旋钮,而是这一整片分布,在一个叫 Wasserstein空间的几何世界里,顺着最省力的方向流动。】
这是把训练直接写成了一道描述质量如何流动的偏微分方程啊。
而顺着这道方程往下,那道卡了无数人从懒惰到特征学习的坎,竟隐隐约约露出了一点能绕过去的缝。
这才是李东懵逼的原因,他立刻就反应了过来……
这是姚先生脑子里的思路,是姚先生那些还没来得及说出口、甚至自己都未必理顺了的灵感。
它们被薪火相传进阶版的效果,塞进了李东的记忆宫殿里。
可紧接着李东又觉得不对劲。
刚才他坐在底下听,姚先生讲了那麽久,他脑子里也只是把旧东西串了串,半点新的没冒出来。
偏偏是他喃喃问了那一句、姚先生回了他那一句之後。
最新网址:m.leshugu.info