先後从湾区的跑道上拔地而起,它们的目的地都是……
韩国,首尔。
……
休息室外。
唐杰找了个没人的电话,拨通了一个国内的号码。
他把会场这边刚刚发生的事,原原本本复述了一遍。
电话那头沉默了几秒,然後笑了。
“唐教授,把心放肚子里。”
“你呀,还是不够了解李东教授。”
唐杰握着手机,怔了一下。
“……行,我明白了。”
挂断电话後,他抬起头。
目光穿过大厅里的人群落在那个正谈笑风生的年轻人身上,神情说不出的古怪。
……
展区的另一边,独角兽联合展台旁的咖啡台。
两个挂着参展商工牌的人,正端着咖啡闲聊。
其中一位是埃里克万斯,矽谷一家ai独角兽的联合创始人,兼首席科学家。
他们家的招牌是long context与极速推理,两年前靠一手“百万级context window”的硬核绝活一战成名,估值一路狂飙过百亿美元大关,是这条细分赛道上跑得最快的黑马。
下午唐杰领着李东在大厅里寒暄的时候,万斯就排在换名片的队伍里,还很郑重地做过一番自我介绍。
此刻他正和一位欧洲基础实验室的研究员聊得起劲,余光忽然瞥见一道身影朝这边走了过来。
万斯扭头一看,整个人立刻精神了。
他连忙朝那位研究员抱歉地举了举咖啡杯,丢下一句“回头再聊”,便快步迎了上去。
“李东教授!”
“万斯博士。”李东笑着同他握了握手,连破冰的废话都懒得铺垫,开门见山。
“正好碰见你,我想问问你有没有想过,把我那套降维算法1.0完完全全地适配到大模型的底层架构上去?”
万斯脸上的笑容,僵住了。
随後转成了狂喜。
他不知道李东为什麽忽然问起这个。
可李东都这麽问了,这天下哪有不吃白食的道理?
万斯深吸了一口气说道。
“想过!李东教授,我们不光想过,还砸了真金白银进去跑过消融实验!”
“您的降维算法里的fft网格的非线性展开,本质上是在做高维流形的低秩逼近,对吧?”
“我们就把这套思路端到了长文本的kv cache上。”
“给key-value矩阵强做低秩投影,切掉尾部的奇异值,显存开销当场砍下去七成。”
“跑常规文本的perplexity,指标很稳,ppl几乎不掉点。”
“可一上niah的精确检索评测,recall就当场崩盘。”
“後来做可视化才定位到,attention矩阵的奇异值谱,是个极其极端的重尾分布。”
“模型里那几个专司精确检索的attention head,要在几十万个token里捞出那根‘针’,它们学到的特征向量全挤在谱的尾巴上。”
“我们把尾巴这麽一刀切,等於直接把这几个head的眼睛给挖了。”
“李东教授,您那套算法算zeta零点的时候,奇异值截断比我们猛得多,凭什麽您的尖峰特征就能无损保留?”
他说的问题,信息密度高得吓人。
周围几个竖着耳朵的参展商,已经不动声色地朝这边围拢了过来。
李东慢条斯理地开了口。
“你这个问题,算是摸到门道了。”
“但你们的方向,从一开始就歪了。”
万斯一怔:“错在哪?”
“错在你们想靠暴力的‘砍’去收敛边界。”
“在我的理论框架里,svd谱截断压根不是c位,那只是工程落地时顺手的後处理。”
“真正的杀招,是截断前的那次非线性流形重排。”
“零点,是zeta函数的特征指纹。”
“你说的精确检索,是全局序列的特征指纹,指纹这东西脾气很怪,选错了基底,你给它留再高的rank它也存不住,扔进正确的正交基底里,rank 1就足够表达了。”
“所以,你们直接在kv的原始特征空间里强做低秩,纯属南辕北辙。”
……略
“等特征重分布做完,你再去切奇异值,error bound(误差上界)自然就收敛了。”
万斯听得连呼吸都屏住了。
听起来……数学逻辑上完全能闭环啊!
“那、那这个非线性重构算子,该怎麽参数化?”他急切地追问。
“这就得看你们对自家数据分布的先验假设了。”李东高深莫测说道,“流形重构是同数据分布强绑定的,我总不能越俎代庖替你们去定义你们自己的预训练语料吧