最新网址:m.leshugu.info
美利坚,加利福尼亚州,山景城。
谷歌deepmind总部的一间实验室里。
杰里米安德森是deepmind前沿评估团队的技术主管,他在这行做了快十年了。
从alphafold到gemini,他见证过太多大模型从无到有的过程。
可眼前这个东西,让他第一次感到棘手。
未央。
燕大那个只做数学的模型。
如果只看它现在的样子,不过是一个垂直领域的专用工具,连聊天都不会。
但安德森却很清楚,如果未央能在数学上彻底消灭幻觉问题,那它背後的架构和范式一旦推广到通用领域……
到那个时候,华夏在大模型这条赛道上就不是追赶的问题了,而是换了一条完全不同的跑道,而一但华夏的赛道上没有了障碍,那懂得人都懂……
所以他接到的任务很简单:摸清楚未央的底。
他第一步就是嚐试知识蒸馏。
构造了一批精心设计的数学问题输入未央的公测接口,收集它的输出,然後用这些输入输出对去训练一个小模型,试图让小模型模仿未央的推理行为,从而反推它的内部表征结构。
这是行内的常规手段,对绝大多数公开部署的模型都有效。
结果却让他大吃一惊,失败了。
小模型训出来了,但它学到的东西完全是一堆无意义的格式化噪声。
蒸馏後的模型在任何一道测试题上都输出乱码,连最基本的算术都做不对。
後面他又嚐试了成员推断攻击。
通过向未央反复输入已知文献中的定理和证明片段,观察它的响应置信度变化,以此判断这些文献是否出现在它的训练数据中。
结果还是失败。
未央的响应模式完全不符合任何已知的基於统计拟合的模型特征。
它不像是在“回忆”训练数据,而更像是在现场推导,每一次给出的证明路径都不完全相同,但逻辑上都严格成立。
最後他使用了最见不得光的对抗性探针注入。
安德森的团队构造了一组专门用来触发模型内部表征泄露的提示序列,这些序列包含了精心设计的逻辑陷阱和自引用结构,在其他大模型上曾成功提取出隐藏的系统提示甚至权重分布的统计指纹。
他本来还满怀信心,结果未央直接返回了一行标准化的错误提示。
“输入格式不符合数学命题规范,请重新输入。”
当时安德森人都傻了,这特麽是什麽大模型??是不是有点不讲道理了?
他脸色难看的坐在屏幕前。
他在这行干了快十年,见过各种各样的大模型——有做得好的,有做得差的,有吹牛吹上天结果一紮就破的,也有确实硬核但多试几次总能找到缝隙的。
哪怕是华夏之前那些模型,不管对外宣传得多麽天花乱坠,他们去蒸馏的时候也没遇到过任何阻碍。
该拿的东西照拿,该摸的底照摸。
可这个未央,从头到尾什麽都摸不到。
它甚至不像是一个基於统计学习的模型——它的行为模式和他见过的所有大模型都不一样。
他沉默了很久,拿起手机拨了个号。
电话接通了。
“朗,失败了。”
……
燕大,李东的电脑屏幕角落。
小黑头上弹出一行字。
【主人,搞定了!而且我还摸到一点他们的核心架构信息,等我整理好以後再给你说哦。】
“真乖,小黑。”
次日。
李东接到了龚校长的电话。
“去普林斯顿的事,没问题了。”
龚旗没多解释,李东也没多问。
挂了电话,他就联系了彭罗斯和莎拉,三个人开始为出行做准备。
……
12月2日,新泽西州,普林斯顿。
初冬的普林斯顿没有下雪,但还是能哈出一口白气。
李东跟着彭罗斯,沿着奥尔登路一路走到了高等研究院的福尔德楼。
这里是高研院数学学院的主楼,爱因斯坦当年的办公室就在二层。
莎拉走在彭罗斯身後,手里拿着演讲稿,一路上都没怎麽说话。
倒是彭罗斯一直在给她做心理建设,说什麽“别紧张,就当给朋友讲课”之类的话。
今天的布尔甘讲座,莎拉是主角。
所谓布尔甘讲座,是为了纪念2018年去世的数学家让布尔甘而设立的。
布尔甘生前几乎凭一己之力运营着塞勒姆奖长达几十年,他去世後奖项停颁了三年多,直到高研院接手、由文卡特什主持才重新恢复。
自那以後,每年的塞勒姆奖得主都会受邀来高研院,做一场与获奖工作相关的学术报告,这场报告就叫布尔甘讲座。
最新网址:m.leshugu.info