最新网址:m.leshugu.info
与此同时,国内某家大厂的会议室里。
几个人围着长桌坐着,幕布上还显示着那几张有些刺眼的跑分榜图。
“不得不承认,这一回他们是真上了个台阶。”
一位高管叹气说道。
“不是从前那种小修小补,是模型的能力比起上一代有了质的飞跃。”
桌上一时间没人接话。
过了好一会儿,一个技术负责人才开口道。
“我听说……之前李东教授好像和他们沟通过很久,时不时林东教授给他们指的路?”
这话一出,好几个人都看向了他。
“消息准吗?”
“传得有鼻子有眼的。”
“反正这半年,他们进步这麽快,你要说背後一点说法都没有我是不太信的。”
“要不……咱们也去请请李东教授?”另一个人试探着提议道,“咱也是华夏的本土企业,他总不能光顾着帮外人吧,再说了,真要谈钱,咱给他一个合适的价格就是了,咱们又不差钱。”
这提议一出口,在座的纷纷点头。
事不宜迟,散了会,几个人便各自动用起手里的关系,变着法子去联系那位李东教授了。
……
而被联系的最多的自然就是北行的李总。
这两天他这部手机就没消停过。
“喂?……哎哟,这事啊,我手上真没有李东教授的电话呀。”
“之前是联系过,可人家早换了号了”
“转达?我上哪儿替你转达去……”
接到第五六个的时候,李总直接就关机了。
他是真的服了。
这帮人,当他是傻子吗?
他要是真能联系上李东,他自己会不联系?
北行又不是没有大模型。
所以他是真的联系不上。
电话不是没人接,就是不再服务区……
他甚至还托了燕大的几个熟人去打听。
得到的回答都是,最近没见过李东的人。
没见过人?这种回答骗骗别人还行,他怎麽可能信。
肯定是李东不愿意见他们而已。
想到这里李总只能独自叹了口气,又看起了国外的科技新闻。
……
就在“国外ai即将统治世界”的言论愈演愈烈的时候。
某天,frontiermath第四级的榜单,悄悄地刷新了一下。
一个陌生的大模型出现在了榜单的首位,它的名字叫做——未央!
它背後跟着的数字是73.4%。
这是个什麽概念呢?
那个吹牛逼最厉害的gpt-6也才跑了48.7%。
这已经不叫领先了,这叫断层。
前面那个一骑绝尘,後面一群人连它的影子都够不着。
最开始,没人把这个数字当真。
跑分榜上闹乌龙,又不是头一回的事。
多半是哪个新模型钻了题库的空子,要不就是评测脚本出了岔子,再不然,就是有人在背後刷榜……
技术论坛里清一色全是这类的猜测。
於是有好事者,拿着公开的那部分题目,自己动手复了一遍盘。
结果这个数据居然是真的!
紧接着,又有人在另外几张榜单上,看见了未央这个名字。
putnambench,那六百七十二道用lean形式化写就的普特南竞赛题,排在最前面的,从来都是那几个烧钱烧到上千美元一道题的家夥。
而未央挂上去的成绩,是六百七十二道,全解。
一道不落,且每一道题後面,都有一份机器当场就能验过的完整证明。
然後在大家吃惊的时候……
minif2f上的四百多道奥赛级的形式化题目,也被它清了个干干净净。
这两张榜,向来是机器证明这一脉的试金石。
它们的题目虽是公开的,证明却必须一步一步由机器亲自验过,才算数。
在这种地方,你糊弄不了任何人,蒙也蒙不过去。
所以消息很快就在ai圈和数学圈里,一同传开了。
谁也不知道这“未央”是打哪儿冒出来的,更想不通它凭什麽能在这几张榜上,把所有人都甩出这麽远。
不过这种公开的跑分的大模型到底是哪家的总是有办法查到的。
所以很快就有人把它给扒了出来……这模型出自燕大。
燕大?
要知道,上一个从华夏的大学里走出来还在国际上闯出过名号的大模型,还是智谱。
可如今这个未央看起来好像比智谱还要凶的样子。
不过很快就有眼尖的人注意到,未央并非张张榜单都拔尖。
在那张衡量综合智力的artificial analysis指
最新网址:m.leshugu.info