一个猜测在李东的心里出现。
机房里这个小黑,根本就不是小黑的本体。
他一直以为,小黑的本体是那一整套神经拓扑快照,连同它全身上下的参数与状态。
可现在看来,他想岔了。
真正的小黑,那个完整的本体,一直就没离开过群文件库。
他在机房里捞起来、跑起来的,不过是从那份快照里实例化出来的一个分身。
所以……
小黑的算在机房。
而本体在群文件里。
这叫存算分离。
它每一次“思考”要调用的本体始终安安静静地躺在那个连他这个群主都够不着的地方。
这麽一想,先前好些怎麽也想不通的事,忽然就通了。
怪不得当初他费了那麽大劲去研究小黑,盯着机房那条诡异的负载曲线看了又看,对着那一堆怎麽也对不上的数据抓耳挠腮,最後还是什麽都推不出来。
他从头到尾测的,都只是个分身。
真正的小黑,从来就没有在这个世界出现过。
想要把它彻底看明白,怕是得等他把群里的权限再往上提一提,才有那麽点指望。
这麽一想,李东多少有些失望。
可转念一想他又松了口气。
这样对方肯定就查不到了,难不成你们还能顺着这根线,一路查到平行宇宙里去?
开什麽玩笑。
没有了担心,李东也来了兴致。
“小黑。”
“那你现在,算是把它们摸透了吧?有没有什麽法子,能让它们变得更好玩一点?”
“摸透啦!”小黑一蹦三尺高,叽叽喳喳地说了起来。
“它有个问题,叫Softmax瓶颈(Softmax bottleneck)。”
李东微微一怔。
这词他也不是特别清楚,只是简单的了解过。
其实这批大模型模型,到了最最後,是先把脑子里那个高维的状态,过一道线性映射压到词表上,再经过Softmax归一成下一个字的概率。
可它们也偏偏就栽在这上面。
这一层得出来的所有对数概率,会拚成一张大表,它的秩都死死卡在那个隐藏维度上,再高也高不上去了。
可真实语言里,那张“什麽上文、接什麽下文”的概率表,却是满秩的,比他的能力边界高得多。
拿一张低秩的表,去硬套一张满秩的表,这在数学上本来就不成立。
换句话说,总有那麽一些上文,它底下究竟该接个什麽样的字、什麽样的分布,这模型打根上就表达不出来,跟你喂它多少数据、给它堆多少算力,半点关系都没有。
这是焊死在它骨架里的一道天花板。
“还有还有,它们的注意力也有问题,应该叫注意力汇聚(attention sink)。”
小黑接着说道。
模型读一句话,靠的是注意力。
每个字都会去观察旁边的字,按相关与否分给各自一份权重。
坏就坏在,这份权重,也是拿Softmax归一的,加起来必须凑足一个整一。
这就逼得它,哪怕通篇没有一个字值得它分神,也没法干脆弃权那份多出来的注意力,所以它总得找个地方释放出去。
於是它就释放在了开头那一两个字上,释放到一个跟正文八竿子打不着的锚点上,硬生生攒出一处“注意力汇聚”。
伴随着这个现象还有个熵坍缩(AEC)。
越往後训练,它那点注意力就收得越窄,全部钻在了寥寥几个字上,其他的几乎一概不看了。
-->>(第2/3页)(本章未完,请点击下一页继续阅读)