第389章 小黑的本体(4/4)

换句话说,总有那麽一些上文,它底下究竟该接个什麽样的字、什麽样的分布,这模型打根上就表达不出来,跟你喂它多少数据、给它堆多少算力,半点关系都没有。

这是焊死在它骨架里的一道天花板。

“还有还有,它们的注意力也有问题,应该叫注意力汇聚(attention sink)。”

小黑接着说道。

模型读一句话,靠的是注意力。

每个字都会去观察旁边的字,按相关与否分给各自一份权重。

坏就坏在,这份权重,也是拿softmax归一的,加起来必须凑足一个整一。

这就逼得它,哪怕通篇没有一个字值得它分神,也没法干脆弃权那份多出来的注意力,所以它总得找个地方释放出去。

於是它就释放在了开头那一两个字上,释放到一个跟正文八竿子打不着的锚点上,硬生生攒出一处“注意力汇聚”。

伴随着这个现象还有个熵坍缩(aec)。

越往後训练,它那点注意力就收得越窄,全部钻在了寥寥几个字上,其他的几乎一概不看了。

这两样凑到一处,白白浪费掉了它一大块本该使在正经处的注意力。
本章已完成!

附近章节