第440章 小心资本(3/4)

李东别说试过了,他连未央出了通用大模型测试版也是今天才知道的。

“我还没有,唐教授试过了?”

“嗯试过了,能力很出色,这不用多说。”

他顿了一下,然後说:“但如果是要往通用方向走,有几个地方,现在看来还不够。”

李东说:“说说看?”

“我先说好的地方。”唐杰说道。

“凡是有标准答案、靠硬推理的榜单,它都强得离谱,简直可以说是断层领先。”

“而且,我很意外他在swe-bench上的表现也是出人预料的好,几乎也是断层的水平。”

swe-bench测试的不是大模型单独写代码的能力,而是把模型直接扔进一个真实的开源项目里,让它读懂整个代码库,再去修一个真实存在的bug。

这玩意儿吃的是长链条的推理能力,一步错,後面全错。

通用模型在这张榜上普遍吃力。

未央能在上面取得好成绩,其实并不意外,未央的底子就是一步一步可核验的推理,它天生不爱跳步,也不爱瞎编,这习惯挪到代码上,反而成了优势。

“但是,”唐杰话锋一转,“另外那些榜,就不太好看了。”

“最明显的是chatbot arena。”

这张榜在大模型圈子里份量很重,它考的不是谁算得准,是真实用户更愿意跟哪个模型聊。

因此并没有标准答案,打分的不是机器,是一个一个的活人,凭感觉投票。

全球的大厂为了在这张榜上有好名次,会专门做一道叫rlhf的工序,反复拿真人的偏好去打磨模型,让它学会怎麽把话说得让人舒服。

未央在这张榜上的名次,低得几乎可以忽略。

“它太死板了。”

“你给它一道题,它的推理无懈可击,可你换个方式问同一件事,它就不一定能灵活地调整切入角度。”

“它的训练信号从来不是人类喜不喜欢,是核验器判它对不对,所以它压根没学过怎麽揣摩人话。”

李东在心里想。

“唐杰教授,你说的没错,但那时因为我没时间去优化这些,额……小黑没时间,算了,反正我没时间就是小黑没时间!”

未央现在的通用侧短板,是架构层面的一些选择带来的,而这些选择本来就是为了让它在数学符号推理上做到极致。

他当初和小黑弄未央出来,就是为了方便计算。

至於有没有考虑把未央这套底子拿去做通用大模型,说是实话,他确实动过念头,不过也只是一瞬间。

因为不能吸引他呀,他的最终目标其实还是像小黑这样的人工智能,现在的这些大模型,他和香农的态度是一样的,什麽狗屁玩意儿。

所以李东没有吭声,只是点了点头。

唐杰以为他听进去了,於是看了看四周,确定没人注意这边,才继续说道。

“李东教授,你和我们有些不一样,作为一个过来人,给你一个建议。”
本章未完,请翻下一页继续阅读.........

附近章节