• 首页
  • 上一页
  • 目录
  • 下一页
  • 书架

《首富从看见信息面板开始》

第一百四十二章 唯一的解释

    刘大海组织了一下语言,回答道:

    “我也想过,不太能够。三道测试题来源完全不同,一道从鼎盛内部题库选的,一道我现场手打的,还有一道是我私人题库里最难的,内部都没几个人见过。而且三道题覆盖了三种不同类型的意图推断,他们全部精准命中。最後他们还展示了完整的基准数据,一千两百道题,十六个场景交叉验证,不是挑好的给我看的。”

    “咋说呢,这个85.2,确实是实打实的。”

    办公室安静了下来。

    空调出风口的声音突然变得很清晰。

    程远地下意识合上了文件夹,咽了口口水,然後尴尬的听见自己咽口水的声音怎麽这麽响。刘大海盯着茶几上的花瓶,里面插着几枝干枯的棉花。

    郑晓波的脸上还是古井无波,但他的手握在杯子上,既没有拿起来,也没有松开。

    过了一会郑晓波才慢慢开口:“他是怎麽做到的,你有想法吗?”

    刘大海从背包里摸出笔记本电脑,走到郑晓波的办公桌前面,打开电脑,屏幕亮了。

    上面是一份打开的文档一

    《汤圆模型-意图理解:可能的技术路径分析》

    “这是我昨晚连夜写的。”刘大海说。

    技术人的邀功还是直白了点。

    他把屏幕对着郑晓波,往前推了推。

    “先说排除法,指定不是架构创新。”

    “意图理解这条赛道,OpenAI的GPT现在是公认的天花板,也就78分出头。他拿一个开源的7B架构,参数量只有人家的零头,跑出85.2。郑总,这麽跟您说吧,这就好比一个我们那县城中学的一个差生,用别人的旧课本自学,高考分数比全省状元还高三十分。我拍胸脯地说,绝对不是架构创新,7B的架构就那麽点东西,翻不出花来。”

    “现在大模型的竞争,已经过了参数军备竞赛的那个阶段了。几百亿参数、几千亿参数,架构上大家都整的差不多。Transformer还是那个Transformer,无非是层数搁(gé)那儿多一层少一层,注意力头多一个少一个。”

    刘大海一边说一边仔细观察郑晓波的表情。

    技术人给领导汇报,又怕说多了太多技术细节,领导听不懂。又怕说的太少太简略,领导觉得不满意。只能小心翼翼,随时调整。

    “我能想到唯一的解释,除非这个县城学生用的不是别人的旧课本,而是一份全世界别的学生都没有的,黄金复习资料。”

    郑晓波还是面无表情。

    这时程远插话了一一他没听懂,这没关系,但他主要是怕郑总也没听懂,这种问题不能让郑总来问。“刘博士,不好意思,你这个比喻指的是?”

    “是标注数据。”刘大海也意识到自己说上头了,赶紧扯回来,“郑总也大概了解,我就简单说一下。”

    他把电脑转过来,去网上搜了一个流程图,再转回去面向郑晓波。

    “咱们训练大模型主要分为几个阶段,先是预训练,就是堆语料,咱们恨不得把互联网上所有的东西都给它整进去。”

    “然後是监督微调,找一帮人给模型做示范,教它学明白啥是好赖话儿。”

    “再往後就是对齐,让模型学着按人的想法来排,回答得更像正常人说话。”

    刘大海指了指屏幕上的流程图。

    “第一步大家用的语料都差不多,互联网就那麽多东西,你抓我也抓。真正拉开差距的是後面两步,谁的数据标注质量高,谁训出来的模型就强。”

    “所以我说,那个……对方效果能做的这麽好,一定是有好的标注数据。”

    刘大海把韩路一的名字忘了,

    -->>(第2/3页)(本章未完,请点击下一页继续阅读)
  • 加入书签
  • 上一页
  • 目录
  • 下一页
Copyright shukugu.com 返回首页
顶部