课代表立正

许多人尝试模仿ChatGPT的样子,但实际上他们无法复制背后的大型模型的能力,因此看起来像是智障。因为很多人忽略了工程能力的难度和重要性。 在这期视频中,我用一个Intel 5nm芯片的例子,来直观地向大家解释为什么工程能力如此重要困难,以及为什么即使你了解所有关于谷爱凌的训练方法,也很难把自己女儿训练成谷爱凌。

What is 课代表立正?

课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士

社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai

Hello 大家好 欢迎回到科特伟类John
今天我们聊一下为什么复制一个XGPT
可能不像大家想的那么简单
其实大家也看到了很多XGPT的复制产品
国内国外的都有
国内的我就不点名了
但是不管是大公司还是小公司
其实都有很多复制XGPT形式的产品
国外最著名的就是谷歌的Bart
然后也有很多开源的这个模型
这些产品他们或多或少的
也会去宣称自己在某些任务上
是比XGPT的效果更好
最近还有一个开源模型
说自己是GPT4认证的
达到了3.5的XGPT的80%的水平
这些东西就很扯
因为大家真的去试用以后
发现其实那些模型根本就无法使用
他们空有一个对话的生成方式
可是底层大模型的能力天差地别
就表现在虽然都是在说话
但是一个是正常人
或者说优秀的有理解能力的人在说话
一个就像是智障在说话
那你跟一个智障对话有什么帮助呢
肯定是没有帮助的
我也跟业内的同学聊过
就是你想做一个Generative的Language Model
用对话的形式去生成一篇对话
其实这个难度也没有那么大
就是很多团队
然后花个几百万的人民币的钱都可以做到
可是这样想要做到GPT3.5这样一个水平
那就超级超级难了
那我们这期视频就聊一下
为什么做一个GPT3.5这样的水平的大模型
是这么难的一件事
首先我们要知道GPT3.5它没有一些特别的密集
就是它不是说我藏着一个模型的范式
其实这个命名都已经很清楚了
就是Generative Pre-Trend Transformers
是一个基于Transformers的这样一个大模型
它也有各种各样的论文和各种各样的资料出来
大家大概知道它的参数量大概是什么样子的
和它在训练的过程中有做什么
可是在这种情况下还是很难复制
为什么呢
因为这是一个复杂的工程问题
工程问题的难度大家在日常生活中可能很难感知到
所以说我们经常就忽略了
但是我们知道我们国家经常被卡脖子的这些科技
就所谓的硬科技
比如说大飞机的引擎
比如说一些特殊的材料
比如说芯片
这都是吃工程能力的
就是我们其实知道引擎的原理是什么
我们知道芯片的原理是什么
我们知道的配方我们也做不出来
就是因为它中间需要很多的工程积累
我这还有一个更形象的故事
就是大家如果看我之前有采访过我一个学长
他在英特尔做5纳米芯片
我那个时候住在他家他跟我聊天
跟我聊天的时候他那个时候就在抱怨说
自己虽然在这个5纳米的实验室里边工作
可是工作的内容也不是特别有技术含量
他做的这些事情觉得一个初中生也可以做
我说为什么
就是你给我讲讲你的工作内容到底是什么吧
他就说其实他每天就是拿到一个单亲硅
实验室里会生长出来这种结晶的单亲硅
然后去做各种各样的实验
根据实验的结果
再去决定下一步的实验怎么样子去迭代
可是这些实验结果本身也没什么复杂的
他只要积累一些工程和know-how就好了
一个就是聪明的初中学历的工程师过来完全可以做
他是康奈尔的一个化学博士
他觉得他在博士中学的这些知识其实是完全用不上的
听完了以后我就问他说两个问题
第一个你做这个单亲硅需要多少个步骤
第二你做一片单亲硅需要多少钱
他说25片单亲硅因为他的要求比较高
纯度要求是很高和很固定的
所以说做这么一个单亲硅的成本
对于英特尔这样一个非常有工程积累的企业来说
大概25片是100万美元
然后做这么一个单亲硅的步骤
大概是几百步到1000步
如果这里边的一步出了一点点的小问题
最后的良率就会受到很大的影响
所以说你叠加起来的话
你的技术积累稍微差了一点
可能你的良品率就是人家的十分之一或者说百分之一
那英特尔花100万美元可以做出了25片
你可能就要花1000万1亿美元才能做出25片
那你就根本没法做了对吧
所以说我就说OK
那你的这个看似很简单的这些知识
其实是几千万美元的成本烧出来的
那回到大模型也是这样子
我们模型的训练包括数据的积累清洗
需要很贵很贵的成本
更关键的是这里的学习成本
就是你大模型叠代一次的话
可能要一个月到两个月
所以说哪怕对于谷歌这样发明了Transformer
发明了T5发明了Sichela的这样的一个公司
他也觉得自己乐观鼓起
如果一切都非常非常顺利的话
怎么样也要花一年才能复现出来GPD 3.5的那个能力
GPD 4就更久了
在这种情况下我实在是不知道为什么
有那么多人有自信觉得我们跟OpenAI差距很近
其实人家的工程人才的密度是非常非常高的
他们的工程的思路
他们的决策体系
他们的整个迭代机制都已经很优化了
所以在我们各方面都落后的情况下
如果我们再不认识到这里边的巨大差距
那我们是不可能赶上这个差距的
意识到这里的巨大差距就是去尊重工程
尊重工程的know-how是需要很强的积累的
它是要一步一步的去做出来的
而不能一步登天
那这儿再稍稍说一下
就是为什么我们之前的模型不是这样子
就是之前的机器学习模型
好像大家看到中美没什么差距的吧
这是因为机器之前的模型全都是开源的呀
而且那个模型本身不是一个特别有门槛的东西
尤其是开源了之后你拿去用
谁都可以掉包
人都把代码都给你了
你的壁垒其实是在你把它跟业务的结合和你的数据上
那我们又恰好收集了很多数据
所以说显得好像我们的AI能力和美国是在一个水平线
但是大家要知道背后的这个脑子
基础科研能力以及工程能力是有很大差距的
尤其是我们现在连谷歌都跟OpenAI的工程能力有这么大差距的情况下
大家再不认真对待这件事的话
那我觉得是没什么希望的
我们认真对待这件事的话
去一步一步的去补
从清理数据开始
把清理数据这件事搞清楚
然后再去把怎么样子用大模型
怎么样子去调度好算力
然后在这里面怎么样子快速迭代
怎么样子早期失塑等等等等
一系列的工程问题全部解决了以后
我觉得才有希望
不然的话就会沦为像材料科学引擎和芯片这样子
我们天天说被人卡脖子
我们烧了无数的钱
最后离别人的差距不是越来越近
而是越来越远
好的
这期视频就到这
希望可以帮大家澄清这样一个误会吧
那我们下期见
拜拜