课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士
社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai
這不是應該是你嗎
這是你的節目
你的節目
所以說我覺得這些東西疊加起來就
可能世界上只有五個日子
好
但是我在這一步裡邊看到了兩步
一個是底層的模型
和它的這個
reinforcement learning這一步
歡迎
Hello
大家好
歡迎來到Onboard
我是Monica
特別來這裡
來繼續
對對對
這加得好
對
大家可以感受到了
沒錯
我們這一次又是一次非常有意思的串台
就是Monica在跟這個柯代表
我們在西雅圖
終於又在美國第一次現下見面了
真的
對
雖然都是前亞馬遜同事
但是那個時候沒見過
對對對
然後我們上一次見面應該還是在
深圳
對
在深圳
然後我也是剛回
我們都是剛回國不久
好
沒有
第一次
第一次是剛回不久
第二次的深圳是
我剛要回美國
對對對
就每一次我們見面都是一個非常重要的時人節點
而這一次特別的一個地方也是在於說
我們之所以來有這麼一次錄製這個話題的機會
也是非常的意外和驚喜
也是我們那次最近
我正好來到西雅圖這邊出差
然後我們在一次這個聚餐上
然後發現
聚餐中有一位小哥哥特別的有insight
跟我們火花不斷
我們就覺得說一次吃飯顯然是不夠的
所以說就專門把這位小哥哥
邀請到了我們的這個節目來跟大家一起去探討很多
他所自己經歷的這一路以來
這個Marsh learning
他所看到的大語言模型
以及他所在的公司所經歷的大語言模型的一些探索
而且我相信這一次因為有柯代表的加持
我們可以在很多技術
歷史
甚至時的需的思考上
相信能夠碰上出更多的火花
那我們要不先由這位小哥來做自我介紹
謝謝那個Monica的介紹
還有歡迎謝謝柯代表
邀請我一起做這期節目
然後我可以簡單做一下自我介紹
然後我叫盧毅
我現在在一家C輪的創業公司
做智能客服的創業公司叫Forceout
做他們的Head on Machine Learning
然後我同時還在University of Washington
做他們的科作教授
之前我是在蘋果
做一些機器學習方面的研究
主要在Siri裡面做他們的
比如說事實性問題的問答
也做一些解鎖相關的工作
所以我也是非常高興
這次能夠和大家一起來分享一些我的觀點
然後和大家一起探討學習
好的我叫孫玉征
然後我的網名叫柯代表栗正
是B站和油管的賬號
所以說叫我柯代表就行
我是一個做數據的
我之前是經濟學博士
然後在亞馬遜Facebook同學
都做數據方面的工作
最近去加入了一家Startup叫Static
就是Statistical Significant的所寫
它是做ABCN平台的公司
我平時也對技術商業都非常感興趣
不管是工作中還是課外中
都會有很多思考和產出相關的內容
我因為在2月份的時候
應該是去年10月份的時候
跟Hawaii聊了之後
就一直非常關注AGI的東西
結果就跟他聊完了以後
Mid Journey出來了
然後Chag Pt出來了
之後就一直思考
也寫了很多這方面的文章
包括在M小姐的公眾化上
發過關於Chag Pt的
最重要的五個問題
也一直在不斷地尋找
有insight的人去進行交流
提升我自己的認知
從盧玉治裡邊學到了很多東西
所以說就趕緊抓住機會
趁著Monica在的時候
我們趕緊一起做個節目
我好奇就是
我們要不作為一個開場
那天我們吃飯的時候
聊了很多話題
我好奇是當時盧玉治聊到了哪幾個
哪幾個點讓你萌生了
要跟他做進一步交流的想法
有哪幾個你比較印象深刻的點
我們可以作為一個開場
首先我覺得我們在那個群裡邊
有各種各樣的人 對吧
就是我覺得大家對這件事情的理解
到位的人就已經不多了
就是雖然這麼多人關注我
雖然我們的群裡邊
已經是這裡邊討論這個
但是我覺得真的對他有比較到位的
就是事實性都是事實正確
且理解到位的人
我覺得應該不到100個
然後在這些人裡邊
你又能有一線經驗
且能不斷幫助你update認知的人就更少
但是更重要的是盧玉治本身
他在蘋果的時候就是做這方面的
只不過不是用GPT的方式去做
而和現在所在的這個公司
就是一個人工智能enabled客服公司
又是大約模型最promising的應用場景
所以說我覺得這些東西疊加起來
就可能世界上只有五個日子
就是他在講他們的技術選擇的時候
應該是在講17年前後
有一個人在亞馬遜做了一個模型
然後他可以在review裡邊
extract sentiments
然後他當時沒有
大家覺得這個東西是一個很正常的東西
可是他們看到了一個
就是很大的希望
因為你只是做
從embedding裡邊就可以extract sentiment
哦明白你的意思
我忘了具體是什麼模型和具體是
應該是在Aliya的一次訪談裡邊
有人問他就是說
你的那個
我們可以現在找一下出
然後一線的那個research
訓練在亞馬遜review中的下一個人
這個其實我覺得一方面來講
怎麼說surprise
可以說不surprise
我們他其實說的是unsupervised learning
對其實這裡面如果更subsidized
他們其實比較自我指導
就是我們說什麼叫unsupervised
就是說完全沒有label
對嗎
就是你完全不知道你下面要predict
就像一個cluster的問題
把東西分類
就是group到一起
其實是沒有label
那就是unsupervised
有label就是supervised
像這種nexttoken prediction
形容是一種比較聰明的方式
去自己supervised自己
對
因為你其實沒有人給你提供一個label
但是下一個token就是你的label
對
其實這個最開始的時候
我當然這是我的觀點
我的理解就是說
最開始的時候這種語言模型
他們的這個language modeling task
其實最開始就是predict nexttoken
到現在也是不準
到現在也是
但中間有時候大家會去
就是從中punish出來
就是說也許不認為是這種方式是最好的
那一開始大家這個想法就是說
如果你能夠predict nexttoken
你現在對之前的語言有一個很好的理解
那你這個理解什麼呢
其實你可以理解成就是它的inbedding的東西
如果你對這個語言有很好的理解
那是不是這個inbedding就應該包含了
這個語言當中本來的一些信息
剩下的部分只是從這個inbedding中
提取出你已經學到的信息
這就其實是為什麼要選擇一個task
做language modeling task
那就是說他們認為如果你能完成這個task
代表你對語言有掌握
那這種方面就是說不見得一定是
nexttoken prediction
還是language modeling task
比如說BURT
它其實一開始說GBT
或者說這種類型叫auto-regressive模型
你有前面的東西
然後predict的下一個
就非常適常於生成
那人們就發現有一些問題
就是比如說你在學習這個語
因為我的目標是學習語言
並不完全所有的task都是為了生成
那我為了學習語言
那麼我去做這種
predict下一個token的情況下的時候
那有可能會失去後面的context
對不對
就是我並不知道後面的東西
沒有讓我後面的詞來去描述之前的詞
去學這個詞的意思
對
就是
所以這是所謂的
我覺得這counter-intuitive和
為什麼這個研究如此的重要
和它為什麼
就是Elias覺得如此的重要
就是它這個counter-intuitive
和需要你有一定的信仰的東西
就是你剛剛說的next token
包含了所有的信息
不包含之前所有的信息
不光是能夠包含所有的信息
而且它從一定程度上也包含了之後的信息
這個不好說
對這個怎麼理解
它還可以包含之後的信息
就剛剛比如說的
就是剛剛說的一個很重要的burt
和這個jpt思路的區別
就是burt是雙向的
對吧
然後jpt是單向的
對
然後它為什麼要用雙向
就是因為語言中的上下文
你既然已經能看到全文了
那你當然也應該用全文去理解這個詞
那你的全文就包含了之前的信息和之後的信息
對
所以說從這個角度來說
我們想要精確地預測出來
就是給你一篇文章
先等下去學習這篇文章
然後從這些詞裡邊
精確地知道這個詞是什麼的情況下
你就應該知道全文是最好的
對
你有雙向的注意力是最好的
對
但現在就是像是jpt
它選擇了只有單向的注意力
沒有雙向的注意力
對
後來我覺得這個發展應該是一開始的時候
人們認為單向的學習語言
就是需要這種做這種單向的生成就可以了
這就是一個by definition
什麼是language modeling task
那之後人們認為雙向的注意力是有好處的
我覺得這也是人們發現
確實是有好處的
我覺得不是
我覺得是一個
然後
我說發現這個詞
我不是確實是有好處的
肯定是
但是我覺得說發現這個詞
我不同意
為什麼呢
就是在這之上
其實我就看到了
就是我自己對OpenAI的感覺
就是他們一直在走這一條路
這條路是可以lead to AGI的唯一的一條路
然後剩下所有的人
都是在application的過程中
take各種shortcut
cut各種corner
你可以這麼理解
對
它的corner體現在什麼
就是體現在你用更多的信息
或者更specific的任務
或者說你加入了人更多的hard coding
就是它是不同程度的hard coding
像亞馬遜Alexa就是寫各種if function
如果這個人說了這個
if function
對
然後你就可以在一些任務上perform得更好
他在一些任務上perform得更好
他就不general
對
然後OpenAI從頭到尾
就是二和三為什麼堅持下來那麼難
和我覺得那麼展示這些人非常不一樣的地方
就是因為二是比Bird差很遠
各方面都不如
三是有來有回或者說開始超越了
但是從二和三之間的堅持是很難的
是的
對
他們就堅持了唯一一個最general的方向
就是你想想如果一個最general的東西
就必須要用只用上文去predict下文
之外的所有的hard coding或者什麼的
都會讓他也許在一些事情上做得更好
就是他在這過程中
他真的把這些人類物理拿過去
去做一個specific的任務的話
我相信他早就做得很好
但是他就到不了
我覺得確實我聰明說的
這其實是非常需要信仰的
就是說在發展的過程當中
其實Transformer出現以後出現了三個發展的方向
可以說
第一個就是純autoregressive的模型
這種就是next token prediction
他們的目標只有一個目標就是為了生成
因為我為生成目標的時候我是沒有後文的
我只有簽文
我要做生成
如果你的目標或者說你認為真正的AGI
最後就一定要完成很好的生成型任務的話
其實這種autoregressive的component是不能少的
所以你一定要去完成這件事情
T5的時間是什麼時候
我們可以查一查T5是什麼時候
但是我估計也是個1920年左右的
對
他們有信仰
去說自己用autoregressive這件事情去做AGI
是17年的時候的信仰
然後這個T5也就是所有的自然語言任務
都可以被生成式任務統一
是20年的文章
就是他們在不知道T5的結論的時候
我們現在回去看的時候覺得好像一切都make sense
但是在那個時候你不知道你的所有任務
是可以被生成式任務給統一的
然後你就走了autoregressive
那是很難很難理解的事
還有另外你當時人民就可以選擇說
如果我要得到一個好效果
我可以選擇雙向注意力
這種autorecoding像Bird的方向
同時還有一種結合了autorecoder和autoregressive的方法
比如說有一個叫Bird
它的模型就是先做像Bird一樣的東西
獲得它的表達
再通過一個生成性模型再去做生成
如果我們其實在那一刻的時候
其實我也在那一刻的時候就去了解這種模型
那一刻是什麼時候
比如說Bird剛剛出來的時候
比如說是2021年或者是20年21年的時候
那種時候大家其實確實非常的以後
就是說這三個思路到底要往哪個方向去發展
明顯我們知道這種像Bird這樣的模型
它的發展是更多的
注意力更多效果會更好
大家有很多文章都是講的是
如何提高這種東西的模型
甚至就是說我如何去改變
就用一種非常巧妙的方式
用Bird這種雙向注意力去完成生成式問題
這其實我覺得在那一刻你也是無可厚非的
就算是為了要完成這個問題
那你可能人們都不知道是用哪種方式
更是能夠有最好的結果
但最後其實OpenAI也向大家證明了
就是這種autoregressive單向注意力的
就通過各種各樣的方法是可以完成到很好的狀態
對 就是這個信仰
就是這個信仰之月是月在哪裡呢
就是其他的東西都是短時間
一定程度內效果好
問題是GPT這個方向
你根本不知道能不能成
對的
這個事情你不知道
就是你剛才所說的這個就是2到3之間
就是他們看到了什麼
就是在2到3之間
他們看到了什麼別人沒有看到的
或者說有一些大家都看到了
但是他們從裡面看到了一個更
我覺得17年這個文章真的很重要
就是這個unsupervised sentiment neuron
就是這個是告訴了他們這個東西是可能可以的
不是說可行甚至就是可能可行
然後他們就背著這個可能可行去了
而且是通過這種暴力美學的加算力的方式
是可能可行到一個突破threshold的方式
對
好呀
我好奇你其實前面也提到
我相信裡面文章出來以後也會有很多人找你出來探討
你感覺到GPT
你看雀GPT出來也大半年已經過去了
你感覺這過程中
大家仍然最常見的一些誤解可能是在哪
最常見的誤解就是永遠會發生的短期高估和長期低估
這個Howie當時跟他聊的時候
他說在語音和mobile上都出現過這種情況
我當然不理解就是說為什麼會這樣的
現在我就理解了為什麼會這樣
就是因為短期的時候大家想的是
用雀GPT能解決我現在手上的什麼問題
這一定是一個小機會
因為雀GPT對比
因為現在能看到的問題都會被現有的技術解決的還不錯
所以雀GPT也許能增效一個50%
是了不起了
但是它真正能給我們帶來的一定是我們現在還不存在的問題
對
就是你在mobile之前Uber是不可能做的
對吧
但是有了mobile才可能做Uber
但是你需要很多東西都存在了以後才能做Uber
你互聯網之前Google是不可能做的
但是互聯網剛出來的時候Google也做不了
因為那個時候沒有什麼信息在網上
我覺得這是大家覺得的誤解
魯伊呢
我覺得正好我有一個特別相關的話題
就是其實大融模型出來了以後
我就在思考一個問題
就是說我們所謂的應用型的機器學習
Applied Machine Learning這個領域到底之後還會不會存在
什麼是應用型機器學習
比如說我們原來就認為機器學習分成幾個部分
有些人是更加偏工程型的
對
就是有一些工程性的問題
就其實和Self-reengineered我認為其實沒有本質上的區別
Machine-reengineered
對其實沒有本質上的區別
它只做的是不同類型的engineered問題
就不可能說有人叫as-engineered
有些人叫什麼Gateway-engineered
但其實都是Self-reengineered
Machine-reengineered其實在很多時候只是它的context有些不一樣
我覺得這是最engineered的程度
其實還有另外一個極端就是像scientist
他們做的東西其實就比較不能脫離
因為我也做過一些關於research方面的工作
然後其實主要就是你有一個具體的非常well-defined task
你去如何找到這些數據
如何提高在這個東西上面的效果
也是一個比較玻璃的
就比較怎麼說理論比較強的
中間就有一個叫applied scientist
Applied machine learning
就是把這些技術通過工程的方式
應用在一個具體的產品或者一種形式上
去所謂實現商業價值
之後中間的行業到底還是什麼樣子
未來會變成怎麼樣的發展
我覺得我自己是特別的好奇這個方面
其實在今天來講
當然我們長期看也許這個行業就已經消失了
就變成了每個人都應該獲得的技能
比如說我們每個人不會說
我需要一個人去幫我去做Google engineer
就裝著去做Google search
每個人都會去做這件事情
每個人可能都應該會去做prompt engineer
那這個applied到底是有什麼樣的變化
又會怎麼發展
我覺得也是一個我們日後也可以討論的一個有意思的話題
對這個其實我本來是想留到最後有一個類似的討論
其實就是我們吃飯的時候
和我當時總結的問題的第四個
就是當JPT把他的reinforcement learning這個layer開放給大家的時候
他是不是市面上現在所有的這種所謂的
垂直大模型之類的全都會被幹掉
我們的觀點是會的
我覺得只是reinforcement learning
比如說他只是
如果把那個比方說fine tuning這塊也放開得更徹底的話
你覺得足夠嗎
還是說必須得要把reinforcement learning這塊放開才可以
我在那個文章裡邊一直強調的
就是fine tuning這個詞現在太browth
所以說大家在說fine tuning的時候
不同的人指代的是不同的意思
所以就不能隨便的使用那個詞
然後我的理解就是
魯伊歡迎你隨時糾正我
就是JPT4是他的底層大模型
接下來的那一層是reinforcement learning
with human feedback
但是其實你也可以用不同的feedback
你可以讓他直接只跟code來對話
然後給他構建相應的reward function來做
那這一層其實自由度是非常之高的
然後他能帶來的效果也非常之
就是為什麼JPT3大家都覺得很這樣子
但是XGPT就覺得很驚艷
除了他本身3到3.5可能有一些變化之外
就是他在reinforcement with human feedback這一步
和人的alignment做得太好了
所以說所有人都懂了
所有人突然懂了他是一個特別牛逼的東西
那你這是跟人類的偏好的alignment
但是你也可以跟不同的知識
不同的能力去進行alignment
所以說這能解鎖的可能性是非常之高的
再往下是prompt對吧
然後現在的prompt也是給了你一個非常死的方式
但是這個prompt其實是在chat的
這個reinforcement learning的這個環節之下的一個方式之一
我的預判是他會開放更多
更定制化的prompt的方式
比如說更長或者說權重可調
或者說你可以給他的往上再多記一些東西等等吧
或者說多開幾層layer
但是再往上他現在就能做到
只是還沒有做的東西
就是把reinforcement learning這一步給開放出來
我把這個從reinforcement learning到prompt
這整個環節都叫fan2
但是他和我們之前的fan2那種方式不一樣
因為就像那個洛伊說的
他沒有改變模型的權重
他沒有改變模型權重和之前我們的machine learning fan2
其實在這上面是有很大的區別
其實他在做這個
我稍微查一下
就是他在做這個
就所謂reinforcement learning with human feedback的過程當中
實際上也是改變了模型的參數的
他是拿出來了distill出來
相當於就是把那個4裡邊的一部分拿出來了
還是改變了4本身的權重
他應該是改變我的理解
當然沒有人知道具體這個東西怎麼做的
但是我的理解就是說
他首先先通過我們正常的語言模型的問題
去訓練出來一個普通的模型
然後他用先把他首先他做了一個模型的clone
然後這個模型專門去訓練成他的一個reward模型
他這個reward模型就通過一些人工的數據
去告訴他這個人債人告訴他好還是不好
所以有一個clone就專門做這個reward模型
然後他用這個reward模型去重新再用強化學習訓練
他之前那個底層模型
在訓練這個底層模型當中的時候
這個底層模型實際上也是在變化的
這個我覺得我們可以回頭
把instruct GPT那個paper拿出來重新看一下
我當時還因為張俊林在他的大語言模型技術經驗裡面
有講in-context learning和講這方面的東西
然後我看了他了以後
我回去再看instruct GPT和Chatch GPT的兩個論文
其實instruct GPT是藍色的Chatch GPT是綠色的
就是他們在那個圖裡面
然後流程是一樣的
就是你剛剛說的
當然他們不光是做了一個reward model
就是他們是先構造了一個
用instruct和Chatch的方式去構造數據集
然後去用大模型在這數據集下去perform
然後在這個perform裡面再用reward model去選擇是
就是看的是哪個叫policy
對吧
我當時的理解
就是這是一個distill
或者說用in-context learning
去選擇性的激活大模型的不同的位置
但是沒有改變那個大模型本身
就是說GPT-4它有這麼多個參數是吧
然後每個參數不同權重
這個權重其實是沒有改
對
但是如果說你在in-context learning的這個部分
其實in-context learning並沒有learn任何的東西
對
它只是說你提供了一些東西
在外的作為一個例子
對
給它
那個時候確實是
只是說你可以理解成激活了模型的某一個部分
對
但是我們在訓練一個模型
想通過強化學習的時候
那我們我們需要找到的是一個更好的in-context examples
還是我們要找到的是一個模型
在不提供in-context example
或者提供同樣類似in-context example的時候
得到一個更好的結果
我覺得是後者
我也覺得是後者
如果是後者的話
那就模型本身就要發生一些變化
對嗎
這就是劇裡裡邊說in-context learning的魔力
就是模型的權重並沒有發生變化的情況下
它卻能改
有一個具體的截圖
我回頭可以找出來
就是基本上
而且這裡邊還有一個很神奇的點
就是在你in-context learning的情況下
你不需要給它提供一個y
你給它提供的例子是y等於這些x
對吧
外的這些x
然後你給它一個新的一堆x的香料
然後它能得到一個新的y
結果它發現你在in-context learning給它提供的時候
只要是一個x的集合和一個y的集合對應起來就行了
你不需要它的等號一一對應
它都能學到東西
所以
它不是學到東西
只是說你提供了這個例子
它就可以像這樣往前行
對
就是它這個
所以in-context learning的魔力
起碼according to Jun
就是
開始應該連線它
對
就是我沒有
我
基於對它的信任和理解
就是說
它不需要改變模型權重
對
就可以去激發它
舉一反三的表現
但是在你訓練一個模型
訓練一個更好的模型去完成同樣的in-context learning的時候
你是不是應該改變這個模型的參數呢
我不確定
這是一個問號
那我換一個
舉個例子
就是說
我們現在可能會有一個Lama模型
對
如果我們想要通過一個強化學習去強化這個Lama模型的話
那麼我們原來能夠提供的這個例子是1-2-3
我是不是強化之後
給了那個強化的模型
同樣的例子1-2-3
它應該給我一個更好的結果
是
那這個模型本身變化了嗎
未必
還是
就是
就是我還是想說
就是
你是把這個看成了一部
對吧
就是我給了它的例子
然後我去
讓它調整了以後
整個模型變得更好
但是我在這一部裡面看到了兩部
一個是底層的模型
和它的這個reinforcement learning這一部
就是所謂的in-context learning的激活這一部
就是
就是這個人
可能還是同樣一個人
我不確定這裡應不應該打比方
Anyway
還是說模型吧
就是它的模型全這種仍然是這些
然後你的這個in-context learning
你把它
其實就是你那天說的這個non-parametric
parametric兩部
你把它看成一個系統的話
整個系統是發生了變化
但是你回到這個底層大模型的話
底層大模型是不是全中一定發生變化
我不確定
因為有可能底層大模型的全中不發生變化的情況下
你的in-context learning的能力是強的
你去追逐
你in-context learning這些例子回答得更好
去overfit這些例子的情況下
反而它的模型的能力
in-context learning的能力有可能會下降
這個我們可以展開
到時候以後我們可以接聊
所以其實現在業界大家並不知道在pre-chain之後還有什麼辦
pre-chain之後做的那件事情
有沒有可能改變這個
Foundation Model的這個模型全中
我們並不知道
在今天之前我的理解都是沒有改變
今天我會打一個問號
也希望觀眾如果
對我們當時可以再討論
對
這個可能是我理解上的一些偏差
我覺得
對
最好是我們可以
拆開再繼續
拆開討論
我們可以在群裡
也可以請到時候觀眾們來
確定知道的告訴我們
但是這個問題
再復述一下的話
就是pre-chain這大模型
在in-context learning之後
第一
in-context learning有沒有改變全中
大概率是沒有
沒有
但是第二
為了讓它的performance更好
它需不需要
或者是應不應該去改變模型的全中
在強化學習的過程當中
有沒有改變模型的全中
對
我的觀點是
是你的觀點是
我的觀點是distill
是better distillation
然後你的觀點是要改變模型的
我覺得它的模型的參數會發生一些變
其實就是因為前面
這個柯代表做了一個
這個clarification
就是你對於這個fine tune的這個定義
可能
我覺得可能是因為
因為大家現在如果在講fine tune的時候
可能更多講的是sft的那個環節
但是你這樣就會clarify
這個是不是因為在
傳統的mush learning裡面
當你講fine tune的時候
就默認你其實改變了這個模型的全中
你覺得如果我們用fine tune這個詞
就可能就默認了
我們在
其實sft這個過程是不改變
這個模型全中
這個就是我在寫另一個文章的
第二個問題的時候
我反覆跟人溝通
然後發現跟所有的
傳統的機器學習的人
但是沒有接觸過
或者說沒有對大模型了解
非常深或者非常細的人的時候
總是會出現的一個爭執
就是fine tune
尤其是對這個詞definition的區別
他們心中一想到fine tune
第一想的就是我去改變模型的全中
但是我說不對啊
你看只有incontext learning
你都不需要改變模型全中的情況下
也能給你輸出更好的結果
然後我就會發現
大家對這個詞的定義
已經產生了很大的變化
對其實剛才有一點
我覺得可以
我想繼續問一下
因為其實我們剛才提到這個
這個話題其實是因為
你聊到說
如果等到OpenAI開放了
這個RHF的這一些
更多的這個權限以後
我們有很多這個可以enable的東西
那也許有一些人會
就是那我想可能有一些朋友會想說
那到底開放這個有什麼
是我們現在不能做的
而你覺得說等開放這個全中
我們就可以做的
因為現在其實我們是可以做一些
一定程度上的這個SFT
然後還有包括這個
拉馬的話其實也可以做一些
就是你覺得開放以後
有哪些都可以做的
我先直接回答
然後再prompt Louis來回答
就是我先prompt他
然後再回答一下
這個可以prompt
我prompt他就是我們當時
聊到這個話題
就是因為他現在在做的這個業務
就是去做一個更垂直的模型
就是他們兩條
一個是應用市場上
一個是自己開發
然後我們當時說
如果JPT
如果OpenAI開放了這個layer的話
會不會所有的垂直模型
都沒有意義了
然後也很有可能是這樣子的
因為他模型performance好太多
他要能給你開放
這樣一個定制的環節的話
完全就把你們所有人群都淹死了
然後我舉一個例子
就是他開放能達到什麼程度
我舉的例子
現實中不會存在
但是他可以幫助大家思考這件事
就是我們現在人
是無法學會狗說話的
假設狗真的能給JPT
提供一個reward function
那你讓JPT去學狗叫
JPT很有可能就會學會狗的語言
不存在
但是或者說就是代碼吧
或者說是
那我說一個更實際的例子
就比如說我們的醫生
是很難訓練的
因為你很多知識不是是否問題
它不是一個rule based function
你看到了一些東西
你怎麼會得到這樣的診斷
其實不同的醫生
他給你的
根據他的經驗直覺什麼的都不一樣
但是假設有一個
我們有一個高質量的
這樣的一個數據集
就是說病例
所有醫生能看到的
收集到的所有信息
和他做出來的判斷
和也許他寫下來了一些判斷的
一些沒有寫
我們也許就可以拿這樣一個東西
去構建一個這個reward的數據集
然後讓GPT學會怎麼樣子
去進行專家級的
就真正專家級的醫療診斷
對這個知識
不是在現有的那個
所謂的案例庫裡邊直接存在的
GPT現有的能力
也許能去模仿一些人
在這個案例庫裡的對話
但是他得不到那個
醫生下診斷的那個知識
可是你如果有了這個reward數據集的話
GPT有可能就能得到一個
真正醫生的那個知識
明白意思
其實我就想先退一步說這個問題
就是我們首先我們想說
OpenAI可以開放一個可以定制化
或者個性化這個模型的這個服務
到底想我們要解決什麼樣的問題
可能有幾個東西是我們需要去做
個性化的
一個是它就是知識
你GPT裡面學習的知識
就是比如說我們簡單來說
就是Wikipedia
或者說我們互聯網上的文字
你上面獲得的這些知識
那有一些實際上是
專有的一些知識
比如說是就像你說的那個
醫療方面的知識
或者是法律方面的知識
如何讓這個模型去專門去複習也好
或者是專門去強調這方面的知識
就把這些知識放到它的參數當中
那可能是一個
我們想去做個性化的部分
這另外一個其實呢
更多的是
你已經擁有了這個知識
擁有了這種推理能力
那如何我去用一種方式
去把你的這個能力
應用在我的這種任務上
也是一種個性化的思路
那麼這其實往往就是說
我們可以說一下傳統來講
如果要去達到這兩個目標
我有一個比如說是白河模型
我們如果是
像GPT現在我們可以認為
對於我們個人來講
我們是黑河模型吧
那如果假設說我們像Lemma
或者說對於OpenAI
他們自己來講
這就是一個白河模型
就是白河模型
要去完成這個目標
可能去做的任務
稍微有一些不一樣
就是方法稍微有一點不同
這也是我經常收到的一些問題吧
就是如何去
把一個大語言模型
應用在一個特定的領域當中
那其實我往往就是想說
如果你要去學到知識
其實現在學到知識最好的方法
就是類似Language Modeling Task
一樣的方法
或者是Instruction Funding
所謂Instruction Funding
就比如說像Flyon
他們的做法
我有這麼一個問題
或者是有一個Fix-A-Pump
那就有出來一個結果
這種方法也可以學到知識
對
那麼我給了一
那Textbook的話
也是可以學到知識
我自己之前自己玩的時候
也去做這種東西
就是說你給他Textbook
做這種Causal Language Modeling Task
也就是Next Token Prediction
這種Task
它就確實會
等等
你說你自己玩和你剛做這個是
這相當於是我自己的一些探索吧
是在GPD之後還是之前
在GPD之後做這些探索
然後用的一些也是開源的這種
模型
Language Modeling Task
Decoder這樣的模型去做這種事情
然後我就會去
比如說
比如說我對房地產這方面的東西感興趣
然後我就把他們的教科書
教材
考試的題
全都變成
那個語料
收集下來以後
我去訓練這個模型
原來我同樣問這個問題
他會回答一個答案
也許他有一點合理
但是我
把這個教科書給他了以後
同樣這個問題他回答答案
他就會更像教科書裏面
講的那樣的答案
對
他就是
這就是像是選到了一些知識吧
那這種其實就是我覺得
像Cosmos language modeling會更合適的東西
那還有就是
還有一種
我這加個Pin
回頭再討論
你先繼續
好的
然後
還有就是如何去Format最後的結果
也就是
我有一個也是非常
Overloaded Term
就是Alignment
那如何把這個GPD的結果
它
也許GPD已經擁有這樣的能力
但是我希望你去完成的一件事情
或者是按照我的這個任務的
Format去完成
或者說這些步驟去完成
那這個時候
如果我能夠提供一些
比如說訓練數據的話
那其實
可以達到的就是兩個效果
一個就是
我不需要再通過
In-context learning的方式
去達到這個效果
因為In-context learning
我提供了一些例子
那它就可能Prompt更長
然後更慢
更加的貴
那如果我在之前訓練的過程當中
我就已經提供了這些例子
我可以提供更多的例子
我在去做Inference
或者說去做生成的時候
我就不需要提供
額外的例子去做這件事情
這也是它的一個好處吧
就是
我覺得也不能
這事就我們回到那個
Customization的好處
那我們這就又說到
我們不得不說就是強化學習
它到底開放的是什麼東西
我個人的觀點
可能和你稍微有一點點不一樣
就是
我自己覺得
你去開放
你要完成的
如果是學習知識的話
那是一個思路
如果開放的是
Format alignment的話
是一種不同的開放
如果你要開放強化學習
它是一種
第三種我覺得不一樣的
類型的任務
什麼時候我覺得用強化學習
我自己之前在想有幾個可能性
一個是說
你需要完成一系列
就A sequence of decision
而不是一個
decision
然後直接出一個結果的
比如說我們下棋
更像是一個
一系列
決定最後獲得的一個結果
這種東西我覺得更適合於強化學習
如果只是說
我說一個東西
回一個東西
然後這個任務就結束了
永遠都是這種就是一回合的
其實並不見得
都是適合
強化學習的
不見得是強化學習
也許就是我們所謂說的這種傳統的
方式去
微調模型會是更加
方便直接的一個方法
因為你會直接告訴他的結果
如果是一個sequence of decision
比如說conversation
就是一個sequence of decision
你回答一個東西
你說了一個東西
別人又說了一個
這個時候別人再根據你的回答
可能會說完全不一樣的話
對嗎
你完全猜不出別人可能會怎麼回答
在你說了這句話之前
像這種
一系列互相
depend在一起的問題
就更適合於強化學習這個問題