课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士
社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai
很多人觉得NLP在大约模型出来之后
整个field就翻天覆地的变化了
然后有的人可能觉得保尔应用更广了
然后有的人觉得这个field就完了
就没什么好做的了
又能不能给大家一个你的感觉
和你的一些想法或者是观察
真正领先一个时代的技术
都是掌握在少数人手中的
不被大家认可是一个常态
慢慢的这个东西都会被人认可
DeepSync它一个很不一样的点
就是它在工程上的这些创新
然后它可以把价格变得很低
然后能变得非常efficient
运作需求更少
或者说是infrast成本更低等到
但是它们这是一个很明显的
application driven工程向的东西
你说的东西好像和它们很接近
但是听起来又是research
你觉得这两个是一个东西吗
还是其实是不一样
比如说DeepSync的这些东西吧
它们能发一个顶刊呢
今天给大家带来两集
跟哥伦比亚大学渝州教授的访谈
大家知道我平时不专门做嘉宾介绍
但是因为渝州教授在我的这个访谈里边
做的自我介绍太低调了
我觉得没有办法表现出来它多厉害
所以说我就专门去做了一下research
然后去讲一下渝州教授的这个履历
希望这个例子也可以帮助大家
稍稍多理解一下一个厉害的学者
他的履历是什么样子的
以及这样大家看视频的时候就知道了
渝州教授是多么的谦虚和低调
我在这里边简单讲两个点
一个是渝州教授的学术影响力
一个是他的业界影响力
渝州教授的学术影响力是
他的论文引用是8640
人体指数高达47
8640引用虽然很高
但是不是一个特别天文的数字
但是我们要知道渝州教授
是2017年开始做教授的
而且他的这个大部分引用
大概近8000次都是来自于2020年之后
像是高度契合当前AI领域的热点
所以说也是被广泛应用的
而且他的实验室也非常厉害
在2024年一年内
就获得了ACL和NAACL的两个杰出论文奖
这是自然语言处理领域的两个顶会
获得一个顶会已经很难得了
在一年内同时获得两个顶会的
这种成就更是奉猛领奖
也就证明了他这个实验室
研究的质量有多高
那除了引用和奖项以外
在业界渝州教授还在2018年的时候
就入选了福布斯杂志科学领域的
30位30岁以下先一把
注意就是美国的福布斯是有含鸡量的
不是国内的那个30&30
然后在2018年的时候
他带领团队赢得了
亚马逊竞争激烈的
Alexa Prize的挑战赛
他们开发的社交聊天机器人
也获得了千万级别的用户
余教授还得到了很多公司
比如说IBM、Sony、沃尔玛、腾讯等等的
研究奖或者教职奖
也代表了业界对他工作的认可和追逐
而且这段时间余教授一直在创业
他现在创业的这个项目叫Arklex AI
是致力于将前沿的AI agents的技术
运用在各个场景
比如说AI销售
所以说我们频道上业界大佬聊得很多
但是像这种横跨学术和业界的人聊得不多
总而言之余教授是一个不可多得的
在学术界非常有影响力
然后在业界也有很多成就的人
而且他还去做创业公司
我们的两集视频
上集聊学术下集聊应用
尤其上集的问题就是自然语言
余教授已经在这里边学了这么久了
他被大语言模型是怎么颠覆的
然后AI研究对AI应用到底有什么意义
什么才是一个好的AI研究
比如说Deep Six是一个好的AI研究
那下一部分就讲余教授在做AI应用的时候
他有什么经验教训踩了什么坑
然后他哪怕有这么强的学术背景
有这么多的创业经历
而且跟很多大公司合作过了
他现在在创立Arklex AI的过程中
又遇到什么样的挑战
那如果像这么厉害的人
都遇到这些挑战的话
那我们每个人也应该都humble一点
对创业这件事情多一些敬畏之心
还有一个点就是余教授跟我聊的时候
我当时都没有注意到
就是我知道他怀孕
但是我不知道他已经离生产这么近
在我们访谈结束之后的一个周之内
余教授就去生二胎
然后生完二胎以后马上又投入工作了
那这个访谈也是非常有意义的一个时间点
那好这里就给大家带来
哥伦比亚大学的余洲教授
Hello 你好
大家好我叫余洲
我现在是在哥伦比亚大学做教授
同时我也自己创业做了一个公司叫Arklex
我们主要是做AI Agent Orchestration Layer
我们有Open Source
也有Enterprise Version
也有一两个我们称之为Vertical Sass
来帮助我们更好的实现我们这个Agent的
这个validation
然后我自己的背景是
我在中国读的本科在浙江大学
竹科真学院读的积能基和英语的双学位
然后在本科的时候
我就接触了AI做很多Machine Learning的工作
然后有一些Application
就包括有一些Computer Vision的Application
也有一个Machine Learning
就是Driven的Machine Translation
就是从英文翻译到中文中文翻译到英文这样
然后本科毕业了以后
我就直接到凯奈基美龙读PhD
然后之后我在PhD毕业了以后
我就马上做了老师
我先是在UC Davis做了三年老师
然后我part time也在UC Berkeley做一些
collaborative research
之后我就搬到纽约
在哥伦比亚大学做老师
也做了有四年多了
四年多快五年
然后一直都是做National Language Processing的
然后人家可能有时候会问
就是哪个是你的major conference venue
或什么
我的major conference venue
就是我们说的ACL
Association of Computational Linguistics
同时因为像我们做这种
更偏向于Deep Learning
或者是Large Language Model的组
我们也经常会出现在像Iclear
Neurse
ICML的这些会议里
包括因为我们做的比较general
做argorithm的
所以说我们也会投
比如说CDPR
有的时候甚至会投robotics
会议像Iros等等
所以说其实我们做argorithm的话
就是根据application不同
我们也会选择不同的application track
就比如说我也会有比如说
double-double paper
也会有rexist paper等等
我自己本来做research就是做
最早是做conversational agents
然后现在agents的话
你可能想一想就说
之前是只能说话吗
现在可以做action
然后可以做更多interesting的planning
argorithm
我们以前也本来就是做各种RLR
等等的argorithm
去做sequential decision
然后我们现在做到agentate task以后
就有更多丰富的
场景
各种各样的use cases
然后我们就做了很多argorithm wise
怎么去做efficiency
怎么去elicit better
large language model behavior等等
然后agentate task可以完成的更好
完成的更快
in general就是我们做的比较多的research
然后我们就spin off了一个
我们的公司
就是做open source的agentate
orchestration layer
这样帮助大家可以更好的去
用我们提供的这些tool来更快的build agents
这样子不用重新做很多engineering的工作
然后argorithm也已经有了
已经train过了
这样子可以提到一些base的performance
你说你之前做这个
你在学术界应该也做了蛮久
然后你之前做的那个是在大元模型之前的
是吧
我们很早就开始做了
就是以前只有machine learning model
没有neural networks的时候就开始做nlp了
对我是2011年还是读phd的
就是做natural language processing
然后我本科的时候也是
对我本科的时候就是做machine translation
这样子nlp task
我是技能机系和原学系的双学位
然后之后在cmu读的nlp
然后毕业了以后也一直是做这方面的研究
做有十几行年
快要死
对
刚才我们聊了我觉得有两个问题
特别想问你
就是你的创业公司archlex
然后他对AI agents
然后你对field是怎么要理解的
然后你在这里边做的工作是什么
你觉得大家平时要去学习
或者说在这里边有什么待解决的问题
然后另外一个问题
也是很想给你请教一下
你是做nlp做了很久
然后很多人觉得nlp在大元模型出来之后
就整个field就翻天覆地的变化了
然后有的人可能觉得反而应用更广了
然后有的人觉得这个field就完了
就没什么好做的了
因为之前所有需要被解决的问题
现在成了被解决了
对我不知道你是能不能给大家一个怎么说
你的感觉和你的一些想法或者观察
对其实我们这个field怎么说来
就是大家都是可以看到有特别多的
development over time
然后可能我是觉得是一个好事
就是我们变得越来越popular
就比如说我们的会ACL
然后我们刚去的时候
我11年读的PhD的时候
那就是几百个人的事情
然后现在有几千个人
然后同样的像nlp
都有一个爆炸式的增长
从我的角度来讲
是一个越来越大的community
大家也放了特别多的resource
然后因为特别exciting
attract了最好的学生来做我们这个事情
所以说相对而言
我觉得是一个非常fortunate的事情
我可以跟全世界最优秀的人一起work
对我来说是一个非常exciting的事情
当然同样在这个竞争也是非常的激烈
因为这个不仅是你学术界做这些事
而这个industry有特别多的deep pockets
也在做同样的事情
所以你的竞争就特别激烈
然后导致你需要实时更新你自己的knowledge
同样你也会有这个压力是说
在我们资源不同配置的情况下
什么样子可以是你的unique的一个pass forward
但每个人在某一个时间段
他都会有一个
extensive black crisis
就是我要怎么样重新reinvent myself
every3 to 5 years
但是我觉得总的来说是一个好事
那就是举一个这个fac就是说
我是2017年毕业的
就是大概是在neural network开始兴起
是在14 15年开始
那我们是比较早去adopt neural network的
这样子的工作的组
然后当时也是因为这个neural network带来了
第一波的这个ai boom
大家看到这个image recognition可以做的这么好
就是这个可以商业化做落地
然后很快大家都有一个就是业界觉得
这个特别有意思
然后想要招同样的phd
然后master和undergrad也都想要上这样的课
然后突然需求量就增多了
那在academia就突然就有了招nlp的职位的
这个机会
就是如果你看2014年2015年
这样子的职位是几乎没有的
就是非常competitive
可能整个一届也只有招一到两个新的老师
而且这就是一个萝卜一个坑
对就是一个非常exciting的时代
因为我当时2011年的时候
就是开始更系统的做这种nlp的research的时候
其实它的唯一的应用可能就是Google的
这种information search
就叫information retrieval是挺火的
对真正的到比如说后面的translation
就是speech recognition
其实还是有一个小的gap
然后之后到2015年
我这个speech recognition的能力突然上升了
然后machine translation的能力也上升了
然后computer vision的recognition也上升了很多
然后就open up to a lot of new opportunities
然后我们学术界也有这个boom
然后工业界有这个boom
其实这两个之间稍微有一些delay
但是总的来说
是整个方向变得招的人更多
然后大家也更愿意在这里做投资
所以说我们在2017年左右
就是开始慢慢的教职就增多了
然后比如说像平时
像我刚phd毕业的学生很难找到教职
我们当时就非常幸运的就找到了教职
然后又过了三年以后
就是开始deep learning
慢慢就是越来越火
然后更多的学校说
我也想要有一个做nlp的老师
以前top30的学校
并不一定每个学校都有一个教nlp的老师
然后于是就open up more opportunity
那这样子的话就有更多的新的老师来被招聘
然后有一些老师也可以move到更好的学校
这样子总的来说就是一个欣欣向荣的过程
然后因为这个投入
甚至于large language model之后
这个系列界投入就更多了
对于我们来说
我们拿funding也更容易
然后我们的学生也更容易拿到教职
我们也更容易做tenure
所以说整个来说是一个好事
我想double click on这个
就是large language model之后变多了
机会变多了这件事情
因为之前很多人会觉得
之前有的人会觉得
我甚至可能也是其中之一
就是nlp所研究的问题都直接被解决了
然后可能很多时候一个phd的research
变成了一个api call
然后就行了
好那在这种情况下
研究nlp还有什么值得研究的这种感觉
就是你要么就是说你是研究大远模型的
要么你这个nlp还有什么值得研究的
或者说大家会不会注意力全都到了大远模型那里
对这个其实是工业界或者是一般人的一个misconsumption
因为我们做research不是说是一个final product
而是一个process
是一个怎么解决问题的过程
并不代表说你一时做的一个paper
可能过了一年它没有再多的利用价值
它这个就是没有用的
因为我们更多的我们是做一个argorithm
这个argorithm和新的technology可以做combination
不是说它就会完全覆盖我们原来的
argorithm的能力
也有很多东西
就是很多大家觉得这已经solved了
但其实它完全没有solved
因为它有很多corner cases
怎么做得更efficient
更robust
怎么可以做reducing cost等等
在不同的应用环境
比如说multimodal fusion等等
有很多东西是没有解决的
大家可以看到的这些东西
我们只是觉得是一个非常底层的一些sail layer
当然像我的话
我是一直有一个open minded的事情
比如说我最早是做我的PhD的see this
叫situated awareness
interactive intelligent system
其实就是现在大家说的multimodal agents
对
只不过我们当时因为确实是没有这些API
我所有的module我都要自己写
然后都是要在这个说人家说要花很多的
投入很多的时间来做这件事情
那就是说做research的话
你就是不能说只做现在能做的事
你需要one step further
就是说我assume两三年以后
这个东西会更完善的情况下
我在这个基础上可以做什么样跟futuristic的
research
比如说以前我们的speech recognition model
都是自己写的
computer vision model都是自己写的
当然它有很多的error
它不过robust不好
但是它在这个搭起来的system
可以explore的东西还是类似的
现在我只是把这些原来自己写的比较
low quality的module换成了新的大家已经package好的API
其实这个东西是整个的research
direction没有change
只不过我觉得就是对新的写生来说
这个barrier降低了
对你能研究的东西变多了很多
但是你刚刚说的点我再问一个点
就是你提到了这些算法本身的价值
和没有被解决的问题
比如说怎么样子更efficient
corner cases然后cost这些
然后这就让我想到了最新的deepseq
然后deepseq它有一个很不一样的点
就是它在工程上的这些创新
然后它可以把价格变得很低
然后它training变得非常efficient
用的运作需求更少
或者说是influence成本更低等等
但是它们这是一个很明显的application driven
然后是一个工程向的东西
你说的东西好像和它们很接近
但是听起来又是research driven的东西
你觉得这两个是一个东西吗
还是其实是不一样
research其实分很多种
对吧efficiency的这些也是research
然后当然你push boundary
就是说做到state of the art也是research
但是其实有不同种的方式
从我们的角度来讲
就是说这个东西是不是novel的
有没有人做过
它是不是提供真实的价值
这个是大家就说评价
research的taste
你刚刚说的这点就是
我就是要challenge一下
因为research community
大家也有过很多critique
比如说deep sick所应用的这些东西
它们是不novel的
据我所知
但是它们结合的非常好
和应用的非常好
最后产生了价值
你觉得就是比如说deep sick的这些东西
把它们能发一个顶坑吗
这个这样的问题
我觉得还是它其实有挺多的贡献
对吧
但是我觉得现在有一些人可能夸张了
它的贡献
但是我觉得从我的角度来讲
我是非常推荐sasha roach
跟他deep sick explain
基本上跟我的观点是aligned
我觉得它最重要的contribution是在于说
它重写了底层的架构
让可以training model pre-training的过程
变得更efficient更神鲜
这样的话
open up很多possibility
去用更低的成本去做更好的model
它本身也是一个research
其次确实就是从argorithm的层面来讲
它的contribution没有那么大
因为moe等等之前也都有人做过
但是它的contribution在于说
它把它具体是怎么做的
写得特别细
这个有
然后open source一些它的model
web等等
它就会促使整个community
有更多的人可以做同样的research
同样的比如说它有一些
比如说reward model怎么设置
等等
确实有很多人也做
包括我的组也做这些类似的工作
不是说completely new
但是同样的这些components组合在一起
也有它的意义
也不是说到徐破天津的时候
新的transformer based model
它完全的efficiency revolution model
对吧
然后我再从另外一个角度去问
一个类似的问题
就是对novel的定义
again又是大家的critique
我觉得正好好不容易逮到了一个
学术界的教授
然后我问一下这条问题
就是你提到transformer
然后transformer当时出来的时候
大家觉得它是徐破天津吗
第一
第二就是我记得好像openAI说他们的
GPT3
然后去投conference
投典绘
然后典绘不要
然后后来他们就不投了
对这两个怎么看
因为我从我的角度来讲
真正领先一个时代的技术
都是掌握在少数人手中的
所以说不被大家认可是一个常态
就慢慢的会这个东西都会被人认可
只是需要时间
越是novel research
越不会被之前认可
比如说像transformer这样的工作
它确实
其实刚开始attentional
in need在很多应用里面
就是挺有意思的
大家觉得
然后慢慢的我们给它各种各样的
第一的做pre-training
然后特别是GPT3的话
我们看到emerging ability
这个对我们来说都是非常surprise
因为我们很早
我们因为走过全程
我们很早就也自己pre-trained model
也自己做GPT2的发言体来等等
当真正发现到GPT3的时候
它跟GPT2的performance完全不同
它有一些emerging ability
比如说in-context learning等等
是我们原来完全没有想到的
这个点它本身
就是真的对我们来说是一个
非常groundbreaking的research results
你觉得它涌现的能力到底是为什么
就是emergence这个事情
对吧
就是我们知道它可能在什么节点涌现
比如说到了什么样的参数量
或者说你读了一些代码以后
它涌现了in-context learning
但是为啥
我们都是认为就是说亮变引起质变
同样的这个人也是一样的
对吧
你小朋友他到某一个点
他突然就理解到很多东西
就是他需要这个过程
比如说我们之前做很多
比如说CD有很明显
就是self-supervised learning
就是说我们不给他很多这种人工
pre-curated data
而是让他在自然环境中可以
生产的这种synthetic test就让他学
因为这些test他收集的成分比较低
当他这些test足够多的时候
他可以simulate整个world工作
然后突然这个model就学会了
然后我们自己也做了很多工作去analysed
就是说为什么比如说in-context learning是出现的
我们有一篇ICML的paper
就是去年讲是什么东西
illicited了这个in-context learning
然后我们发现在很多的pre-training
的这种
Corpus里面
有一种我们称之为parallel structure的东西
他比如说我们举个例子
就是一个语言
本身是有structure
他句子和句子之间也是有structure
您可能看不出来就是这个running text
但是你如果仔细分析是会发现的
就我们举一个比较简单的
在中文的一种修辞
穿着为副啊
新啊等等
对吧
他是他这个repetition
就是说这种partum
他不只是在我们说的synthetic里面
在symptex里面
或者discord里面
也有
这个在我们在分析了以后
如果你把这一些东西给它打乱了
再去train的话
他就in-context learning ability就没有了
就说是他somehow这个model take
advantage of这些information
他自己学会了这个partum
于是他就有了in-context learning ability
那我在这个地方我就稍稍收一下
就是
所以说请你如果做一下几句话的总结
就是why a large language model work at all
你会怎么总结
就是给一个小朋友解释这件事情的话
你会怎么解释
就是large language model会work
是因为
这个大的模型
它有很大的capacity
当他接受到足够多的信息
我接受到足够多的supervision以后
他会自己generalize他学到的知识
这样子的话
他不简单的就是copy
原来他学到的东西
更加会extrapoly新的东西
好的好的
你帮了解释
那接下来就是关于研究这方面
你还有什么想聊的东西
嗯
从我的角度来讲
就是说研究和实际的落地是有很大的差异的
其实现实生活中
这个模型他学到的东西
他可能跟人学到的知识不是一回事
他有自己的逻辑
那我们需要的experimentality可能对他来说并不重要
因为我觉得我已经有点out of my depth了
有很多东西可以做
那什么东西值得做什么东西不值得做
这件事情大家是怎么衡量的
而是large language model对NLP带来的
你的研究方向什么等等这些东西
没有什么特别本质的变化
你说自己是最好的没有人信你
因为所有人都在说自己是最好的