课代表立正

数据科学里的鄙视链的最顶端是机器学习,但是数据科学家真的适合专精机器学习吗? 在我看来,机器学习里真的有革命性的深度学习,瓶颈和回报都在「工程」而不是「科学」。视频里从成因、现状、未来进行了总结,请配合之前上传的鸭哥深度学习科普视频一起食用。

What is 课代表立正?

课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士

社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai

Hello大家好
欢迎来到我们课代表讲数据的第三期
这期西雅图的春天来了
然后我Yancy这个花也开了
我不知道是什么花
但是它很好看
于是我们就在这个花旁边来录一期
正好借着外面比较好的天气
在西雅图难得的好天气
来跟大家聊一个挺有争议性的观点
我觉得为什么大多数数据科学家
做Machine Learning是没有前途的
好的
上来先开宗明义
我觉得Machine Learning本身还是很有前途的
但是它不适合数据科学家来做
因为Machine Learning其实真正的价值
就是它发展到今天这一步了
真正它的价值和它应该做的事情
是工程问题而不是科学问题
所以说我们接下来会看到
Machine Learning还会有很多发展
但是更多的是应该让Machine Learning
Engineer来做
在这里边有少部分的人会去解决科学问题
但是绝大多数的人是没有条件
去解决这些科学问题的
我们现在看到很多公司还会招数据科学家
来做Machine Learning
但是慢慢的他们就会发现
招数据科学家来做这件事情
未必有招一个Machine Learning Engineer
甚至未必有招一个Sulfur Engineer来做
成效好然后节效快
之所以把比较争议的观点抛出来
是因为我现在看到很多
做数据科学的小伙伴
学数据科学的小伙伴
他们还是觉得学数据科学
就应该去做Machine Learning Model
但是又没有去真的提高自己的工程能力
这样子我就担心大家做到最后
把自己饭碗做没有了
这期视频我分两部分
第一部分就是讲我这个观点
我会先说一下什么是工程问题
什么是科学问题
然后为什么Machine Learning
走到今天这一步
绝大多数都是工程问题
而不是科学问题
后面我再会用一些故事和例子
去跟大家讲一下
为什么我看到了还有很多公司
去招数据科学家来做Machine Learning
而不是招工程师来做Machine Learning
但是在大厂尤其是一线大厂
像亚马逊Facebook这样的公司
绝大多数都已经是招Machine Learning Engineer
而不是去招数据科学家来做这些事情了
第一部分先讲科学问题和工程问题
这个问题稍稍有点复杂
我们也会用Machine Learning里边具体的例子去讲
但是从一个非常广的概念来说
我觉得科学它要懂得为什么
但是工程它要想怎么样子做得好
所以说你工程问题最关注的东西
是怎么把它做好
它不需要关注为什么它会做得好
你当然知道了为什么能做得好以后
可以帮助你更有效的去找出做得好的方法
但是你未必是这个东西不是必须的
比如说很多时候人们知道飞机能飞
然后知道一些流体动力学的东西
但是大家对流体动力学并不是完全的理解
可是我们可以在不同的试验中
找到这个东西的最佳方案
飞机就能飞得更高更快更省油
所以说流体物理学是科学
但是流体物理学的实践
甚至说有的时候是脱离流体物理学的实践
我在做第一件东西的时候
我未必需要知道流体物理学的知识
我只知道我做成这个形状它能飞就行了
回到Machine Learning有两个特性
是导致它的工程回报远远大于科学回报的
第一个它是一个black box
所以说很多时候决定了它只能用工程的方法
去让它变得更好
而很难用科学的方法让它变得更好
第二个现在它的应用远远没有到头
所以说只要你用工程的方式投入下去
更多的数据更强的算力更大的模型
你就会performance更好
所以说大家还没有动力去在科学上进行那么强的突破
我们先讲第一个
我上一期也讲了deep learning它到底是什么样子
你简单的去想你有一个大家看到的数据
然后你用deep learning把它搞得乱七八糟
就是用一堆完全乱七八糟的数据
但是你有很强的算力
你就可以在这一堆乱七八糟的数据里边
把它联系到一个结果去
你这样再来新的数据以后
它用现有的规律
它就可以去给你一个新的prediction
就是你这个新的图
比如说对应的结果应该是什么
可是中间的环节
就是把一个你看到的x变成一堆乱七八糟的数据的环节
它就是很难解释的
Facebook有一个非常有趣的发现
它让人一堆专家去预调一堆网络
然后让机器去随机生成一些网络
最后发现专家预调的这些网络
它的performance并没有比机器随机生成的网络要更好
所以说现在deep learning的很多application
最好的方式就是你提高你的算力提高你的数据
然后夸一把缩然后就行了
你就能得到最好的performance
一堆人去那思考这个东西怎么样子去做得更好
未必能得到特别好的结果
如果你对这个结论不是完全确定的话
我也会请我一个朋友亚哥
他是这方面的专家
我们会出一个40分钟到一个小时的deep dive
我们会把整个原理完完全全的讲通
然后把几个重要的论文全能讲通
然后再去讲一下业界最cutting edge的research
总之在这你先相信这个结论
就是说deep learning很多时候是一个black box
你不单从科学的角度很难解释它是怎么work的
有的时候你解释清楚了你也不能做得更好
所以它就是一个工程理解dominate科学理解的这样一个use case
另外一方面就是deep learning
它在工程的应用上还没有达到一个瓶颈
也就是说你只要给它更多的数据
只要给它更强的算力
只要你能建立一个更大的网络
你的performance就是会变得更好
所以说这就是为什么
很多公司都在讲machine learning machine learning
真正的deep learning state of art的技术
永远掌握在几个巨头手中
就是他们手里能掌握的数据和算力
不是一般的公司能想象的
所以说他们的performance也远远超过了一般公司能达到的程度
所以说真正懂machine learning的这些公司
他们无一例外都是去走向engineering的这条路线
比如说你在亚马逊
你会看到真正做machine learning的那些人
它叫apply scientist
就是说你是一个scientist的情况下
你要过程序员的coding bar
你要能写production code
然后你才能做apply scientist
在facebook干脆就直接叫machine learning engineer
它不叫data scientist
它就叫engineer
你如果做machine learning model
大家已经意识到了
这个东西是你把市面上现有的这些solution
拿过来做一些工程上的优化
然后去不断用工程的方法去得到更好的结果
而不是用科学的方法得到更好的结果
既然事情是这个样子的
为什么还有很多企业找data scientist去做machine learning呢
我觉得有两个原因
第一个是machine learning这一行
虽然想要做好非常难
但是它的入门门槛很低
而且它入门又和做data特别相关
所以会让很多data scientist
他一上来
很快的就能得到一个做machine learning model的能力
写在自己的简历上
未必能做好
但是起码这个东西是可以写在简历上的
另外这些公司
尤其他们的leadership
或者senior leadership
他不是真的懂machine learning
他不知道machine learning到底怎么样才可以帮助他的业务
但是他们又很需要machine learning
尤其是在他们对向上回报的时候
他们就想我这个业务是用人工智能去做的
然后他们就听起来很厉害
然后在周报上
然后大佬们纷纷鼓掌
这种情况下
他们会害了一个人过来
然后去做一些看似好像还不错的这种demo model
但是其实对这个业务未必有什么真正的价值
未必有什么真的帮助
与此同时
你如果真的是觉得machine learning对你的业务很有帮助的话
你招一些machine learning engineer
价格会更快的
我把这两件事稍稍展开说一下
就是machine learning的入门门槛非常低
它是什么意思呢
就是现在绝大多数的machine learning model
它有现成的包或者现成的平台
比如说Keras、PyTorch这样的
你很多时候去调个包
然后你只要能知道怎么把数据给导入进电脑里边
然后怎么样子去把它按照规定的格式
把它分成training data分成testing data
然后你知道怎么样去调用那个函数
怎么样去调那个包
然后怎么样去specify你的parameter
怎么样去search或者optimize你的parameter
然后就行了
然后你就可以直接train一个model
这个model还是work的
其实这里边比起那些传统的统计知识来说
它的入门门槛实在是非常低
所以大家看到市面上绝大多数的
data science或者data analytics的master program
它都有一些课教你怎么样去做machine learning
你上网去上一门网课的话
再下可能有10个小时也就学会了
可是你学了这个东西以后
进了公司真的能为公司创造什么价值吗
这个时候在公司里边做machine learning的人
很多时候反而是做的to leadership ML
而不是一个to customer ML
就像很多创业公司之前说我们是to C,to B
最后发现的是to SB
就是to self bank,to软银
你这个创业公司是为了投资人看了
是为了给软银爸爸看的
而不是真的为了解决一个问题
同样的这些machine learning model
它也是给leadership看的
这个在泰克公司可能还不是那么强烈
我认识了很多在传统行业的data scientists
大家在聚会的时候都会介绍说
我是一个data scientist
我现在在做一些machine learning应用
比如说NLP,比如说random forest
比如说forecasting等等
然后他们来自的公司也大多数来自于
传统公司的一些比较新的部门
比如说化妆品公司,百货公司
或者说是银行,电信公司等等
他们这些新的部门想做出一些成绩
想做出一些不一样的东西来
他们会去说我们现在有data scientist
然后用machine learning帮我们去解决一些问题
但是仔细去听一下的话
发现大多数解决的东西是一个委需求
就比如说吧一个化妆品公司
它用natural language processing
去看它的网站上留的customer review
的sentiment到底是好还是坏
在我看来就是你给customer一个五星
让大家去点评价就好了
五星是好一星是坏对吧
你需要用一个nlp去得到sentiment吗
那下一期视频我也会从一个顶层设计的角度
去给大家讲一下
市面上什么样子的machine learning model
才是真的有用有价值
并且skillable的machine learning model
而且互联网的很多公司
就是被这些非常厉害的machine learning model power的
比如说各种广告
比如说抖音
比如说Netflix,Spotify,YouTube
都是这些非常牛逼的machine learning系统的结晶
那我们这个话题就下次再说吧
那这些话题稍稍recap一下
machine learning 这个鄙视链顶端的技能
绝大多数时候是工程问题
而不是科学问题
就是不排除有的人
就是非常顶尖的一些科学家
他们是可以做科学
然后去push整个field的frontier
但是这些人一定是在最顶级的学校
和最顶级的公司里面才会出现的
绝大多数的公司是没有资格谈这个的
对于我们绝大多数人
machine learning 虽然是很有应用价值
但是如果说你真的想做machine learning的话
你要提高的是你的工程技能
你要知道你之前学的关于数学统计的
绝大多数知识
在machine learning之前是没有什么太大的用处的
最后就是希望这个行业其实早早的恢复正常
就是不要让大家把那么多时间
花在一些没有用的事情上
就是你为了听上去好听
我们再用machine learning
然后去做一些非常没有价值的东西
然后偏来偏去
就是你骗 leadership
leadership 骗投资人
但是到最后用户消费者并没有得到任何好处
也耽误了很多人的青春
好的
这期视频就到这里
最后再
拜拜
下期再见