课代表立正

最近网上经常有人说数据科学家是一个可有可无的职业,引起大家很多焦虑。Meanwhile,数据科学家在Facebook工作得却特别爽 — 工作价值、存在感、话语权、影响力、主动性,都非常高。 但是这些并非来自于强制的「安排」,而是自然的「结果」。我们一起总结出来四个方面,分别是Infra、文化、组织结构、商业模式,导致了数据科学家在Facebook能更好地产出更有意义的分析,更好地提升自己的影响力、以及进阶自己的职业。 那就来一探究竟吧!

What is 课代表立正?

课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士

社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai

包括在Data culture背后所需求的Mirror Tocracy
或者说这些Ap Testing
也让Facebook的数据科学家
不会去追求那些Fancy的Model
而是去提供真正有价值
真正经得起考验的这些Data Insight
他们不会把时间花在嘴皮子上
而是真的去寻找
数据怎么样子为这个产品和Business提供价值的
这件我觉得非常非常重要
Hello 大家好
我现在的工作是在Facebook作为一名数据科学家
我发现在Facebook数据科学家的工作非常重要
无论是工作价值、存在感、影响力、话语权、主动性
都非常非常强
可是与此同时
在很多公司Data Scientist感觉自己的工作发挥不出价值
甚至网上盛行有Data Scientist
是一个可有可无的岗位的这种言论
很多Data Scientist或者想做Data Scientist的同学
看到这些言论以后
也会对自己的前景产生焦虑
那我们这期视频就来Po稀一下
为什么数据科学家在Facebook工作的这么爽
从而帮助大家从一个顶尖互联网企业的应用案例中
来寻找数据科学到底能产生什么样的价值
其实我从亚马逊跳到Facebook的时候
我对这件事情并没有一个完整的认知
但是我那个时候的Mentor就跟我说
YZ你要是成为一个有价值的数据科学家的话
你也要小心
就是你的Team会feel crippled without you
他当时跟我说这个的意思是
让我尽量多做一些Data的education
多enable我的Team在没有我的情况下
也可以做一些分析
然后来unblock themselves
这一点先放下不说
但是他说的这些话
确实从一个侧面体现了数据科学家
在Facebook是有一个多么不可或缺的角色的
那说到这儿呢
大家可能就好奇
是不是数据科学家在Facebook做的事情特别不一样
他们到底是做了什么不一样的东西
导致他的角色这么不可或缺呢
我一开始也是这样想的
但是我后来跟很多公司做数据科学的小伙伴进行了沟通
就问他们数据科学家在他们公司做什么
我会发现大家对数据科学能做什么
和想做什么这件事情的认知是差不多的
就是大家都是还有数据科学家来做这些事情
可是最后数据科学家真的做了什么事情
和理想就会很不一样
我觉得在很多公司呢
想的是这样子
但是他实际是可能在这儿
但是在Facebook就非常非常接近
就是他达到了一个数据科学家非常理想的状态
所以这就很有意思了
所以他说明数据科学家在Facebook发挥的作用
是一个结果而不是一个原因
或者换句话说
不是因为小扎比起姐夫
他就是知道数据科学怎么用
所以说他给数据科学安排了很重要的岗位
而一定是Facebook这个公司
它有一些特别的地方
特别适合数据科学家在这里面发挥价值
所以说我们搞清楚这背后的原因的话呢
我们就可以知道在一些其他的公司
怎么样子让数据科学家们
发挥出他们应有的那些价值来
于是想清楚了这个思路
我就从这一方面开始入手去观察总结
包括采访很多Facebook内部的数据科学的大佬
包括有一些人他们是见证了
Facebook的数据科学是怎么从无到有
一步一步搭起来的
我也着重采访了一些从别的公司跳来
Facebook的数据科学家
和从Facebook跳去别的公司的数据科学家
这样多了解不同公司的差别
就可以帮助我更好地总结这些事情
在采访了这么多人之后呢
我总结出来了四个大的方面
是可以帮助数据科学家
在Facebook发挥更多的价值
然后有更多的成长的
这四个方面分别是
Infrastructure
文化
组织结构
和公司的业务形态
接下来的视频呢
我会把这四个方面剖开来分析
我会把每个方面都给分成两个小点
然后我会举一些具体的例子
讲一讲Facebook现在到底是什么样子的
我也会分析一下
为什么他的这件事情非常有利于数据科学家
去发挥自己的影响力
和数据科学家的成长
那好
我们就从Infrastructure开始吧
Infrastructure好
是可以极大提升数据科学家
能做的事情的范围
和提高数据科学家的效率的
在这我分成两点
一个是他的这个Data pipeline的这一些
另外一些是他的Analytical tools这一些
所谓Data pipeline
所谓Infrastructure在Data pipeline这一步
是在Facebook
大家的login做的还是非常非常全的
所以你能想象的
用户在Facebook上产生的各种行为
他在隐私的requirement之下
都是被非常好的给log了起来
而更关键的是我们的Data engineering
非常非常强
所以Facebook一直是在用业界非常领先的
大数据工具去管理这些东西的
比如说我们Hive table很久以前就在用了
然后我们的Corey现在主要是用Pristol
但是还有一些更快的东西来
比如说Facebook有一个专门的Scoop by table
我这也会放一个link
就是你可以在一个PB级的数据里边
real time去得到你去达到你想要的一些数据
在这里面当然就是有一些join是不能做的
但是你可以想
就是如果你写一个Scoop by Corey
然后你只要group by
然后或者说你只需要filter
但是你不需要join的function
那在一个PB级的数据
你可以得到一个real time的数据
而且这个东西是几秒钟
就可以把这个数据给拿出来
在遇到这些工具之前
我根本就不能想象天啊
这么大的数据竟然还可以这么快的就可以得到
在这之上我们的data pipeline也做得非常好
data的管理也做得非常好
比如说你能看到什么data
你不能看到什么data
你要看到一些其他的data
你要申请什么权限
这些东西都非常清楚
所以你想要分析的数据
只要它存在
而且policy允许你拿到的话
你很快就可以得到这些数据来进行分析
而且他们log的是非常干净的
很多数据的质量也都是非常高的
这个和我见到了其他公司都有非常大的区别
我知道很多小伙伴在其他的公司
他们想做一个分析
可能80% 90%的时间
都花在清理数据和捞出来自己想要的数据上了
如果你想到
如果你想要跨部门的去拿数据
很多时候就更加难实证是一个不可能的
甚至是一个不可能的工作
这些烦恼在Facebook基本上都是没有的
那是省下来的80% 90%的时间
你就可以去做更有效的产出
接下来第二点就是背后的
analytics tools发展的也非常完善
所以说你在写query
包括这些query的version管理
包括你可以去随时随地的去看任何一个人
他之前写过的query
然后这些query写出来了以后
你就可以通过一些图形界面去把它形成dashboard
然后还可以直接发表在一些地方
而且在这过程中
你还可以跟我们内部的这种Python notebook进行连接
大家都可以非常方便的搜索
不光是搜索自己的工作
也可以搜索其他人的工作
发表或者说是协作都很方便
所以我比如说刚进组的时候
我对组内的数据很不清楚
我就直接去看一下我那些在组里待的时间久的同事
他们写的query是怎么写的
然后我再去看一下我们组里的那些dashboard
这些dashboard都是被deverified data
我看一下他们dashboard背后的query都是什么样子
很快的就对我们组需要用什么样的数据
从哪用
然后需要加什么条件
有了一个初步的理解
更重要的是Facebook的AB testing背后的实验analytical structure
也是一个非常完善的界面
这个地方我觉得需要单独开一期视频去deep dive一下
在这我就不详细阐述了
就是他的在Facebook做AB testing
engineer直接就可以做
然后这个工具就可以告诉他
你需要track什么样的数据
你需要有什么数据来做你的gutrail
然后有什么数据是company critical
你在这个时候做的时候
你需要把它expose去多少人
你现在的exposure是不是够的
如果你想要得到statistic的数据
你需要再增加多少exposure
你今天的结果是不是significant的
你的decision到底应该是什么等等
总而言之这些工具的存在
是让数据科学家那些可重复的工作
很容易的就可以自动化
不管是你data visualization也好
不管是你做实验也好
不管是你做分析也好
只要这件事情是应该被自动化的
基本上都能自动化
同时它也可以让非数据科学家
比如说PM
比如说designer
比如说engineer
他们自己就可以去做很多简单的数据分析
那就可以让数据科学家
从繁琐和重复的劳动中解放出来
你不再需要说engineer今天过来跟你说
请帮我看一个数
PM过来跟你说请帮我看个数
这些需求一般都被dashboard
或者说他们自己写一些简单的query去解决了
数据科学家这个时候
就可以把更多的时间发挥在战略上
或者说发挥在一些数据科学家
本身非常unicly可以提供的高价值工作上
所以总结一下
infrastructure好
一方面可以节省数据科学家的很多时间
极大地提高数据科学家工作的效率
另外一方面也可以让数据科学家
把时间花在那些更高价值的工作上
第二部分是文化
就是数据文化
其实我觉得一个好的数据文化
其实是一个好的工程师文化
加上一个好的mirrorocracy文化
综合的产物
就是你工程师文化
可以让工程师们非常有自主权
所以说他做事情非常灵活
但是他要往哪方面做
这个时候就很需要data来告诉他往哪方面做
mirrorocracy的文化
就是我们要measure你的outcome
而不是你的income
不是来measure你每天打卡上了多少包
而是你shift多少code
而是你到底产生了多少impact
为了measure这个impact
我们又搭建了很多这个AB testing的infrastructure
我之前有一篇文章就是说
AB testing为什么导致Facebook加班多
因为你AB testing了以后
很多你做出来的成果是完全可以measurable的
大家在这个竞争环境中
就会去自主地去push去做更多的东西
你有mirrorocracy之后
你data scientist在这中间
可以提供一个neutral voice
来说这个产品到底是好还是不好
我们也会综合很多方面的东西来考虑
比如说你在一个页面加一个button
加这个button可能会让你的这个feature的使用率变高
那你可能就想shift它
但是我们作为data scientist
我们就会考虑说加了这个button
会不会影响其他的东西
或者会不会符合一个design principle
而最后去做出一个综合的取舍
最后其实data scientist对这个产品能不能launch
是有一个final say的
我在facebook看到绝大多数的产品
都是start with data and ends with data
什么意思呢
就是data scientist在一开始会去做一些analysis
是说我们组的工作是这样子
然后我觉得在哪些领域是我们接下来的growth opportunity
或者是我们没有做好的地方
然后我们所有的这些工作
优先级是这样这样这样ABC
我们的要达到什么样的goal
这个goal会被什么样的metrics来measure
所以说你们的所有的实业
都应该想方设法的去提高这个metrics
在engineer们做了这些实验之后
他们有各种各样的结果
最后在experiment review上
data scientist也是有一个final say的
就是engineer会把他们做的比较好的实验拿上来
然后说我觉得这个实验应该launch
data scientist这时候做一个决定说
我同意你的想法
这个东西可以launch
或者说虽然你看到的这个结果好
但是我有如下的conserv
我们是不是还要继续做一些其他的改进
或者说我们这个东西就不应该launch
data scientist在这里边天生就有final say
在很少的情况下
如果data scientist说这个东西不应该launch
然后engineer说这个东西应该launch
那这个escalation很多时候都是要vp那个level
vp看的比较高看的比较远
可能这个时候也有很多data scientist
data scientist没有想到的事情
然后vp他根据自己的这个
vp他根据自己对这个东西的理解
他会做出一个决定来
在这种情况下
data scientist的话语权真的是非常非常大
对产品真的是非常有影响力
让大家的工作的成就感也非常高
大家平时生活中也有
如果一个人来找你给建议
哪怕你给的建议在对
他可能也不跟着你的建议走
而是去做了一件别的事情
事情时间多了
你就没有什么动力去提建议了
但是别人找你问建议
你给他说了一个建议
他马上就照做
那你就特别有动力去提出一个更好的建议
在facebook就是后面这种情况
你提的建议基本上都会被裁纳
所以说工作动力也非常足
culture的第二部分
我觉得是一个副产物
就是A B testing这么多的情况下
我们不光会看这个产品好不好
我们也会做很多learning test
这些learning test
很多时候也都是可以用A B testing的方式来做的
甚至我们有的时候会sacrifice
一些短期的用户体验
来去做learning test
去看一下这些用户体验到底有多么的重要
比如说我们做了一个非常赚钱的产品
有的时候也会专门拿出来一些用户
让他们看不到这个很赚钱的产品
我们就会看到这个很赚钱的产品
它的长期对用户的影响到底是什么
大家都知道这种基于randomized control trial的data
是所有data所有analytics的gold standard
只要你的实验设计合理
你看到这个数据你就会被这个数据信服
但是你如果是用一个模型跑出来的结果
很多时候这个模型的结果未必那么可信
所以说在facebook分析的结果是非常convincing的
这个时候不光是对你的合作方convincing
对data analytics自己也非常convincing
就是当我看到了这样一个数据的结果
我知道我的实践是设计对的
我就直接相信了这个数据的结果
versus我在很多公司如果我用模型跑出来这个结果
我可能第一反应是我的模型是不是哪里有问题
我的假设是不是不成立
或者说我的哪些条件是不是不满足
所以在facebook这种实验做多了
然后你对business go了解了以后
你对自己的分析也会非常有信心
而且在这过程中你会极大地提升客人
对数据和对整个business的感知
也就是说你能很快地找到主要矛盾和次要矛盾
我现在比如说我在这做点商
我就大概知道比如说我增加了一些卖家
增加了一些inventory
它会增加多少的transaction
比如说我的这个listing多上了几个图片
它对我的conversion有什么样的影响
这些都是经过完善实验设计的causal results
这种认知是你在别的地方很难得到的
你要知道像我们economics journal
如果你有任何的这种in natural experiment
或者causal data
你都可以发一个顶刊
那这样的实验在facebook天天都在发生
真的是一个非常奢侈的体验
第三部分就是组织结构
组织结构保证了数据科学家的独立性中立性
然后它也保证了数据科学家
既对产品有很大的影响力
又能从自己专业这边得到上级的支持
而且它会让数学科学家的工作非常有visibility
这我还是拆成两点来说
第一个是data scientist在facebook的汇报关系
它就是一个embedded加centralized的这样一个组织结构
embedded就是说你会embedded到一个product上
这一个product比如说对我来说
就是marketplace它的seller的一些东西
就是是我data scientist来负责
我有对应的engineer
有对应的pm designer
和一些其他的cross-functional team的partner
但是我就负责这一块业务
我的汇报关系又是一个centralized的汇报关系
就是我的老板的老板的老板的老板的老板
都是数据科学家
他们只有在facebook app老大这一级
就是facebook不是分instagram whatsapp什么的吗
facebook老大是一个很大的leader
他只有在这一级才和其他的
比如说engineering designer
pm汇报条线融合到了一起
但是在其他的很多公司
一般是在一个director或者说senior manager
或者说是一个gm的层次就汇报到一起了
centralized的汇报关系有一个什么好处
就是可以保证你的voice是中立的
你的工作好坏是由你DS条线的人来决定
DS条线的人决定你的工作好坏
就是说你的insight是不是正确
你提供的recommendation是不是正确
而不是你提供的insight是不是你产品想要的
就比如说我看到一个产品
我看到了一些数据有好的有坏的
如果说我的汇报关系是产品的老大
我的老板最后是汇报给产品的老大
我到最后可能只能说好的
我没有办法说坏的
但是如果我的汇报关系我的老大是DS的老大
我这个时候好的坏的都可以说
我做出来的推荐也可以更加独立专业
如果产品对我的分析有意义
我可以跟他一直asks到我的vp那个级别
才会说我们用authority来决定大家听谁的不听谁的
versus如果说senior manager的话
senior manager可能就可以用一个authority来跟我说
我们听产品的而不是听数据科学家的
所以说它保证了我们独立性
保证了我们专业性
保证了我们中立性
你工作的时候就可以更多的说对的事情
没有那么多political concern
也不用去做那些粉丝太平
或者说vanity听起来很好
但是实际没有什么用的analysis
自主性也是非常好的
embedded这个又可以保证你对这个product非常理解
虽然说我们是专业的独立的自主的
但是我们其实非常invested in the product
我们会去想方设法的去做什么样的东西
对这个product或者是对整个org是最好的
你对这个product了解让你支撑其中而不是支撑事外
可以让你的建议也更有product sense
所以这里边是一个平衡
但是我觉得这种central加embedded的平衡就平衡得很好
既能让你很好的去support这个product
但是又能让你作为一个裁判员的身份去如实的反馈
这个product到底是做的好还是不好
第二点其实又是Facebook一个非常unique的东西
就是Facebook它我刚刚说了
我楼上顶上有那么多层老板
所以说Facebook的汇报层级并不贬评
但是Facebook的信息流动非常的贬评
所以让data scientist的analysis visibility都非常高
我有自信说我的analysis做的好的话
大佬们都能看得见
这是为什么呢
就是这个是邹鑫同学他总结出来的
我觉得他总结的非常对
我就在这儿用了
Facebook内部有一个工具叫workplace
它其实就像是一个内部的Facebook
你在上面会有你的所有的同事关系
你也可以选择去follow谁加什么样的group
你的信息来源就是来自于workplace
你的信息在feed上也是像Facebook一样
用一个newsfeed的这种形式去organize的
并且不是完全按照时间排序的
而是用他认为的relevance来排序
这个时候一个数据科学家
如果他做了一个很好的analysis
他要么是用一个post
要么是用一个notes的形式发表
但是这个就会显示在很多人的feed里边
这个时候你在下面去艾提一些
你认为应该看到的人
你老板看到了以后艾提一些
他认为应该看到的人
大家可能还会share到不同的group里
然后其他的人比如说我写了一个东西
然后隔壁组的一个做seller support的VP他看到了
他觉得这个东西写的挺好的
他就会去艾提一些他汇报给他
或者说他合作的人
去一起读一下这个notes
所以如果说在一个email交流为主的团队
我要写一个analysis
我要发email
可能发到我的scheme manager之下的人就停了
但是在Facebook
我发了以后首先他是public
而且有的时候我觉得做的好的analytics
天生大家就喜欢读
所以说他在feed上就会被bump的很高
而且大家会这样艾提了以后就会有很多人来读
你做了一个工作visibility是非常强的
大家也都知道你的存在
大家认可你的能力
这个时候也会给analytics增加很多工作的动力
所以回头总结一下组织的架构
可以让analytics既invested in the product
既可以build up很多product sense
和给product很多建议
同时又能保证自己的独立专业和自主
再另外workplace非常unique的环境
可以让analytics的工作visibility变得非常高
那也是可以让大家的工作变得非常爽的
最后一个我就不多说了
他也不全是Facebook独有的
但是Facebook的商业模式和它的体量
特别适合数据科学家在这里发挥作用
其实包括我们为什么背后的大数据的工具这么好用
是因为比如说Facebook要做session level optimization
然后要做个人化的广告推荐
在不同地方做个人化的广告推荐
这个数据量是非常大的
当Facebook为了这样的一套商业模式去build up一个tool
它在用来分析电商的数据
很多时候就是杀鸡用牛刀了
就分析的非常爽
你给core点一下基本上就可以出结果
因为core背后的机器是为了100倍于你的数据而准备的
同样这个产品是免费的
也允许你去做很多的learning test
如果你一上来就是一个电商的产品
可能像Shopify这样子
或者像Amazon这样子就很难去做那些testing
以上四方面就是说
为什么Facebook是数据科学家的天堂
一方面是infrastructure好
所以说可以极大地提升数据科学家的工作效率
让数据科学家把时间花在有意义的事情上面
第二个是文化
文化导致了数据科学家非常有话语权
非常有影响力
他说的话是真的可以turn into product impact
而另外一方面这种data culture
包括他data culture背后所需求的mirroritocracy
或者说这些ABC testing
也让Facebook的数据科学家
不会去追求那些fancy的model
而是去提供真正有价值
真正经得起考验的这些data insight
他们不会把时间花在嘴皮子上
而是真的去寻找数据怎么样子
为这个产品和business提供价值的
这点我觉得非常非常重要
第三点就是组织架构
embedded加centralized的模式
让你既有影响力的同时
又能保证自己的独立性
这个workplace可以增加你的visualization
最后就是Facebook商与模式和体量
非常适合数据科学家在其中发挥价值
说了这么多好的地方
我们再稍微说两点可能不太好的地方
第一他这种embedded加centralized
然后你去负责一个产品的模式
可能不是非常适合junior data scientist
因为junior data scientist在职业生涯初期
可能希望的模式是你老板给你一个活
然后他把这个活所有都defin好了
然后你把这个东西做出来就行了
但是在Facebook因为你负责的是这个产品
你老板没有你了解这个产品
然后你老板很多时候是一个people manager
他没有办法给你那么多的指导
那他你你那作为一个senior非常爽
你有autonomy吗
但是作为一个junior压力可能就会很大
因为你也不知道在你要做的所有的这些事情里边
哪一个是最重要的和你怎么样子去完成它
你也不知道你有没有办法能做好这些事情
那这个时候压力挺大
可能学习成长速度也未必有那么快
第二点就是Facebook整个公司本身
它的新产品不是那么多
或者说成功的新产品不是那么多
有机会也可以再讲一下
就是我觉得Facebook作为公司的整体
它也有很多可以改进的地方
我这说的是它适合数据科学家
但是是不是最适合数据科学家的公司
就是最好的公司呢
我觉得也不是的
Facebook它做成的新产品不是那么多
那另一方面Facebook的人才密度非常高
你在任何一个产品上
你都会发现有非常聪明的人在那里工作
所以说如果你做的是一个新产品
或者说是一个高光产品
或者说一个非常有前途的产品
你会觉得非常爽
因为你会跟很多聪明的人
去做一些非常exciting的东西
但是你如果是在一个比较稳定的产品上
你就会发现稍稍有的时候会有一些内卷
也会让大家会不开心
最后就给我们组打一个广告
最后就给我们组打一个招聘广告
我们组绝对是一个高光高成长高impact的组
众所周知Facebook最大的战略决心之一
就是要进军电商
而且我们已经做了很多关于电商的努力了
小渣在刚刚不久前的Earning Call里边
也跟大家说Marketplace在全球有10亿的月活用户
这个数字其实是一个非常可怕的数字
就是有10亿的人
每个月都会来Facebook来买东西
你放眼全世界没有多少电商网站
是能达到流量数的
在这个过程中
我们想借助Marketplace这么大的流量
去把电商在Marketplace上做好
具体的成长和其他东西
因为都是内部数据
我在这就不多说了
总之这是一个非常有意思
非常有前途的职业
现在我们组在招一个IC5
或者是IC6的这样的一个Headcount
就算是一个很senior的Headcount
如果你觉得你Qualify
这里是我老板的微信号
你欢迎跟他聊一下
表达一下你的兴趣
或者说进一步了解一下这个岗位
如果说in general
你只是想得到Facebook Analytics的referral
也欢迎联系我老板
他可以内推你
好的这次我们就到这里
谢谢大家我们下期再见