课代表立正

Product Sense是Data Scientist面试中的重要一环,但是相对其他面试,有点玄,有点虚。难准备,也难知道自己准备得好不好。 我平时工作中收到的feedback是product sense还不错,面试时候product sense一般也是我准备最少,但是发挥比较好的环节。 这期就来分享一下帮朋友mock interview时候,发现product sense环节最容易犯的错误,用一个例子来讲解我遇到这个问题是怎么想的。希望能带来启发和借鉴。

What is 课代表立正?

课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士

社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai

大家好 今天跟大家聊一下Parallel Sense
Parallel Sense算是面試環節裡邊大家比較頭疼的一部分了
因為它不像編程和統計你會了就是會了
然後你也知道你會了
Parallel Sense的不確定性很高
相應的也比較難準備
網上其實也沒有一些特別好的資料來幫助你進行準備
我自己總結了一些方法吧
我在同事和面試這裡收到的反饋呢
Parallel Sense還算是我比較擅長的一部分
所以說我就把自己的這個一些個人經驗
拿出來跟大家分享一下
不一定是對的
因為Parallel Sense是一個很大的話題
但是希望對大家有一些借鑒和啟發就好了
Parallel Sense這個問題其實蠻大的
因為你要形成這個Parallel Sense
其實有很多培養的方法
或者說是提高的方法
也有很多資料可以看
或者說你自己應該上手做一些事情
比如說對我來說
培養我Parallel Sense最好的方式就是
我真的去參與了一些這個Startup的經驗
我自己也去找一些在業界
默拍滾打的人一起聊
或者說一起幫他們做點事情
從中從這個真實的市場反饋
和自己使用這個產品
得到了一些對於Parallel Sense的感覺
那最後ultimately就是Parallel Sense
有機會的話
我可能也會分享一些這些經驗
或者說甚至請一些我的做Startup
或者做投資的朋友來幫大家分享
那這些視頻我就Focus在兩個地方
第一個是我幫朋友Mark Interview的時候
發現大家對這個Parallel SenseQuestion
最大的誤取
我覺得這個誤區是非常值得被解決的
第二個就是我跟大家分享一個
我來準備這個Parallel Sense問題的框架
就是其他的能力你可以提高
但是我覺得這個框架可以幫助我
起碼把這個一個10分的答案
變成一個60分的答案
當然60分到100分中間還是有很多問題的
但是掌握了這個框架
反復練習
你起碼可以達到60分到80分
是我是這樣想的
我們就先從這個誤區來開始吧
這個誤區就是Parallel Sense的問題
一般他問你的都是一個開放式的問題
開放式的問題就是什麼意思呢
就是它沒有一個正確答案
這就是大家的誤區
很多同學他在聽到一個Parallel Sense的問題的時候
他會去把精力放在找正確答案上
而不是去給這個面試官溝通
展示你的這個思路和分析問題的能力上
我舉可能這樣說不是很那個
不是很容易理解
那我就舉個例子吧
有一個問題就是我們隨便用微信舉例子
你去面騰訊
民事官給你個問題
微信公眾號稱的文章
百分之多少是假新聞
那我先暫停一下
就是大家想一下
你聽到這個問題的第一反應是什麼
你打算怎麼回答他
是不是你的想法是
你要去找這個假新聞的定義是什麼
你用什麼樣的用戶數據
什麼樣的這個文本數據
或者什麼樣的網站來源數據
去定義假新聞
最後這個就是你把假新聞定義出來了以後
你就可以去算一下比例了
是這樣嗎
我覺得這就是我剛說的誤區了
之所以這個問題會是一個開放式問題
就是因為他沒有被解決
假設我知道什麼是假新聞
什麼不是假新聞的話
那我直接就不太這個定義
那我微信上就沒有假新聞了
之所以會問他
就是因為首先假新聞很難定義
尤其是你還沒有抓到的假新聞很難定義
第二就是你所有的解答方案
其實都代表了一種trade off
我在幫朋友mark interview的時候
就會有這樣的回答
比如說我們應該用機器學習
做語意分析
然後通過機器學習來給語意上標籤
這個是假新聞那個不是假新聞
或者說我應該根據網站的來源去分假新聞
比如說來源於特定網站的內容是假新聞
或者說我應該去根據用戶
或者比如說你轉發的點讚的
是教育程度比較低的用戶
那你可能是假新聞
或者說根據你的傳播速度
傳播速度快的是假新聞
還有好多個例子就不一列舉了
但是有沒有發現上面沒有一個正確答案
大家上來就去想正確答案
但是其實離正確答案是反而走偏了
因為剛剛說的所有的定義裡面
沒有一個是真正的
fundamentally假新聞的定義
比如說你轉發快 versus轉發慢
你就是定義了一個轉發快的東西
這裡邊會有precision和recall的問題
就是你可能你覆蓋面很廣
但是你的錯誤率也非常低
也非常高
那你的機器學習
可能首先你develop一個好的
機器學習的模型很難
很慢或者很慢
也不一定能develop出來
然後最後你通過抓起關鍵字去找假新聞
可能你的判斷率是高的
但是你的coverage是低的
那你抓不到絕大多數的假新聞
那你可能用機器學習去說
這個地方假新聞的比率是1%
但其實假新聞的比率已經30%了
你也根本無從知道這30%到底是什麼
因為你的機器學習只能抓到
你認為的定義裡面的假新聞
那話說回來
在沒有正確答案的情況下
你最好看的就是你的trade off
所以說在沒有正確答案的情況下
你遇到這個問題你要先問
這個問題解決的是什麼
你問這個問題
你要解決的背後的商業問題是什麼
誰在問這個問題
他的目的是什麼
他是為了反假新聞
把反假新聞降到零呢
他就是為了比如說一個report
這也就是你跟面試官溝通的第一步
他拋給你一個問題
你要去把這個場景什麼定義好
這也代表了你對工作負責的一個態度
你在工作中也應該是這麼跟你的同事溝通的
你問我一個問題
到底你的action是什麼
所以我才能根據你要take action
去進行對問題的回答
假設面試官跟你說
是小馬哥要去做報告
然後他需要數據來支持他
這個事情可能需要一周之內回來給我答案
然後我可以給你提供很多資源
那我說好
小馬哥去做報告
大家不是很care這個假新聞的定義
就是大家不會care這個假新聞的technical的定義是什麼
只會care最後假新聞的比率是多少
然後這個假新聞的比率應該是符合
他去做報告的聽眾對假新聞的認知的
那我對這個問題的解決方案就是這個樣子的
我首先去搞清楚他的受眾對假新聞的定義是什麼
然後把他形成一個簡短的工作流程
然後去找一堆人工的鑑別員
他可以根據我給他的定義告訴我
這個東西是定義中的假新聞還是不是
那你也可以中間有一些審核的流程
比如說兩個人去
然後出現異議的時候讓一個auditor來做
這些都是細節
那我可能找1000個這樣的人
做個六七天
做個五六天
那我可能出來個五六篇文章
五六千個文章
我算一下sample size
其實這五六千篇文章的這個random sample
已經能很好的體現微信整個公眾號
這個生態圈的質量了
那就可以了
那就已經滿足這個要求了
如果說好發現這個問題很大
那我們要怎麼解決他
那我就可以接下來接下來跟他提說
OK這些人他其實給我們提供了
很好的很高質量的這個人工的tag
那我們在這上面就可以上機器學習模型
而且我可能會把機器學習模型分兩類
一類是來源一類是內容
我們根據內容去看什麼樣的內容
更像是假新聞
什麼樣再根據來源去看什麼樣的來源
更容易是假新聞
然後找到這樣的pattern以後
就可以針對性的行動
那最後就這個可以比較有效的降低假新聞的數量
而且也這個人工的tag也給這個機器提供了一個比較好的
所謂的ground truth
就是你不是說機器認為你是假新聞你就是假新聞
而是人認為是假新聞你是假新聞
機器的目標是要降低人認定假新聞的這些新聞的比例
那最後我覺得結果是比一上來就做一個門上的模型
要這個負責的多的
好的這是開放性問題
就是沒有正確答案
你在面試的過程中不要把太多的時間精力去糾結於尋找正確答案上
而是應該一步一步的溝通
去瞭解這個問題
他到底是為了做什麼
他的action是什麼
然後去根據這個商業問題去做一個取捨
當然你手裡的這個工具要足夠多
你瞭解的工具要足夠多
這樣你才可能根據不同的目的吧
去推薦最適合的工具
說完第一部分
其實我們就把product sense的這個問題的意義也帶出來了
product sense的問題的意義是溝通
就像我前面說的
是考驗你能不能很好的解決商業問題
能不能很好的抓住重點
但是你要在能抓住重點的前提之下
是你分析又能全面
就是你不能說你覺得你抓住了重點
其實重點在其他地方你根本就沒有覆蓋到
那這就是一個分析問題的框架了