课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士
社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai
大家好,欢迎来到科大表达数据的第五期
这期视频我跟大家聊一下我看到的人工智能模型的具体应用
这里面当然有一些好的应用,也有一些不好的应用
我们就先从好的讲起,然后慢慢讲到不好的
和为什么他们能做到好的效果和不好的效果
现在人工智能模型应用最前沿,然后也是最赚钱的模型
就是推荐引擎了
比如说我们听音乐的时候,Spotify,Apple Music
我们看视频,尝视频的话,YouTube,Netflix
短视频的话,抖音快手,腾讯的视频号
那我们买东西的时候,买东西的时候就更多了
像其实很多广告都是来自于买东西对吧
比如说你在Google上啊,或者说在Facebook,Instagram这些地方
很多时候他们打的广告都是猜你想要买什么
然后把你想要买的东西推送到你的面前
那具体的网站呢,wish.com做的就不错
Facebook,Pinterest,Google都有类似的尝试
但是这里面其实涉献到一些数据,我就不具体展开了
就是反而这些电商的推荐做的没有广告的推荐那么好
所有的这些模型如果做得好的话
大家使用的时候都会有一种可怕的感觉
就是他仿佛比你爸妈,比你朋友,比你自己都了解你自己
他给你经常推荐的一些东西精准到你看了以后就想买
然后你点进去越点越多,越点越想买
那他是怎么样子做到这么好的
他这里面有两个机制,我觉得是至关重要的
第一个呢,就是他的training数据是用户给他产生的
就以一个卖东西的广告来举例吧
你的广告的点击率,也就是说展示给一百个人看多少人会点开这个广告
是衡量这个广告效果的一个非常非常重要的依据
而这个点击率呢,是这个用户自然而然的就反馈给你的
这就省去了很多传统机器学习模型
需要人工去label data的这一步
用户一方面是你广告的用户
一方面又帮你train了一个很好的模型
这是一个得分得厚的优势
第二个很重要的机制,就是collaborative filtering
这里边的原理呢,就是说他去看每个人都干过什么
然后把和你相似的这些人去干过的事情推荐给你
因为和你相似的人,他干过的事情大多数时候也是你感兴趣的
这也就是为什么像Spotify或者Netflix他推荐这些东西的时候
推荐的有种非常感情的感觉
因为很多时候他的推荐就好像是来自于一个平行世界的你一样
collaborative filtering具体的机制我们就不展开了
有机会的话可以详细讲一下
比如说他背后的matrix completion
比如说他的embedding加上一些deep learning的算法
是怎么可以让他从一个非常非常sparse的数据
提炼出来有用的信息,最后给你得到一个有效的推荐的
那我们这里先就不放过
总之我们这就要记住两点就好了
就是推荐算法之所以这么厉害
一方面是因为他的数据是直接来源于用户的反馈的
所以说他要去优化这个用户的反馈也变得非常非常的容易
第二方面就是collaborative filtering
就是你不光是我的机器去figure out你喜欢什么
而是我去得到了很多其他的人的信息
然后把其他人的信息综合起来形成一个推荐给你
这个时候他做的这两件事情是普通人做不到的
这也是我们在很多企业里边去看一些具体的推荐
我们觉得人可以打过机器
比如说Apple的一个editor他给我推荐了音乐歌
但我觉得非常有品味
或者说一个买手他对这个时尚非常有理解
所以说他给我推荐了这个产品
我也觉得是非常有品味
但是你逼不过这个机器这么大规模这么个性化
然后全天候的这种一复一日的推荐
这里面还有一个消费者的心智
就是人们总是喜欢新鲜的东西
你给他的推荐最好每天都不一样
也许你可以找到一堆买手
他们去进行很多很好的推荐
所以说也许你的买手在一两次的推荐里面可以打过机器
但是你架不住你这个买手在推荐10件商品的时候
你的机器已经推荐了100件1000件的商品了
而且这里面的推荐还是针对每一个人进行的个性化推荐
所以说推荐算法真的很厉害
那互联网现在最火的应用
比如说抖音这样的转视频
或者最赚钱的商业模式
比如说Facebook和Instagram的广告
背后和推荐算法这么强大
和它这么高度的发展是离不开的
第二类好的应用
是在我看来把一个附加系统给简单化
这个附加系统本来可能是一个牵连非常广的一个
很多很多小系统组成了一个大系统
但是它时间越多附加性越高
这里面每一个小的改动小的优化都很难了
因为它不同的组件都是息息相关的
而且它非是附加到一个单独的人
是没有办法理解整个系统的
那你这时候你想让他做给他一些输入得到一些输出
你要想知道他怎么得到这个输出的
对于任何一个个体来说都是一个很难做的事情
而且哪怕你理解了以后想要优化这个结果也很难
因为这里面已经是有很多很多不同的人
做的很多很多工作导致的这个结果
那这个时候你可以把这个附加的系统
用一套模式学习的东西
一个黑箱子去替换它
也许你不需要知道这个黑箱子是怎么运作的
但是我只要知道我给你一个什么样的输入
得到一个什么样的输出就行了
这个在机器学习的领域就是End to End Training
基本上能做到End to End Optimization的系统
它们的性能都得到了非常大的提升
这里面其实也有一个可以展开的话题
就是知乎上的Alec Ciss他提出来的
我们现在的系统设计遵循的原则是低偶和高聚合的设计原则
它是为了一个Heroiciple的系统而设计的
这样的话大家才能更好地在一起合作
但是自然界并不是这样的
或者说最efficient的方法最优化的方法也不是这样的
而是一个非常整体的系统
那我们到时候也可以展开讲一下
但是总之就是你之前有一个非常非常复杂的系统
这个系统可能已经僵化在那里了
很难优化了
这个时候你如果用一个Machine Learning去把它替代掉
而且你有一个高质量的Label
你能cover到你业务的大多数的范围
那你会得到一个非常好的提升
刚才我们说的第一类和第二类
是机器能做到人做不到的事情
或者说机器比人做得要好很多
那第三类呢就是机器是重复人能做到的事情
但是它比人做的快做的成本更低
这个的例子就是说我们本来有很多我们有很多业务
那这个业务是人来做的
它可以有一个非常标准化的SOP
那人就可以根据这个SOP去给你的机器提供各种各样的Label
比如说这样的Input应该对应Action A
那样的Input应该对应Action B
那我们用机器去学习人的这些Decision
然后再去replicate这个人的Decision
我们可以满足一定程度的精度
甚至很多时候可以比人的精度要更高
那它就有一个非常好的应用
它还可以利用机器能检索到的各种各样的信息
去增强这个系统
达到一个更好的效果
其实图像识别就属于这一类
就是你的人是能认出来这个图像到底是谁的
但是机器如果也能像人一样认出来这个图像长得像谁
而且它能非常快的去搜索这些图像
那它就可以在图像识别的基础之上
一有能进行人的信息识别
就会有一个非常非常强大的应用
所以以上这三类都是我觉得非常好的应用
也非常有前景的应用
那接下来的一些应用在我看来就是一些非常不好的应用
比如说是一些简单系统可以解决的问题
我们非要上 machine learning
这个是我在大厂见到的非常普遍的一个现象
就是说有一些 rule based system
有一个 if-then 很简单的问题就可以解决了
然后大家非要说这个事情是需要 machine learning 去解决的
结果用了上了 machine learning 系统
然后发现效果还不如 rule based system 来解决的好
然后大家还要去调试这个 machine learning 系统
到底是要怎么样子才能比 rule based system 做的好
在我看来很多时候这就是典型的脱裤子放屁
这里边又分两类
就是你的 machine learning 可能最后比这些简单的 rule based system 做的好
但是大家不要忘记了
你开发一个 machine learning model 其实是很费时间的
而且 machine learning model 你牺牲了很多可解释性
所以说当你做的好的时候你把它放过去不管了
但是很有可能在一些 edge case 或者说当你的数据变了以后
你的 performance 就变差了
这个时候最危险的是你
你根本就没有再去 track 这个 performance
你就觉得我被一个 machine learning model 去解决的这个事情我就不看了
那很多时候需要花很长的时间
你才去发现出来你的业务出了问题
那有的时候你去看
你看了以后你也不知道这个东西
它为什么之前做的好现在做的不好
你要么重新调餐也可能做的好也可能做的不好
但是你归根结底你不知道你的 machine learning model 为什么做的不好
这就是为什么你不光是脱裤子放屁
很多时候效率还是更低的
那更有胜者
就是这个业务本身就不适合被 machine learning model 去解决
我在前面的几期视频里面也提过类似的例子
对吧
就是一个是你只有300个 data point
然后你非要去用 deep learning 去做 prediction
对模型有理解的人
听到这儿就会皱起眉头
这件事很有可能是做不好的
然后确实它被一个简单的中文术模型很大脸
可是就是有大肠
花了上千万的薪水
招了一堆人去研发去研发和维护这个模型
就很扯
再就是有的时候你用产品可以更好得到这些信息
你非要用 machine learning model
比如说你想知道客户对你的产品满不满意
你可以去收集 review
你可以去做一些用户能给你提供 feedback 的方式
但是这个时候你非要去上一个 customer review 的 sentiment model
那 customer review 本来去留 review 的这些人就是 highly biased
你的这个模型本身你到底有没有效又很难说
因为你去做了这个 machine learning model
反而你没有去做产品
反而你没有真正的去聆听用户给你产品的 feedback
这又是一个买赌还出的故事
以上就是我总结的五类模型简单的 recap 一下
第一类是它既能利用非常广泛的数据
而且它的 label 是用户自动产生的
典型的就是推荐效法
第二类它是把一个僵化的复杂系统简单化
从而达到人类做不到的事情
第三类是它可以很好的复制人类的工作
这三类都是好的模型
那剩下两个不好的模型
那第四类就是脱裤子放屁类
你去强行用 machine learning
去 replace 一个本来做的很好的系统
然后在这过程中你牺牲了可解释性
并且牺牲了 scalability
很多人的误解就是 machine learning 有 scalability
但是你如果真正做的话
你就会发现只要数据一遍
你的模型很多时候就要重来
而且在你缺乏可解释性的情况下
这是不 scalable 的
第五类就是买赌还书
就是本来应该用其他的方式去做的事情
你非要去用 ML 做
那最后就会导致你做出来的效果是更差的
总结了这么多
但是其实做 machine learning 的这些人
是非常聪明的一些人
如果你对这些模型非常了解的情况下
你做一些排列组合和做一些创新
有的时候会有很多意想不到的结果
比如说 GN
它就是用 machine learning model
去给 machine learning model 产生 label
那它就达到了很好的效果
比如说图像识别
它在 replicate 人们的工作的情况下
又能利用互联网的强大搜索
最后也能达到很好的效果
所以我这儿说的这些东西
难免刮一落万
我把它说出来也是希望一方面
有好的景色让大家赏心悦目一下
另一方面也是提出一个框架
拓展领域
希望大家不管看到了好的例子也好
还是对我的这个 framework 有补充或者有意义
欢迎在留言下面跟我提
大家一起来讨论一下
我们可以共同进步
那好的 谢谢
我们下期见