课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士
社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai
大家好,这期视频我邀请到了我的朋友和前同事
在亚马逊工作的业员科学家卢瑞同学
来和我一起讨论一下人工智能在互联网大厂的应用
那这段视频我会把它剪成两个部分
上一部分是卢瑞同学帮我们讲一下人工智能
机器学习和深度学习的历史,他们之间的关系
以及我们为什么是在2011年2012年之后看到深度学习有一个广泛的应用
和这里面有一些标志性的事件是什么
那下段部分我们会一起讨论一下尤其是深度学习吧
在互联网大厂里的应用,包括我们到底现在是到了一个平静呢
还是未来有广阔的发展空间
我们能不能会看到一个泛式突破或者泛式突破在这里边,重不重要
包括数据的价值是什么,以及互联网大厂他们的门槛到底是什么
上半部分大概会十几分钟吧,下半部分应该是半小时的样子
那话不多说,我们就开始吧,谢谢
那感谢卢瑞同学今天来给我们大家讲一下人工智能在大厂的应用
卢瑞同学是这个清华大学的本科,水利工程
之后去德州农工读了博士
他在2012年的时候就发表了一篇基于风群智慧和Neural Fencing算法
在控制交通方面的应用的论文
也算是接触人工智能比较早的一批人了
在之后他也去福特和IBM实验室有过工作经历
也都是有人工智能在不同领域的应用
之后他在亚马逊先后是在广告和客服务部门做人工智能科学家
我不知道介绍对不对,卢瑞可以自带补充一下
挺好的,谢谢孙玉正同学的邀请,很高兴来跟大家聊这个东西
卢瑞同学,你的经历是接触了人工智能的比较多的方面
我们知道大厂里面说了人工智能,大概讲的就是机器学习,尤其是深度学习
但是我想请你先帮我们讲一下人工智能到底是什么
和简单的介绍一下这方面的历史,你可不可以
我觉得可以,这个问题我是这么看的
人工智能有一个定义是很有意思的
人工智能就是你凡事你还没有做出来的东西它就是一个人工智能
怎么说呢,比如说在IBM的深蓝出来之前
你要是下国际象棋下得很好,你就是个人工智能
但是他做出来之后,这个东西已经解决了
大家再说这个他就不酷了
在AlphaGo做出维旗AI之前,大家都认为维旗AI
维旗它可能是很难做出来一个战胜人的东西
这是很多原因决定的,但是他后来把它做出来
基于深度神经网络和强化学习把它做出来了
那之后大家就认为这个东西已经解决了
所以人工智能我认为凡事你用人的智力解决的问题
或者甚至是人的智力解决不了的问题
你用机器来解决,它就可以放到人工智能里面去
这是一个比较宽泛的定义的方式
我们后来说的那个机器学习,特别是现在的深度学习
它是人工智能的分支
像我在11年上研究生level的那个人工智能课的时候
那几十奖礼课里面没有一奖在提那个深度学习
因为那时候刚好是那个深度学习爆发的前夜
就是机器学习课和人工学习课两个
你会发现机器学习课那个人很少
对,那这个样子其实蛮有意思的
就是首先我们定义了一下就是这个机器学习和深度学习
是人工智能的一个子级,对吧
但是现在大家机器学习,尤其是深度学习特别特别火
包括你刚刚说的很多之前解决不了的问题
现在都是因为有了深度学习的发展才可以解决的
那可不可以帮我们把这三者之间的关系介绍一下
就是再详细阐述一下
嗯,可以,我觉得这样来说
我们先说机器学习和深度学习吧
就是深度学习肯定是机器学习之后才出来的嘛
机器学习你按照常见的分类
你可以分成监督学习,无监督学习,还有强化学习
你可以这样分类
然后刨开强化学习,监督学习,无监督学习
你可以都认为它是一个给定一个数据集
然后我要从这个数据集里面学习到一些pattern或者一些表征
然后再给你一个新的数据集
你可以把这个generalize到那个新的数据集
either是那个监督学习的一个标签
或者是无监督学习的一些特点或者一些pattern
所以它,你如果从那个
因为它本质上是基于一个特定数据集的一个优化问题
就是你从数学优化,从那个运筹学或者应用数学的角度来看
它就是这样,它的本质就是这样的
说的稍稍有点专业,我可不可以这样理解一下
就是所谓的机器学习,它做的一件事情
就是把一堆特征,把一堆事物的特征和一些结果给联系起来
然后把这些特征和结果都告诉机器
机器从这学习其中的规律
然后它把这些规律再应用到那些新的东西上
然后我告诉它特征,它告诉我一个结果,是这样吧
对,就是它强调到一个点,就是它一定要能generalize
它从已经观测到的东西,它能够放化到一个新的未观测到的东西上面去
就是它的一个分析区
也就是说明了为什么数学这么重要
因为我们有了这些,我们必须练这些模型
数学和计算机科学,对,就是它的那个基础
那为什么我们按道理这些数据可能在之前就有了呀
为什么是在2011年之后这个深度学习才有一个大发展呢
哦,还有刚才没有完全说完的
深度学习和机器学习到底是这个中间的联系和差别是什么的
对,其实你刚才说的这两个问题可以一起说
就是为什么它突然深度学习就爆发了
成了一个特别时髦的一个词
其实是这样的,就是神经网络其实很早就有了
七八十年代就有了
那个现在的得了图林奖的三巨头之一
那个桂莲,我不知道现在还在不在桂莲
桂莲的那个人工智能中心的那个杨乐坤
他就是先驱
刚刚说七八十年代是不是就概念提出更早一点
对,其实五十年代就有那个比如说那个perceptron
那个感知器
然后感知器组成一个神经网络的layer
就是这样的概念已经有了
但是七八十年代是提出了那个反向
那个propagation
那个中文叫什么
就是那个back propagation和forward propagation
这样他才能够train这个parameter
他才能够把它给根据数据train出来
train出它的那个泛滑的能力
这个东西很早就有了
当时杨乐坤我记得他把它做了一个应用
就是给那个美国邮政局识别那个
那些字
就是我给他一个信封
他可能可以把那个地址给他识别出来
就极大地提高了那个它的效率
这是他应该是很早就很出名的一个应用
为什么到了九十年代和一直到一一年
一二年左右他都就沉寂了呢
我觉得
我觉得主要是两个原因
一个是最重要的一个原因是
其实神经网络它算起来还挺复杂的
它其实是一个比较复杂的一个算法
这个算法导致了一个什么原因呢
就是他如果
把那个神经网络的结构做得很复杂
就往深了做
你就算不出来
你算机因为当时都是CPU单机
就最多几个盒在那算
如果这样就算不出来
如果太浅了
你可以用别的算法来取得差不多的效果
比如说你可以用
这些算量机或者说一些更简单的一些算法
都可以达到可能也差不多的一样的效果
大概就没有这个动力去做这个事情了
所以是说
还是因为这个算力导致的它的性价
比不高
对算力是一个然后还有一点
就是当时其实它数据确实也不多那时候
就是90年代零几年
互联网公司也才刚起来
没有那么多海量的数据
那时候最多可能就大家平时的数据机
可能几百兆不得了
没有那么多use case
大家也没想到有什么那个就是可以用的
一直到那个一年一年二年
就是因为你刚说到use case
我觉得其实应用是这个
其实应用是这个所谓的人工智能非常重要的一方面
但是我们回头再说
其实你看美国的科技史
它都是由应用驱动它的发展
比如说军队方面一个类似internet的概念
它不知道拿来干嘛
是吧
然后民间它才有各种各样的use case
好
那我们先继续把这个话题聊完
然后再回来讲应用吧
对可以
对你刚刚说就是因为这个算
首先是算力的不足
然后是这个数据
就是因为没有应用
所以说导致大家没有去收集这些数据
所以导致它没有发展起来
那11年有没有什么这个化时代的发现
或者说是一些特别的进步
导致它一下子爆发了
对
据我了解有这么几个点
一个是GPU起来了
就GPU以前都拿来打游戏
后来突然发现它可以用来做一些计算
然后就是stochastic gradient descent
这个算法提出了
给我们简单的介绍一下
就是GPU和CPU的运算的区别是什么
就是为什么GPU算起来会快很多
对就是CPU它相当于是一个
就除了你几何的是吧
你是一个single thread的一个计算
它用来算你的那个浮点运算是比较好的
但是像
你深度学系里面有的算法
比如说你最近点的stochastic gradient descent
随机的那个气度下降
那时候你用GPU就可以得到很快的加速
因为它可以
你可以认为它一个一个小的
它在同时进行很多的那个
三颗和那个计算
它可以同时
你可以通过一些设计
可以让它
其实就是并行算法那些东西
但是你可以让它就很快的进行
那个parameter的update
这样就是一下子
就可以让那个神经网络做得更深了
我不可以这样理解
就是CPU是用来算一些比较复杂的运算
但是GPU可以同时算很多简单的运算
对很多简单的运算
对对对
你可能可以开一万个东西同时算
因为这也是GPU当时设计出来
就是为了它同时render一个很大方面
对对对的
就是这样的
exactly
对
那这样的话
就是相当于我们一下子把算力
在那个在那个在那个
在那个在硬件没有大发展的情况下
发现了GPU的应用
导致深度学习的算力
一下子被放大了几万倍
那它很多算法之前做不了很深
对它现在可以做深了
然后它的它的它的模型的performance
一下就提高了很多
那可能比如百分之七十的精度
现在百分之九十的精度
那它就可以这个
就大家就可以想象出来很多应用
然后又去收集数据
从从而把它带上一个正循环
导致现在的这个
但是那个时候呢
就是还没有现在那么多use case
那个时候大家就
从那么几个经典的use case
里面来测试
比如说这个深度网络
深度神经网络到底是不是work
就比如说像我刚才提到Siri
其实更早
我记得微软那个
那个语音助手好像比Siri还要早
所以说在11年左右
那个Hinton就是那个大佬
Geoffrey Hinton和微软研究院的
那个邓丽是个中国人
他们就写了一个
发表在那个
IEEE
好像是signal processing上面的一个论文
就是那个其实算深度学习的一个
化时代的一个论文
他应用在了ASR
就是Speech Recognition上面
得到了很好的效果
就是一下子把那个
以前的baseline给提高了很多很多
这是什么
时候的11年我记得是
11年
11年12年这样子
然后包括后来大家翻到
这个好像可以
那我们试一下另外一个标准的问题
图像识别
对说到这个图像识别
就是我们要感谢李飞飞教授
他一直在致力于搜集那个image net
他从那就开始有这个意识
一直在搜集这个数据
所以到了后来
大家就用那个做一个标准的测试集
我不断的上面就是提高performance和刷版
就是像你推出来一个
比如说Alex net
我第二年又出来一个resnet
然后就这样
他可以一下子把那个performance
我觉得Alex net提出来的时候
他把之前那个performance甩开
好多好多
大家一下子就觉得
我操深度学习好像真的就是很厉害
这给不太就是没有背景同学
稍解释一下image net
它其实是一个数据集
它里边有很多很多的数据
然后你的这个模型可以放上去
大家试驴子试马拉出来遛遛
然后看一下你的识别的准确度是如何的
那这样子所有的新的模型出来以后
他都会拿到这个标准的数据集上
去看我能不能把它很好的给这个识别出来
所以说它还有一个榜单
那所有的模型都会在这上面有一个榜单
其实国内有很多这个公司热衷于干这种打榜的事情
对包括其实这也是一个很好的途径
比如说你刚那个框式出来的时候
他们干了很多就是刷那个刷版的事情
这样你可以快速提高你的那个知名度
对也是一个相对可
但我知道这里边还有很多就是各种各样的事情
但是也挺厉害的