课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士
社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai
今天我想深挖的主要是两个点啊
一个是Databricks为什么这么牛逼
一个是为什么你这么牛逼啊
who are their best people
where do they put the best people
当然这个你在可能publicly你看不到的
他number one priority is to win compute and storage
just a relatively successful startup
versus a incredibly successful startup
what bridge Databricks in incredibly successful startup
one major difference is that they are willing to expand
我觉得对于任何一个startup来说
能够在早期发展壮大
很重要的原因就是
好的那就欢迎欢迎Reynold
哎课代表你好
我经常在很多其他人给我发过
我也在网上关注你的这个视频哎
哇真的是
我made it哈哈哈
感谢感谢
我给频道前的观众
介绍一下Reynold和你的公司吧
你是Databricks的联合创始人
然后Databricks大家可能都听说过
是一家Pre IPO还没有上市的公司
你们上一轮funding是一年前
一年多以前
当时的估值是430亿美元
然后现在还是在一个高速发展期
尤其最近的势头其实一直都非常好
所以说具体上市的时候
你到底估
值是多少我就不猜了
但是总之是现在比较少见的一个
体量本身很大
发展速度又很快
而且天花板非常高
因为你们做数据
在AI时代里边
其实是有一个更大的天花板的
在我看来
你觉得我这样总结Databricks恰当吗
挺恰当的
就是还没说我们具体做什么的是啊
对对对对
其实你们具体做什么
是我今天一个很核心的问题
但是我们一会再聊啊
然后我再介绍一下你
就是你是
Reynold你是这个2013年在这个
UC Berkeley啊毕业的
计算机博士
然后那个时候
我猜你在学校里边
就是做了很多Spark相关的东西
那你当时也是
就是这个spark的核心团队
包括你是这个Spark 2.0的release manager
然后很长时间都是the top contributor
对吧好像只是最近因为太忙了
去年还是今年的时候
我我其实从2017年之后
可能就没有怎么给开源的spark写代码
啊但是反正可能之前写的比较多吧
一直占的top就是number one的地位
到了可能今年年初
或者去年年底的时候
慢慢有其他的这个新的人超过了我
我觉得这是个好事
证明
就是
Spark本身还是一个非常Live和这个
一个项目需要有新的血液嘛
对吧不可能说这个
我我10年前的东西
对好的
然后你在联合创立Databricks以后呢
一直就是像你说的就是工作在技术前沿
而且
你创立和管理了很多重要的业务条线
我在就是Databricks
官官网上看的是dataframe
然后我在你的那个访谈里面看到的
是有DataBricksSQL
都是怎么说呢
就是啊不是
是Spark里边的dataframe
还有这个DataBricksSQL都是
就是让这个技术普及
让大家可以用得比较好
很重要的点
哦这个恰当吗
对我在那边
其实主要负责跟数据相关的系统的
这个就是研发产品和研发
然后那个当然主要就就说到底
最后我们还没有讲到Databricks究竟做什么
对吧但是最终目标其实还是让这个
怎么样可以设计和就Databricks更好的产品
让这个因为data AI的这个use case实在太
就是太复杂了
这个要要真正上了生产线非常的难
我们怎么样可以尽大的简简易
这个各种
企业在对data AI workload上面的
这个复杂性
这句话本身就很有信息量了
我已经非常想直接deep dive到这里边
因为我们现在看到的就是大家在AI
大家都觉得想用
但是很多meme嘛
就说你其实招了一个人做AI
结果最后发现你需要招的是data engineer
然后你连基础的数据都不干净
然后你的computation太贵了
所以说或者
或者说你数据根本价值发挥不出来
那你也没有办法用好AI
这里面肯定是很难
但是我觉得我
我先把这个问题往下放一放啊
因为我先讲一下AI
还有另外一个问题
AI太容易做Demo
尤其LLM出来之后
对AI可能是我见过的就是Demo最容易成功
上线最难
这个比例最大的一个是
我们前段时间就是也采访了那个glean
啊就是方案
他就说
就是很多公司一开始是optimize time to demo
然后就肯定是不对的
因为太容易出demo了
然后但是
如果说
你要从那个难的事情开始做的话
会发现其实也是很难
就是哪怕security啊
privacy和这个Infra啊等等这些东西
真的要去做的话
会发现他很难
而且变化又很快
所以说就尤其难
好那我就是我对你的了解呢
是我长期也关注你的内容
包括你跟徐老师两次访谈
包括你在下面上这个keynote
我觉得就是让我非常impressed
就是
你把这个技术和业务都讲得非常清晰
而且非常具体
就是你从来不讲那些就是对吧
就是空话
你讲的
都是从非常具体的技术出发的
所以说我在这次访谈之前
我专门找了徐老师聊了一个小时
然后去跟徐老师对了一些
我们觉得非常值得深挖的问题
让我们觉得有太多问题值得深挖了
你这准备的非常充分
哈哈哈对
因为这个机会还是挺难得的
所以说
今天我想深挖的主要是两个点啊
一个是Databricks为什么这么牛逼
一个是为什么你这么牛逼啊
这这哈哈哈
其实Databricks是一个很新一代的公司
就是2013年
我们现在听到的这个Cohort公司
可能最成功的就是Databricks
snowflake openAI对吧
然后这个成就其实是很稀有的
对就所谓很稀有的意思是说
就是同期的这个公司
大多数大家都没听说过
更不要提这么高的估值了
然后这里边肯定这么大的成功
是有很多因素的
当然运气啊什么都是很重要的
我今天就想听一下
你觉得都有哪些因素
然后比重分别有多大
但是这个问题你可以现在回答
也可以先不着急回答
我再问一个你别的问题
然后再回来回答这个
OK
好
那我那我那我先问你个别的问题吧
然后
然后我我刚刚已经问了很多东西了啊
我问完这个问题
就可以开始你的主讲了
就是这个问题
就是Databricks到底是做什么的
他他有两层
他有两层
一个呢就是就是
就是Databricks是做什么的
这个我其实问了很多
包括我自己是做数据的
我问了我们公司的同事
data engineer啊Infra
他们的理解可能是manage Spark
然后现在呢
Databricks又买了这个tabular
所以说可能是跟data lake有很有关系
然后肯定Databricks
我去Databricks官网就会看到是data加AI
但是data加AI这个呢
我觉得就是我没有完全了解清楚
这里边到底是一个什么样的故事
或者说是什么样的value proposition
或者是解决了什么样的问题
就大的问题我觉得理解
但是小的问题我不理解
这问题其实比较复杂
因为我们做的东西不
因为我们不断在变
然后这个公司其实
就从产品线的增长上非常的快
但是我觉得如果你要说
就从high level来说的话
你就可以把我们想象成一个data plus
AI platform for enterprises
就是这里头有几个keyword对吧
第一个是data
第二个是AI
然后第三个是platform
第四个是enterprise
那我从反过来说吧
就enterprise的话
我们不是一个针对这个消费者
就是to c的公司
我们是一个to b的公司
然后我们一般来说我们的客户
当然也有中小企业了
但是就是大多数客户是比较大的
enterprise其实比如说这个fortune
two thousand啊这些啊
然后platform指的是
我们并不直接卖给你
最后这个solution
我卖的是一个平台
然后这个我们的客户可以在平台之上
开发
或者实现他们需要的这个solution啊
也有可能不管是他们自己去做
还是去找这个第三方的
比如说这个professional services啊
Consulting公司
什么Accenture啊
最大的Accenture啊
或者说很多小的这种Boutique Consulting firm
然后data and AI platform呢
就有两层
第一个是你有每个企业
都会生成大量的数据
那么
你怎么去管理和处理这一些数据
其实是每个企业都会碰到很大的问题
那么在以前呢
你可能说哎
我如果有一些
我我有一个data Warehouse
然后来做我的这个BI workload
然后我有这个
比如说我有streaming的这个一套的system
来做我的这种real time streaming
然后我可能再有一个
这个专门做machine learning的这个系统
然后再有一个专门
反正你打开任何一个
我觉得任何一个现有
的enterprise吧
只要他有一定的这个年头
十几二十年以上的啊
很多甚至上百对吧
他们都会有非常多的
跟数据相关的系统
然后这些系统呢
然后在AI来到来之后
就加了更多这一个Vector DATABASE
这里一个像Pinecone什么的啊
其实这些系统之间弄得非常复杂
很多时候啊
数据跟AI的复杂的其中一原因
就是因为实在有太多不同的系统
然后你每个系统本身
不光有系统自己的维护
你有系统
每个系统有自己的这个用法
然后每个系统有自己的这个security的
这个啊
功能啊所以你要在一个大企业里头
把这些数据都能够管理好
是个非常非常复杂的事情
就先不要说用好
就光管理好是一个非常复杂的事情
那么我们呢
是希望能够提供一个
就是尽量全的一个方案
能够让你把所有的数据
都centralize在同一个地方来管理
然后不用再担心说然后还包括了处理
然后不用
再担心说这么多的复杂度
我需要maintain
同时二三十个不同的这种系统
这个可能比较
然后但那么在这之上呢
就是说你光数据管理
就管理数据本身没有价值对吧
你需要能够在在
数据能够给你带来价值的
需要你比如说你能够生成报表
能够知道过去发生了什么事情
能够预测未来会发生什么事情
就一个是BI
一个是AI啊
所有东西
最后
其实都是为了可能这些东西服务的啊
然后还有很多可能
各种各样的
这种就是这个领域很广
就是很大的市场
你可以细分到很多不同的这种应用上
啊我们基本上就是说
我们客户碰到了最大的问题
我们就不管在哪里
只要跟data AI相关的
我们希望慢慢慢的
能够在这个系统上解决
那么最开始起来的时候呢
是针对data science
比如说一个data scientist
你想
就课代表自己应该是个data science出身
背景对吧
你如果想分析
能够交互式的分析大量的数据
我们的第一个产品其实是一个
就是一个data science Notebook
然后第二个产品
是一个data engineering pipeline
你怎么样
把你的这个data prepare好
然后能够做成一个上线的
operationalized的一个流程
而不是一个一次性的流程
这是一个data engineering的问题
那么我们有一个data engineering的product
就很多人觉得其实it's about manage Spark
但真正的it's not about manage Spark
it's about a product for data scientists to do their job
a product for data engineers to do their job
然后还有
a product比如说machine learning engineer to do their job
然后a product for data warehousing
a product for BI就各种各样不同的这种
产品线慢慢慢慢的也做的越大越全吧
嗯再来说一句
所有跟在企业里头data和AI相关的
这个问题
我们希望
能够提供一个平台的解决方案
慢慢慢的
尽可能的简化data
AI相关在这个系统平台上的复杂度
那我刚刚这您
您刚刚这件事情的第二个问题就是
他有两个competition
一个competition是cloud provider
一个competition是Excel
怎么理解呢
就是你很多数据到solution的这个过程
你假设不是那种所谓的真正的大数据
或者说是
其实很多东西在Excel上是可以完成的
尤其对于这个啊
他或者说一个scalable Excel
他是可以完成的
这是一第二呢
就是在另一端
所有的cloud provider应该也在讲这个故事
就是你用我们cloud
我们是一个platform帮你提供
就是你可以有各种solution的hosting
那这两个competition你怎么去看就是
对这这两个就是
区别很大了
就是说Excel的话
其实Excel可能是目前历史上最成功的
这个data platform就是bar none
啊就从用户数来说的话
就Absolutely is the number one对吧
嗯我们其实跟
我们跟Excel没有什么真正的竞争关系
更多的是一个合作关系
就就在我定义
因为很多人他可能觉得哎
这些东西都是有竞争的啊
就不管什么
可能他们觉得两个公司
因为做的东西在
high level看起来有点像
或者说两个产品
那么这应该有很强的竞争关系
但对于我来说
其实我这个看
我看竞争关系的这个定义非常的局限
就是说
我们会不会在客户考虑要花钱的时候
他会不会同时考虑那个产品
和我们这个产品
如果他不会这么考虑
那么这就不是一个竞争产品啊
而Excel几乎不会出现在这个过程里头
更多的是一个
我肯定会有Excel
那么也会有Databricks啊
然后Databricks
我会有时候从Databricks里头
把这个data按从Excel download下来
就是以Excel的format download下来
比如说CSC或者Excel
然后我可以在
当数据量不是很大的时候可以做
这个就是additional Processing
当然我们有很多客户其实是sensitive的
data是不允许export到Excel
因为他就是
你只要在平台上做的事情的话
所有东西都可以被audit到
但是你一旦移出了平台
他就没有办法
audit不知道你这个数据会去哪里
所以就就是平台
比如说GDPR
DSR对吧DSR说你接到一个
任何一个欧盟的这个客
用户要求把他数据删掉的时候
你需要把他的数据在30天之内
从你的企业里头全部删干净
如果这个时候你有很多不同的Excel
spreadsheet demo
就是很多员工的电脑上的话
你根本没有办法做到说
我怎么把这些数据删掉
所以这个
其实我们跟Excel
没有什么真正的竞争关系的
而且我们还花了很多不少时间
在客户允许的情况下
怎么样可以让Databricks跟Excel做得更好
啊
比如说前两天我们在做的一个功能
就是说
我希望我有个新的这个BI tool
我希望客户可以直接把Excel文件
一拉进这个BI tool里头
然后我们就可以瞬间去visualize他
你的第二
另外一个方面是说就是CSP
三大云厂商
的确是我们最大的竞争对手
就然后从这个
我之前听
我今天第一次听Databricks的人说
cloud provider是竞争对手
因为之前Databricks的人
都非常小心的说
这个cloud provider是Partners
cloud provider既是partner也是竞争对手
这是一个很
这个就是很明显的事情
因为我们给
其实cloud provider是非常爱我们
因为Databricks现在每天
反正我们上次公布过的数据是
我们每天会在三个云厂商内
launch 2,500万台
VM是twenty five million
这是一个非常非常大的体量
我们可能因因为我也不是我
我有一个cloud provider的内部数据
但是对于其他cloud provider
就我也没有内部数据
但我个人猜测
我们可能是cloud provider上就超重
workload最大的一个公司
这很大一个原因是
因为我们很多workloads
data engineering
data engineering的话
他包括了
就是他特别的compute heavy
他包括了这个很多
比如说最简单的从Json
从json format convert到partK format
这一步就需要burn很多
CPU cycle
所以cloud provider
其实是非常非常喜欢我们的
也希望跟我们走得更近的
因为我们可以给他带来因为
因为对于CSP来说
他们最care的其实是compute和 storage
就是他
虽然Amazon或者Microsoft啊
有很多很多不同的服务
但Amazon可能有700多个services啊
微软稍微少一些
但是他们有很多不同的各种服务
但其实他们最care的是compute和 storage
我稍稍challenge一下这个啊
因为我们看这个Microsoft早期的故事
有一个点
就是当PC和这个软件同时出现了以后
Microsoft占据了operating system
最后就导致所有的PC厂商
都成为了commodity
在整个这个value chain里边
所有的value都被Microsoft和剩下的
软件给capture
PC厂商所赚的利润就非常的少
cloud provider
我猜他们今天也会看到这一点
就是
如果他们只care这个compute和storage的话
那他们最后其实就会沦成一个commodity
就是compute和 storage是没有什么附加值的
他们的利润率就会很低
对吧因为你就就是这方面
你自己也可以搞这些东西
对对对你这句话说的没错
对于非常非常长远来说
但估计在接下来10年
就是现就算2024年
大家都觉得clouds is the future
on-prem IT spend
还是要比cloud要高很多
所以cloud provider的就是说很简单
他number one priority is to win compute and storage
而且这个因为这个体量非常非常的大
然后就
其实有很多你可以看到
就比如说就who are their best people
who then read
就是where do they put the best people
这个
当然这个你在可能publicly你看不到的
就是他怎么样把这个他
他他的CEO
或者说他的这个
SVP管这整个cloud
花多少时间
来focus在每一个不同的部门
每个部门之间有多大
这一些你就可以看到
就你说的
这是我同意啊
这
我觉得未来当然是
其实
总体来说
慢慢慢
就是
就其实in the full extent of time
everything will be commoditized
然后and it starts from the bottoms
从底层往上
当然这有个时间的关系
因为你如果早optimize for the future的话
其实也没有意义
是啊那但是你今天会感受到
就刚刚说的这个
合作的地方
那竞争的地方
你感受到他们的竞争压力了吗
或者你觉得
他们在真的开始跟Databricks竞争吗
还是因为他们还在打
他们这个market share的仗
就是就是compute和 storage的仗
导致他们并不会去跟
真的跟Databricks竞争
对其实他们一直都在跟Databricks竞争
我们成立的时候
Amazon就有一个叫EMR的服务
那么其实在我们公司的成立啊
好几年甚至可能2011
我我怀疑
可能到有可能到去年还是前年
就有人问
你就哎
因为我知道一些这个
私底下的数据
我不好说
但是
也我也不能确定他们是100%准确的
因为我不在
比如说Amazon
的一个工作
对吧
但是反正我觉得在很长一段时间里头
Amazon的EMR的这个revenue
其实要高过Databricks整个公司的revenue
然后我也知道这个
然后
其他其他就
每一个云厂商都在很久很久以前
就有各种跟
比如说就是跟data相关的
这个增值服务嘛
啊其实都是跟Databricks竞争的
所以我们从我觉得诞生的那一天开始
或者甚至我们还没有出生的那一天
三大云厂商
Google不算吧
因为Google比较后
就是起码Azure跟AWS
在2013年Databricks还没成立的时候
就已经有了跟Databricks竞争的这个服务
所以这个本身是一个
就是it is just life
所以有时候我也觉得挺好玩的
因为有些人
我经常在网上看到
有人就不管是我认识或不认识
说哎
我们觉得这个
现在云厂商越来越重视这个
跟data相关了
等到他们真正重视起来的时候
Databricks就会受到特别大的挑战
但是从我看的角度看来
我们越大
其实这个就是it's a
it's a level field
当我们特别小的时候
it's very easy to wipe us out啊
所以我们最脆弱的时候
其实是2013年2014年2015年 啊
或者说去年跟今年相比
但我们每一年其实我们都在变得更强
这个就是it
其实也不是说Databricks变得更强
而是the field become more level
这个竞争我觉得
而且在很长期都不会结束
因为其实在现在来说
大家都因为云厂商就it's very well funded
他不需要
就就甚至包括他自己的这个就
就因为之前有人觉得
这个云厂商可能就会不一定有三个嘛
但我觉得这it's bound to have three
因为这三个云厂商都有其他的cash call
来够fund他们的这个云
所以这场仗可以就是无限的打下去
啊然后汇集到data and AI
而且慢慢慢越来越三大云厂商
他会觉得这是很重要的东西
this this war will keep going
我知道Databricks
在一开始有一个sky computation的概念
然后现在听起来
就好像是这个三国打来打去
最后司马懿一统江湖
对因为这个其实
我们看到
这跟云的发展就是有关
因为在当你一个企业
你最开始要migrate到云的时候
你可能不会去考虑multicloud
那么在比如说两三年前
或者三四年前的时候
我们提到multicloud
大多数客户都是觉得哦
i would love to have multicloud
but let me get to the cloud first
然后就是可能multicloud他们在说
但it's never important
就是it's never prioritized
就是到去年跟今年
明显就有很多客户会直接跟我们说
哎我需要
我需要真的有一个这个two different cloud
这个时候其实一个非云原生的这个
系统
或者说产品
就有一个特别特别大的优势
当然我们也不是说
只依靠multicloud作为一个优势啊
因为如果只依靠multicloud的话
之前Databricks可能可以增长起来
但我觉得multicloud在未来应该是慢慢会
也不是慢慢吧
应该在接下来几年
会变成一个非常大的优势
multicloud还是Cloudless
比如说Iceberg这种东西
你觉得就是他是以这种哦
一个开放标准的形式的数据
和在那上面的compute
他和multiplatform
对于大数
对于data AI很难
起码在短期内很难
again the full extent of time
everything is different
但是在短期内很难
有几个原因
第一个是数据量特别大的时候
其实这个cost跟networking um
就就是说it's easy to have abstraction
it's difficult to have good performance and good cost
uh with abstraction
就经常会为了performance of costs
need to break down the abstraction
所以这个时候可能更多的是hey
我怎么样
可以更好地提供类似的INTERFACE
或者相似的INTERFACE
是让你从各cloud之间的migrate
cost非常的低
或者说
你可能同时支持两个不同的cloud
就you are intentionally on two
但是呢啊
他们提供的API
对你来说基本上是一样的
这样子你的这个支持两个cloud
成本会非常的低
哦我觉得你刚才这个inside非常好
对就是abstraction
但是其实的这个optimization是难的嗯
对我可以给你一个具体的例子
就比如说
multicloud的例子
我前段时间跟
我们一个客户吃饭啊
我们是一个这个澳大利亚的客户啊
具体是谁我就不说了
然后呢澳大利亚呢
就是就是regulation要求他们啊
能够证明当一个cloud彻底down的时候
他可以在另外一个cloud上运行
然后我就问说为什么这样子呢
然后他们告诉我
其实呢我英文我会说
就是it is rarely a problem that
就是Amazon rarely goes down对吧
或者说Azure
可能go down次数稍微多一点
但是in general when they are complete outage is very rare
然后他说很简单哦
it's because the regulators
does not want to place
the stability of the financial system
uh Australian financial system on one American company
他就说这个是一个系统性的risk
所以这个regulator这么一要求
那么下面
由所有的这个公司都需要这么做
我觉得很make sense
嗯
那我们我觉得这个点我聊清楚了
嗯
就是我觉得虽然没有去讲是什么
但是我觉得
起码从不是什么和要做什么的角度
讲清楚了
那接下来正好刚刚我们也提到了很多
就是成功的因素
我从我们刚才的对话里边
就说到几个成功的因素啊
比如说你说前十年都是很难的
前十年就是
尤其跟Snowflake的竞争是很难的
然后但是后面听说
没有我们不怎么跟Snowflake竞争
哦对前十年Snowflake是数据库
你们是什么
snowflake是一个dataware house嘛
是一个established category
我们呢是在做一个新的
没有人懂究竟 Databricks是在做什么的
一个category
我讲一下吧
我直接回答一下就是说
就为什么Databricks能做到今天这样
这这还是一个就就
这个故事还没有结束
因为我们还在继续的发展
对吧但是我觉得每个时期
其实有不同的原因
当然就就一方面
我觉得运气跟时机很重要
原班人马
一模一样的人
一样的时间
对 并没有可能
我我觉得已经没有可能
就是再打造出一个一样的公司出来
但是就运气跟时机之外
我觉得几个原因
第一个是
就这it's not specifically Databricks
我觉得对于任何一个startup来说
能够发展就是在早期发展壮大
很重要的原因就是你需要在一个啊
第一是你需要在一个足够大的市场
或者说未来足够大的市场啊
第二是
你要有一个能够真正为客户带来产品
来价值的产品
我觉得这两点有了之后
其他一切都好说
就是单这两点没有的话
我觉得不管你有再强的operator
再强的这个execution
你都很难啊
就是打造出一个我觉得像moderate
success的公司
对于我们来说
我们的市场啊
最开始的那个市场是data science
然后是data engineering
这两个东西呢
有一个好处就是在早期的时候
他们不是那么大
就我们刚成立的时候
这个市场不是那么大
因为他是一个比较新兴的concept
那么其实就导致了在他并没有
比如说你知道很多市场
因为他一开始就特别的大
所以导致了有非常多竞争对手
就不光是云厂商
可能还有这个同一时间的start up
可能就有几百个或几千个
对吧比如说我在中国有5,000多家Groupon
这种类似的公司
这样子就会非常难竞争
然后那么你失败的概率就可能很大
如果市场已经太大
所以我们其实有一个好处是
一开始我们我们找到了一个
也也不是故意找的
我觉得这一方面就是有点运气吧
还有时机
我们在一个初期不是特别大
但是未来
或者说在现在非常大的一个市场里头
他增长非常快
然后我们做的产品呢
因为我们比较
我们一直都跟这个最终用户
其实比较紧密
所以我们设计跟做出来这个产品呢
我觉得最终用户相对来说比较喜欢
能够解决一些痛点
然后这些痛点呢
可能在其他地方
并没有很好的解决的方法
所以这个
我觉得是早期成功的最重要的因素
那么最早期那个产品就是一个啊
其实很简单
就是说
但当年真的不存在这样的东西
就是如果你是一个data scientist
想要交互式的分析大量的数据
然后这些数据呢
不一定能够完全fit
在一个datawarehouse里面
就不是一个
比如说complete structure
不是一个table
对不是一个table
there's no tool for that
but there's no tool for that
那我们做了一个这个Notebook
跟后端的Spark集成
集成的非常好
所以这个data scientist就they they fell
in love with this specific product这个东西
其实一直到可能去年
我觉得
甚至今年市面上并没有特别好的
就是这个集成的Notebook solution啊
每家都开始做对
然后
后来
所以这是第一个
然后后来
慢慢慢慢的
我觉得就中期的成功
很重要的一点就是我们的这个expansion
我们会找
我们会不断的 就你知道一个公司
我觉得over generalize的话我觉得就是what's a
what's a decent
just a relatively successful startup
versus a incredibly successful startup
what bridge Databricks in incredibly successful startup
但我觉得
one major difference is that they are willing to expand这个
你如果能
你能想象到世界最大的公司微软
你刚刚说的对啊
微软
然后Amazon是三大云厂商之这个东家啊
这个Google啊
Meta这些公司
其实虽然很多人可能觉得诶
你们就是做 social network的
比如说Meta
但是你如果看Meta
they expand it like crazy
they expand it and add a lot of new products
uh huh
微软就更不用说了
对吧基本上你能想的企业软件啊
微软都这个
所以后期来
就中期来说
我觉得慢慢慢的
可能从2017 18 年开始我们就转变
就想说哎
我们要不断的考虑
我们怎么样可以expand到
这个周边的territory
所以最开始的时候
我们觉得我们是个Notebook spark company
但慢慢慢的
其实这个data and AI
我们已经提了很多年了
在有些人以为我
们是在2023年或2022年10月
Chatgpt 3.5出来之后才加了AI上去
但是就是我们之前
我们可能已经说了七八年
就it's a data and AI company这故事
那么这个其实也一方面
也是不断提醒我们自己说
就we are trying to solve the data and AI problem
we are not trying to solve a data engineering problem
or data science Problem
or spark problem
or Delta problem
or Iceberg Problem
we try to solve all the problems in data and AI
我
我帮就是我们的观众
稍稍总结一下啊
就是首先倒序总结吧
就是expansion
expansion
其实不不光是产品上的这种expansion
他可以horizontal
可以vertical
比如说Meta
他虽然看上去早期Facebook一个产品
但是他的商业模式其实reinvent很多次
包括从Desktop到Mobile
然后从web到这个mobile原生
然后怎么样在mobile上就可以打广告啊
他的这个就是收入翻了几十番
这个过程中其实是一个vertical expansion
那产品的expansion就更不用说了
如果你产品没有expansion的话
你最后是个One Trick Pony啊
但是你如果是有很多个的话
产品之间尤其是联系比较广的话
他会有形成很很大的synergy啊
所以说最后他就会网络效应越来越强
然后这个公司就越来越成功
然后你说早期的时候
在我看来很重要的就是这个PMF对吧
就是你made something that people actually need and love
然后这个东西他随着这
个市场的增长就增长了
对对
但是我这还是想再进一步说一下啊
就是再再挖掘一下
因为你刚刚说的
就比如说早期的这个市场的选择
因为确实你们一开始就是做这个的
然后这个市场是做大了
然后有很多时机和运气的因素
我想放弃
这个外部因素不谈
包括你们都在美国
然后是美国这样是一个大市场
又是一个世界领先的市场
这些东西都是我们没有办法改变的
但是内部我觉得有几个可以改变的点
就是
或者说当时是一些比较重要的选择
第一个就是在你们的这个data
就是就是你们现在大家很明显看到了
是可以和Snowflake直接竞争
甚至replace Snowflake
或者说反正就就是就是
这是一个比Snowflake有
反而是竞争且更有优势的
一个一个一个一个东西吧
但是早期的时候你们却选择啊
去做了一个更新的东西
这个选择是为什么
第二个呢
就是我一会可能在聊你的过程中
也会多讲一些
我从徐老师那里听到的anecdotes
就是包括Databricks
大家也可能很多人知道
就是人才的hiring bar非常高的
然后徐老师也认为
Databricks很有可能是收集了
就是infra和data的
非常非常多的这个一线人才
而这种人才的density
可能在snowflake是不存在的
在很多其他场就是更不存在
所以说就是人才这个东西
第一我当然
每个公司都希望我有最好的人才
但是能做到的这种这种公司并不多
这件事是怎么做到的
第三个可能是一个具体的故事
就是当时与Azure的合作
我们可以第三个先放一放
先说第一个第二个
OK第一个是产品定位
第一个是产品定位啊
你说产品定位指的是
产品定位就是说有一个明显的
就是你们当时跟snowflakes
为什么我们不去做data Warehouse啊
有几个原因吧
第一个原因是我们
我们其实一直从2013年成立的时候
一直在争论内部
我们究竟要不要去做data Warehouse
或者说什么时候去做data Warehouse
我们因为我们我们在刚成立公司
就是最开始成立的时候
其实我们是认识了很多data scientist
跟认识了很多data engineer
这些人都是早期的spark用户
但我们并不了解在大企业里头
究竟这个用data warehouse的人是做什么
而且我们当时觉得
data Warehouse是一个特别
就是相对来说竞争比较大一点的
这个领域
在当时来看
所以就因为这些原因嘛
加起来主要就最重要
其实你自己熟悉
因为你只有你熟悉
你的这个最终用户
就就target persona的时候
你才可以设计出来更好的产品啊
你需要知道他们究竟care什么
就你知道
很多时候大家觉得一个产品如果有
比如说为什么企业软件
很多企业软件很难用
对吧大家觉得这个非常不解
那么很简单
因为企业软件
大多数企业软件
决定买这个企业软件的人
并不是他的最终用户
所以企业软件
很多企业软件
他如果做他
他并没有incentive是做的特别的好
这个最终用户的UX
因为最终用户doesn't matter
they don't decide to to pay
or not to pay
啊所以你需要知道
会给钱买这个东西的人
究竟care什么
他最care的啊
那我们对这个data scientist
data engineer比较了解
所以我们觉得做这个上面
我们会有一定的优势
其实这个
然后再加上我们当时觉得
就是data science and data engineering
就是说就是it's a new thing
it will it will take over over time
那什么时候这个从就是一个data engineer
data data scientist这种bottom up的工具
变成了一个企业级的软件呢
变成一
个平台嘛
还是说变成企业级软件
我们就我们一开始
其实我们就针对enterprise做的
就是说我们需要有这个
各种各样的这个enterprise control啊
security啊什么的
但慢慢慢的确就我觉得从
就变成一个平台的话
就是说how do you go enterprise why
我觉得可能是到差不多
基本上两2020年左右吧
就是差不多covid快开始的时候
慢慢慢的我们会慢慢成为
就是说
他不是一个team或者两个team来用
而是可能整个公司里头都有很多不同
就我说的是大企业
如果一个100个人的公司
那就有可能他他很快
甚至很早期的时候
Databricks就是他整个data的Platform
但对于特别大的企业来说
Databricks作为主要data的Platform
可能就是在2020年之后的事情
这个是自然发生的吗
还是你们做了点什么
这个有
第一个需要时间
因为就是说你成为一个enterprise
Web platform需要很多的信任
然后另外一个
也有很多跟产品上相关的东西
我们为
就是从我们在governance上投入了很多
其实
这是我们可能最开始公司成立的时候
并不是很清楚的事情
你要成为一个enterprise的这个data platform
就是你必须要有非常好的governance feature
如果你没有很好的governance
大家没有办法来管理这个数据
没有办法知道
我怎么样设置好的访问权限
没有办法有非常完善的auditing
他其实是
没有办法roll out到这个很多很多用
户上他顶多可以说我一个team有5个人
当当你有5个人的时候
你不太care的时候有没有access control
对吧你不太care auditing
你不太care lineage
但是当你有很多用户的时候
这些东西都变成了是major blocker
然后这个也是我慢慢慢慢学到
就是说在我们有很多不同的这种target
persona就是有最终用户
这个data scientist data engineers
machine learning engineers也有这个admin
然后还有security team
他们都是不同的stakeholder
你真正需要做成一个enterprise
platform的时候
你需要satisfy这些所有的 stakeholder
非常有道理啊
那我在这我就再再追问一个问题
这个问题是徐老师特别感兴趣
这个问题
就是我们也听了
就是阿力
他在各个地方就是也有讲过这个故事
就是Databricks和Azure的合作是很重要的
但是尤其是对今天的这些创业者
可能来说
很有很有借鉴意义吧
就是啊
我们每个人都想抱上云厂商的大腿
或者说一个有非常强distribution channel的
这样的大腿
嗯Google什么都行
但是it doesn't happen like that
你每个人当然都说
我希望跟Azure签一个合作
然后这里边
徐老师觉得非常重要的点是
Azure的sales可以卖Databricks as their quota
这可能是最重要的一个事情
就是how did that happen
这个这个比较复杂
就是我觉得跟一个时代有关
因为Azure当时就是说还是比较新的cloud
我们这我们的deal应该是2017年sign的
2017年的时候Azure比较新
然后这个时候作为clear Underdog
他希望有一切就是again
对于他们来说
他最重要的是compute and storage
他并不是
Azure其实在Databricks成立的时候
2013年就已经有一个竞争产品叫HDinsight
后来又有一个叫Synapse
另外也竞争产品今天有fabric
一直跟Databricks有竞争的产品
但他们最care的还是
我怎么样可以drive
更多的workload到这个我的云上面
而不是就是
我怎么从AWS里抢东西过来
所以他希望能够有更好的这个
partnership跟比较重要的
就在重要领域上能有好的partnership
所以在今天
其实就是Azure已经有非常强的风
就是劲头虽然可能还是第二
但是it's no longer like AWS verse
Azure in twenty seventeen
所以不一定今天就就是按again一样的人
不一定能够在今天重现这个东西
然后另外一个是
我觉得在
就谈判的时候
很重要的一点就是要考虑到
我觉得阿力本身
他自己在这个事情上做了很多工作
因为很多经常有人
比如说找我啊什么问我说哎
你们当年这个谈这个partnership的人
是谁我们可不可以这个找到这个人
是不是已经不在Databricks
我们可不可以招过来
lead我们的这个BD(business development)
我就说跟他们说it's阿力
good luck
就是阿力非常喜欢谈判
所以他有非常强的谈判的能力
然后你需要知道究竟要谈什么
需要什么
那么很多企业
他在跟一个更大的公司谈判的时候
他可能觉得自己没有任何的
就是谈判的这个资本
那么阿力呢
他可以想出来用各种方法谈判的资本
然后具体的东西我不太好说啊
因为这种东西其实所有的人现在都在
可能十年二十年之后
聊的更可以更透明一点啊
然后很多公司可能觉得哎
我只要有一个partnership就OK了
但这世界上99.9%的partnership都是Barney
partnership这个这词我不知道你熟不熟悉
就是it it doesn't mean it
就是两个公司发一个press release
然后大家都all is great
然后就结束了
接下来没有任何的这个啊实质进展
所以怎么样你要把这个东西谈下来
第一点是
你要知道你究竟想要什么东西
什么东西最重要
那么对于我们来说
当时就是说哎
我们特别对于我们来说最重要的是
我们怎么样可以让这个销售人员来
通过卖Databricks来retire他的quota啊
而且不光是1:1的retired的quota
有可能是1比n的retired的quota
这个
然后
然后还有你需要向他们
你你知道微软不是一个公司
就他不是一个
微软是一个公司
但他不是一个个体
就是他有很多独立的个体
有很多不同的CVP
有很多不同的
有销售部门
销售部门里头有很多不同
的CVP有
产品部门里头有很多不同的CVP
每一个人他们的incentive都是不一样的
所以你需要在
而且这不光是谈判的时间
这是整个partnership的时间
你需要知道什么样的人可以
或者什么样的组织
可以跟你的incentive align
他需要什么
你可以给他带来什么
就是说说白了就at the end of the day
对吧就一切partnership
就是说
我可以带来
我可以为你带来什么
你可以为我带来什么
这需要是一个互补
不可能说就是说哎
我我一方面给你无限的付出
然后我没有任何的回报
所以你需要找到这样的人
然后跟他们关系搞的非常的好
了解他们有什么样的挑战
你怎么样可以帮助他们
基本上就是
然后在一个无限的循环过程之间
因为就算谈判谈下来了
有可能有各种各样的这个竞争势力
对吧竞争势力
有可能可以用各种各样的方法
来block你
啊你怎么样去unblock你自己
这些都是需要花很多很多时间来经营