课代表立正

由在亚马逊工作的Mike同学为我们上手讲解如何使用Tableau进行数据分析、数据可视化。中间也穿插了大家对工作中搭建data pipeline的探讨。

What is 课代表立正?

课代表立正的官方Podcast
深度访谈,有用干货,亲身验证的「真本事」
Superlinear Academy创始人,Maven Top AI Instructor
前Statsig布道师(OpenAI收购),腾讯副总监,Meta,Amazon;康奈尔经济学博士

社区:Superlinear.Academy
课程:ai-builders.com
个人:lizheng.ai

我叫刘畅,现在在温暖室做VA,也就是刚工作,我这个职位就刚开始三个月了,所以还在自己聊天。
然后他做我的话,我以前只是考过一个课程,其实还没有自己在工作中运用过。
然后,其实我们组织的主要都是QuickSight,但是可能也有些相同的地方,所以就想要继续。
我叫周晨,我是One Piece场地的合伙人,今天很高兴大家来参加这个活动。
之前我们跟孙一征也聊过很多,希望能在夏拓这边做一个针对于工程师,针对于数学科学家的生态或者社区。
首先我先介绍一下One Piece Work是一个co-working space,就像WeWork一样,但是我们跟WeWork有很大的差别。
我们有两个特色,一个特色就是我们是做cross-border的生意,是因为我们现在在整个中美有十个这样的office。
我们是在班区过来的,我们在班区现在有两个,LV有两个,夏拓也在当场有一个,然后是深圳一个上海一个。
我们在一个城市里面只会有很多人的份量,然后通过这个份量去实现第二个核心的目标,就是我们要创立的城市里面的这些太平市或者是有创新思维的这些人才。
就是因为我们背后有,不说背后,就是我们的Zack Fiddlesticks Business,还有一个VC的话,我们是直接可以去採购去投一些好的创意料理。
我们是想要在这个centre里面更多一些人可以投的,这些项目也好,还是我觉得这些人才会帮助我们在这个centre里面这些科技的创企业对他们来产生一些帮助的这样的一些人才。
这个是我们比较含蓄的。我们基金这边呢,业绩还比较不错,像我们13年开始在班区里面投像,我们目前已经投了360多个单元。
然后还有这个稍微有名气一些,这个Landai他们是第一个拆的手机,像Chatter这个,放Uber都做这个,被众人在调查了。
这个就是我们的Pimps,他们是男性拖把起家的,然后现在是女生,男性和女性的自立品牌,一个自立商品牌。
我们收到5个杜教授,现在从13年开始是17个推出,这个是我们的敢于去做这个,或者是敢于去进行一个探索的核心,这个就是我们的简短介绍。
我们还是希望可以多一些去支持像这样的一些线下或者线上的一些人才数,这个非常非常含蓄的。
就是说我们之后的感觉,这些人有可能会有创新或者创业的思维,哪怕他不创业,他的创新对于我们来说也是非常非常昂贵,因为这个对于我们自己投入的一些项目,我们做的一些企业都是很昂贵的。
可以问个问题吗?您是那个就是把投资者和技术人员连在一起的中介,还是更多的是你们有资金,就是想寻找投入?
对,我们跟WILLOW不一样,就是我们更希望投入。
我叫唐冰凝,我是在H&E,是一个健康管理所,做肺癌的,然后刚毕业不做。
最近也是在我们组里面去学习,做一些数字课程码,但是在用,就是往上拍上线,然后做一些shiny,所以对Tabloom上有什么接触,所以很能了解一下,感觉Tabloom做它的工作非常地干净,非常能多了解一下。
大家好,我是Elaine,然后我是Aurora的Intern,我现在还在读书,然后读finance,然后你跟finance和data analyst,其实说实话就是分家,基本上两个都差不多了。
然后就是这个课程一堂课,就是讲到Data Visualization,那些叫做Tabloom之类的信息,然后我们今天是过来学习的。
各位,我叫Fan,我也是西雅多州那边的学生,也是majoring finance,我也是这边的Intern,所以今天也是过来学习数据和说话。
那我们现在就开始了,可以开始了。
欢迎大家来到今天的主题分享,我们今天讨论的主题就是Tabloom数据口实化的一些入门的知识。
首先来讲一下今天都会讲哪些东西,比较基础就是先介绍一下Tabloom是用来做什么的,然后会具体的根据一些实例,然后来讲一下如何快速的上手,从怎么样找个数据到创建图表,到最后我也讲到怎么样建一些简单的dashboard。
今天暂时不太会讲的会是Tabloom一些更高级的功能,因为这个软件其实功能还挺强大的,我们暂时只是针对一些初学者来介绍一下基本功能。
还有一方面不会重点讲的是这个科学化的设计原则,因为这个又是一个很大的题目,如果真的聊起来的话可以说到心理学,科学等等很多方面。
所以我们有这个计划是会在这个系列里面,之后再定了时间,然后专门来讲一下这方面的一些知识。
所以从开始就是来讲一下Tabloom是用来做什么的。
对于我的理解,我现在是一个SDE,然后平时不是100%做一些电脑解释,但是它对我的最大帮助是能通过数据可说的方式来很快的回答一些数据的问题。
它不需要你写很长的code或者在Excel里面做一些很基础的图表,它的交互方式是它的一些特长。
然后现在我想问一下在Tabloom如果用过Tabloom,对于你来讲它最大的特点或者最大的优势在哪里?
它跟那个Database Connection接地起来非常容易,还有它那个Publish to the server,你可以避免很多东西,像是Power BI,这两个步骤很强。
还有那个Data Refresh功能也很棒。但是它我觉得特别大的缺点就是你建Tabloom的时候,你必须建一个,你建一个PPI,你需要建一个View。
如果你有一个Dashboard,你有10个PPI,你知道我意思吗?但是在Power BI,你一个PPI,一个View,你可以建所有10个PPI,可以建10个Meters。
所以我觉得这是Tabloom的固定性。
有多少不同的步骤,你需要实现Power BI可以做的?
我认为Power BI是非常强大的。在Power BI,你能建立一张Page,然后接駁到其他人。Tabloom的模特,我可能没有说过,如果你有10个Data Refresh功能,你能建立10个Connections,那么你能把10个Data Refresh功能接駁到其他人。
有Data Function,但它可以很慢。很多时候,我会直接从上方的Data 发行,然后接駁到最后的Data Function,所以我可以很容易地用到Tabloom。
Pipeline是一个方法。但Pipeline有时候会有问题,因为如果你直接从Data Source到Power BI,你能建立Pipeline到Capital,如果Data Source有问题,你需要通过所有Pipeline,你需要通过所有Pipeline,去查看每个步骤,然后再去追回。
Tabloom有很多的Extra Staff。
特别是当你把所有人都在同一个伺服器上,你会有更大的缺点。
但Tabloom有很多的Extra Staff。
Tabloom有很多的Extra Staff。
Tabloom Server,我知道你可以用更大的Hose,可以用多个Hose同时来做这个。
可以是一个WebSeries,然后刚才讲了Data Pipeline,Tabloom有一个叫Tabloon Client。
还有是做这种,有中文那时候拍放吧,就是Data preparation那种,Data rental,能接很多Data source,然后然后做这些。
今天暂时不会讲到那么细的东西,主要还是入门加Tablo desktop这种,有点重要。
那先稍微,第一步就是,先教大家怎么安装这个Tablo。Tablo本身的话,如果直接买的话,是每个月要70块钱。
但是如果像是学中的话,可以再去申请一下免费的license,然后一年可以去一次。
我平时用的,个人自己用的,不是公司,就会用Tablo public。
它这个版本就是说,做Valveation的功能都是真的。
它有一些功能限制,就是Data source,它只限于你,比如说你转递的Data source。
然后还要就是说,你做完了之后,你必须要publish到它的server上。
就是稍微有些限制,但是就个人真实学习或者用来说,没有太大的改变。
或者就是你想,你需要publish的功能,就是选择不非版本。
对,所以就是公司的数据是不能公司方面放上去。
主要是有些open data,你可以用,自己做,可以一起用。
然后就开始进到Tablo。
我们有很多幻动片,主要是通过一些实战的方式来给大家介绍一下,
怎么样从拿到数据到一步一步的分析,实现它的功能。
所以你打开Tablo,这是它的一个处置界面。
然后,左边的话就是安顾你连到数据的一些地方。
然后因为我现在用的是Tablo public,所以它这个局限的比方上,
就是只有一个Excel,文本文件,Facebook,PBF,Spatial,还有一些Stats的文件和设计。
server的话也是比较近,就有一些很简单的。
如果你有完整版的话,比如说AWS,DiggaBase,Microsoft,PeopleServer,什么的。
今天我们就是找到,这个跟那个Shuffle可以连在一起吗?
可以,可以。
可以连在一起吗?
可以,可以。
但是数据会直接导入到Tablo里面是吗?
但是它连起来有一点点触皮感,对。
它连到Shuffle是连到那个Shuffle,
因为Shuffle其实是Officer,上面有一个Discord,你要连到那个File,
对,对,对,是FileSaver那个Location。
那我们主要都是直接连到RatioCatagory上面去。
哦,RatioCatagory。
然后今天的数据,给大家介绍一下。
今天它准备的是一个,今天是下个月的,
所以今天我们就找了一个本地的图纸。
本地的AirGridD,前两年published的OpenWrite。
然后我们就基于这个来讲一下。
先用它来介绍一下这个数据里面报案的哪些东西。
它有三个table。
一个是calendar,就是说AirBee并上每一个listing,
然后它的每一天有没有availability,
然后它的价钱是多少,这个就比较简单。
然后最主要的是给的listing。
listing的话,它有92个column,
就是它的数据其实还是很丰富的。
它包括了这个id,然后你的链接,它的名字,
还有些介绍,然后包括了它的一些,
比如说hostid,然后它的具体的位置,
就在每个laborable,一会儿我们会展开分析一下。
然后第三个table是review,
就是在那个AirBnB上租客给一些host review。
今天暂时先不会用到它,主要是listing,
然后会设置在一边。
然后当我们下载完这个数据之后,
就可以通过table来打开这个数据。
我们先看这个listing的CSV。
这个字大家能看见吗?
这个看不太到,放前面一点。
在这里看能不能放下。
稍微有一点小化。
然后这个view就是跟刚才看的差不多,
就是能告诉你这个数据里面都包括了哪些attributes。
然后table它会根据这些数据来判断你这个数据类型大概是什么样子的。
比如说gitid都是数字,
它会选择数字,
然后有一些string,
然后还有一些date,
它会自动的parsed出来。
然后如果它有哪些没有做对的,
可以在这里面直接改一下。
这一般来说都还挺准的。
然后这个地方还有一个功能,
比如说看一些基本的信息,
可以describe一下。
比如说名字,
一般有1000多个不同的名字。
然后postalization,
可以做出一些基本的验证一下这个data是不是你想要的,
或者有一些完整性可以在这里面直接操作。
然后从这一页面,
第一步就是要建一个新的worksheet,
因为在table里面每一个view都是叫一个worksheet。
然后在这里面可以定义我的visualization要长什么样,
需要共享visualization的数据。
然后右边是定义这些数据的地方,
然后左边还是跟刚才一样,
是这些数据里的arguments,
然后它会根据这个data type,
分成dimension和measures。
dimension就是一些就是说这些categorical,
然后还有一些就是说bluem之类的。
然后一些numerical就是就是会归类在measure里面。
这里这个bluem是什么意思?
bluem就是tuning the faults。
就是data mergab?
哦,I see.
然后比如说,
一般来讲第一步我想看的就是说,
因为它每一行是一个listing,
每一行是不同的listing,
想看一下这个数据里面一共有多少的listing。
然后这边有一个叫number of records,
然后最简单的方式就是双击一下它,
然后你能看到它会直接建一个bar chart,
就是说有3818个listing,
然后在这个数据里面。
然后通过它来做一些分析比较简单,
比如说,
你可以找到proporty type,
然后如果把它放到column里面,
它就会根据proporty type,
然后把刚才那个bar拆分成不同的多个bar,
然后每个代表的一个proporty type。
然后现在能看出两个主要的就是说,
有attarment和house,
就是两个主要的proporty type。
如果你想更细分的话,
比如说还有room type,
你就可以加进来,
然后稍微变一下格式。
然后这样的话,
就是把proporty type和room type,
然后拆分成两个,
然后可以看,
就是比如说apartment里面,
然后room type是整个entire home的实践有多少,
然后pilot room有多少。
然后这边可以很容易的来sort这些table。
就是说,
之前我们看到的如果单看,
如果看总体的话,
entire room house的和占主要的,
然后第二是pilot room,
第三是share的。
但是当我们加入了proporty type,
我们能看出这个house里面,
其实pilot room更多一点,
而apartment里面更多的是entire apartment。
所以这是一个,
就是稍微点两下,
抓箭照,
就可以做很多不同方式的分析。
然后比如说,
我们想继续看一下这个proporty type。
现在我们看到的是一个absolute的绝对值,
就是house有一千多个,
然后apartment也是差不多一千多个。
我们想看这个,
它占整个比例的percentage。
我们可以就是在这个sum of number records里面,
加一个quick table calculation,
然后这里面有很多它已经帮你定义好的。
对,如果你直接写percentage错了,
然后它做掉一种改成了percentage。
然后我们可以把这个数,
然后加到level上,
这样的话你就能非常直观地看到,
每一个pilot type,
它占整个这个market的比例是多少。
大家有什么问题,
可以随时提出来。
然后前两天,
看这个数据的时候,
发现特别有意思的,
proporty type是这个蒙古包。
对,
然后后来我就还挺好奇的,
就去看了一下。
然后它如果有功用,
你可以每一个mark,
每一个点都可以很快的找到原始数据。
就你选择它之后,
然后这边有一个view data,
然后你就可以看到,
有哪些data来组成的这个点。
然后你可以选择full data,
就可以看到所有attitude。
然后我们找到这个listing URL,
我们稍微看一下。
因为这个还挺有意思。
因为其实在YSEADO的有一个arrival的笔,
我们可以找到什么。
通过一个图,然后找到结构到解数据,这个还是很方便的。
大家目前来讲有没有什么问题?
还比较简单。
同样的,我们可以做一下这个Price的分析。
我们还是双击一下这个Price。
它默认的是一个Sum,就是所有的Price总和。
可能这个对我们没什么意义,但是我们可以改成别的。
比如说改成Average,告诉你Average Price是多少。
或者还有什么Ninian,中位数,中位数是100块钱一晚上。
还有一个可以做的事,因为这个是Price,
做完MV,还有Cleaning Fee,我们想算一个,把这两个加起来,
算一个One Night Total,因为这个在这comment并没有。
我们可以delete itself,建立一个function,然后可以把Price加上Cleaning Fee。
然后我们就可以得到每一个Listing,如果你只付一晚上,你大概需要多少。
同样的,我们可以把它取掉。
现在它涨到了165块钱。
有一个很大的数据,就是有很多很多columns,
你也不知道你可以用这个数据做什么。
当然你可以这样一个式,看一个东西有多少counts,多少Average,Midium,这些东西。
但是你一般是怎么样从数据里面发现,你一直这样试吗?
还是说有些比较好的方法去做这个思路,就是说比较random的去try,
说我要从这个数据里找什么东西。
我觉得两方面吧,一个是你最好是能带着问题来看这个数据,
就是你能通过这个数据来回答两个问题,这样的话你就能很明确,你的目标比较明确一点。
如果你只是想你错误一下这个data的话,
那个tablet plant那个软件我觉得更适合这方面的工作。
就是它会给你一些数据方面的一些dissolution,
一些dissolution,它会告诉你每个field都有哪些值,然后它降的多少,
然后它有些比如说hissagram之类的东西。
这个就是能更直观的给你告诉你一下这个每个column都表示了哪些东西。
这个prep这个部分,它都在那个ashtop的部分吗?
它是从另外一个app里面,它可以同时用,你可以先把数据导到prep里面。
但就是得走两步,导到那个app里面,然后再导到这个dash top里面。
它可以从prep直接到dash top,它好像可以一键导进到dash top。
prep里的work zone它已经做好了,还是你要自己设计,
就是你自己的data source,然后你做一次transformation。
不好意思,打断一下,如果大家有需要网的我们传一下,
对对对,我发个微信。
我们的密码在这里。
我发个微信。
不好意思。
没事,我直接连的就是那个guess。
guess应该是不需要密码的。
你最近做了一个,其实我当时不知道有没有那个tablet prep,
我最近做了一个最后的一个dash pod,又是altrix。
然后完成了所有的work flow,然后把数据导到sql里头,然后再导到tablet。
但是这个tablet prep可能是更。
但是整个一套的系统,整合的比较好一点。
而且我用的是try,我只是一个,然后在14天之内必须完成。
然后还好完成了。
然后对,prep好像没有免费版的,必须要有的。
但都有14天的prep。
然后对,现在我们就是看了一个,分析了一下这个prep。
然后如果我们想去,这只是一个,其中一个重新值,就是midi.
如果我们想看,比如说这个one night total的,他的histbook,
他这边有一个show me,就是他会根据你现在选择的这些nice和nice,
然后推荐一些你可能需要到的图。
比如说如果我想要histbook,就双击一下histbook,
现在会自动地生成一个histbook出来。
然后我们这边的bin size,我们可以,他会自动的选一个区,
但如果我们想改的话,我们也可以edit。
然后比如说,我们是每25个算一个bin,
然后很快的,你俩建一个histbook出来。
然后,对,这是一个distribution,
如果我们想比较多个distribution的话,
通常我会用到比如说boxplot这种的。
然后现在讲一下怎么用boxplot。
就直接用price吧。
可以把price加到column上面。
然后现在只是一个total的price。
然后如果我们把这个id放到mark里面,
这个就告诉了他做的就是说,我每一个listing,
然后我想看他的price是多少,
然后每一个listing就会以mark来表示出来。
然后他的price也和这上面显示。
然后如果我们到analytics,
这个他有boxplot,
如果我们直接拉过去,
他会让我们先把这个点去掉。
就boxplot出来了。
这样的话,我们可以比较比如说不同neighborhood,
他的pricedistribution是什么样子的。
然后我们想排序的话,当然可以。
就是说我们想sortneighborhood。
然后我可以跟着点它。
跟着什么sort呢?
我们是根据一个field,
比如说这个millionprice。
他就按着millionprice,
就是最便宜的是Lake City,最贵的是Downtown。
但是呢,等会儿他的distribution就是更分散一点。
就是Downtown比较集中。
所以这是很快的能做出一些这种distribution方面的东西。
目前大家有什么问题或者想复充的?
不是那些。
哦,哦。
这边。
对,这中间那个就是灰的跟浅灰的,
中间那个是那个million。
然后左边右边的这两个点是他的P25,P35。
第一框位。
所以就是所有的这些price都是under它那个。
因为它都是偏低于50%吗?
低于50%。
那个灰的是media是吗?
中间这个线。
然后上灰色的应该是从50%到25%,
然后最左边的那个地方是less than 25%,
都是first框位。
中间浅灰色的应该是50%到75%。
所以就是给你一个distribution。
给你一个vision。
在哪里?
我就说那个深灰色的那一块。
深灰色是从25%到50%。
到50%了吗?
对,它是media。
哦,media。
然后在这个应该Tablo它都有一个documentation,
都可以看每一个chart怎么用。
然后它还会有一些比较好的解释,
比如说做什么样的analyzer,
是用哪些chart比较好。
在那个Tablo上都有些分析。
你去找他们那个documentation看一下。
我有一想法。
这个第一个,第一个是这个Avaya是不是可以轻易的删除或者是加上。
如果有Avaya的话。
第二个我其实一直对于boxbox我有一个疑问,
就是Avaya定义是什么?在boxbox上。
哦,对,它这个比如说我们可以。
它有boxbox有很多定义,
就是它这个两端这个头才是放在什么位置的。
你可以选一个来看回答一下。
哦,就这样。
你就对。
然后可以,我来放它一下。
这个就是。
这个能够定义就是两端的这个whispers是到什么。
然后现在是data within 1.5 times the IQR。
IQR就是Intercompal Wings,就是P25到P75。
然后它会就是在它的1.5倍的范围之内,
然后找到最大的一个数。
然后它也可以划比如说就是maximum和minimum。
这个是根据你的需求,
因为它们有一个同一个定义。
然后你刚才第一个就是。
就是Avaya。
哦,对,Avaya。
可以划。
对,这个几种方法吧。
就是如果你。
比如说你看到。
比如说这方面这几个我就不想要它了。
然后直接exclude掉。
就可以了。
或者说我可以根据这个price。
然后定一个filter。
然后filter的话你也可以定义说。
就是一个range还是比如说去看最大不超过。
这样也可以去根据price来。
就像这个东西。
就是说down the road你会要多去考虑。
How to productionize your pipeline。
然后How to productionize your dashboard。
所以那个时候你就会。
就像这种manual的这种调整Avaya的东西。
你可能会做的越少越好。
Otherwise you will always run into the situation.
You don't remember what you random say to the data from before.
但Tablo有一个好处。
因为它会。
你刷上尾破之后,
它会给你一个summary。
就是说你都apply了哪些filter。
这个column和row是怎么定义的。
是以文字的形式给你解决出来。
你这个就是刚才你export掉了几个数据了吗?
你export掉之后,
你新生产的那个table你能当后得出来吗?
在这上面。
可以。
就是你每一个view做完之后的话。
你都可以在analysis view data。
这就是这个table现在。
上面的data。
对,现在选出来的3800。
然后。
对,然后现在。
比如说刚才这个hissugun。
然后和这个boxbox。
是其实是对应的。
就是说我们可以看到它的summary。
其实是这边比较分散,
这边比较集中。
然后这边。
可以看出来。
这个比较分散。
你说你的summary是从哪里看?
那个。
你说你的summary是从哪里看?
哦。
你找一下。
就是一般,如果你export出去之后,
它会有一个选择。
就是能看到它的。
describe sheet。
啊,这个describe sheet。
还有一个describe sheet。
describe sheet。
然后。
然后下面的位置。
有些是summary,
但是它是从20到7的位置。
哦,对。
它会告诉你这个里面的参数。
它是在某一种类型的位置。
对。
哦,对。
然后再介绍一下它的这个
这个我们看一下它的这个 listing
在不同 neighborhood 的 listing 的一个分布
我们还是从所有的这个 count 来
然后就看出每一个 neighborhood 有多少 listing
给我们大概一个一个一个一个
然后 other neighborhood 是排最多的
然后这样是 cafe 档桃
同样我们可以就是把它做成
做成不相同
然后我们可以把它做成
然后这样可以看出一个
这个 neighborhood 的分布
但是因为这 neighborhood 更是一个地理的信息
所以我们同时也可以把它就是在 map 上
直接被丢了出来
然后这个最简单的方法就是说我选择这个
然后还到说明地点
然后放进去的 map view
然后然后会自动生成一个
地图的一个 view
现在只有一个点
因为是我们没有定义
这个 mark 所以它就会把所有东西
然后做一个 average 这是它所有的 listing 平均的位置
如果我们要想每一个点
每一个 listing 显示一个点的话
跟刚才那次就是把 id 放到 mark 上
这样的话就可以看到所有的 listing 的位置
比如说可以把这个大小调一下
然后它这个 map 这个 layer 也可以改
就是它的 tile 的形式
还有 normal 就是更长一点
就是加一些颜色
还有这个 dark 的
如果你对这个 strip 比较关键的话
还有具体的暴露的 style 和 tile
你先用 normal 然后可以加一些 strip
然后这个很多 layer 然后你也可以根据你的需要
这个 layer 从它找出来
从这个 map 到 map layers
现在就是每一个点是一个 listing
然后刚才我们看到的那些 neighborhood
可以通过 view 来 visualise 一下
它的 neighborhood 的分布是怎么样的
可以用不同的 color 来区分
就把它帅了这个 color 上面
这样我们能看到
就是 area 定地 怎么样来分
这些不同的 neighborhood 里面
比如说这边是 downtown,这边是 town,
然后 udc 都可以
非常直观的在地图上拍出来
分析师我们不一定要放这些 neighborhood 的信息
比如说刚才看到 coffee type
可以接一下分析
看到最多的两个就是
apartment 和 house
apartment 是蓝色的
就集中在 downtown, coffee house 两个地方
house 更多分在小区的位置
然后我们可以比如说
因为这个颜色太多了
我们只关心最主要的这两个
可以把这两个选上,然后去 keypoint 里
现在就是干净一点
这一块是什么
然后还有一个比较
最近大家做的就是
很容易建很多这种 sheet
所以要及时地给它起个名字
比如说 this is my
不然的话你这个
它很容易建十几八十的 sheet 然后找不到你之前做的
它是一个definet sheet 的话,它就只有一张图是吗

现在看了很多关于 property 的 listing 这个信息
然后这个还有些 host 信息
可以看一下
比如说我们想知道一共
在这些 listing 有多少个 host 呢
这时候我们就需要 count 一下 host id
可以直接在这个 row 里边
然后来定义一下
这个 function
比如说
一共有 2700 个 host
我们还想知道每个 host 它有多少个 listing
然后就可以用比如说来一个 distribution
然后这边有一颗
这个好像是
这个 folder 里
我们找到
host 和 listing count
因为它默认的
因为在 measure 里面默认的是一个 continuous variable
但是我们想把它作为一个 dimension 来做起
然后把它拿成 discrete
这样能看到这个
最多的 2000 多个 host 都只有一个 listing
然后 300 多是
300 多是只有两个 listing
大部分就是
大家只有一个 listing
它指的是比如说 3000 多 2000 多的
那种人是他这一个人管理 2000 多个 listing 之类的
不是,有 2000 多个 host
他还只有一个 listing
最多的一个 host 有 500 多个 listing
然后这边可以看到这两个 listing
还有就是可以加上一些时间的进行
基本上有一个数据就是 host sense
我们可以看一下这个下拖式地区
所以它就是一个 template
当你 exit out of that session
它就会 disappear 了
不是 out of session
只是你只能在这个卧室里用
如果你想在卧室里通通用的话
你就可以
You have to create it then, right?
OK
我有一个问题是很 basic
就那个 dimension 那个 column 里面
就是它所有 table 上面的那个
相当于是那个名字
对吧,那个
每个的明子
他那个 measure 是你自己 create的
不是
或者是名字,那個名字
它那個measure都是你自己扣列的
沒有,也是那裡的
其實它已經沒有任何的一些 variable 是在 measure
那它這個怎麼知道
把哪個放在地面之裡,哪個放在 measure 裡
就根據 data type 來走
哦,根據 data type 來走
然後在裡面也是可以 change 的這些 tag
可以給大家演示一下
對,比如說剛才
哪一個應該是在上面的
比如說 bed
我想把它弄成一個 dimension
它可以 convert 成一個 dimension
會 conversion discrete 的
它就會跑到上面去
它這個 dimension 和 measure 的區別是什麼
dimension 是一個秒數,measure 是一個 number 是這一次嗎
還是有什麼區別
其實像剛才我們做的分析
比如說這個 count 就是一個 measure
我們想看看它有多少
然後把它 break down 在 neighborhood
這個 neighborhood 就是一個 dimension

就是在不同 dimension 上看這個 measure 的區別是什麼
因為你現在雖然它顯示你 variable
就是一個 variable 和分佈,12345
我們可以 convert 它 into a variable
但是你也可以把它 convert 成 a variable
12345 也是
也是 convert 成 a variable 而已
所以你是 recognize that as a text
還是 as a value 對吧

之前理解好像是不是只有一個 dimension
可以做一個 filter
還是
there is no such a limitation
都可以
就是一個 dimension 可以做 filter
一個是它每一個數據的值也不足
也可以
OK
回到剛才這個問題就是
host 這個增長

有一個快捷的念頭
比如說你之前做了一些關於 host 的事情
然後
你可以直接 duplicate 做一個 sheet
然後
你就可以
在這幾組上
做一些修改
然後
更快一點的
重複上的
比如說 count 和 hold ID
然後這邊有一個
host sheet
就是它什麼時候加入到 Airbnb
然後這個是
它默認的是按年來表示
然後就比如說
2008年有一個 host
很久呢
進來了25個
10年進來了87個
每年都有進來多少

這是告訴你每年新來的 host 的數量

我們想知道比如說
每年它總共的 host 有多少
比如說2009年應該是
09年之內的加零八年之內的

Pumerary
然後它這邊也是有一個
table calculation 叫
no total
選它的話可以看到
它增長的一個趨勢
然後現在是每一年是一個點
它們可以再 expand 到
每一個 quarter 或者到每一個月
整個這個
就可以看出來這個走向
這個就是按照每一個具體的天
可以看到具體的時間
然後

就做的稍微 fancy 一點
比如說把 whole sense
把那個年份
就從
一十


可以把那個兩個
順序看一下
你剛才放它來的時候
它沒有順序
你說這哪個順序
我剛才想了是如果
你想做的是把它
每就是每年加入的人
跟他顏色連結出來
就是
我現在想做的就是把一條線
現在是一個顏色

然後分成不同的顏色
應該是
這時候跟現在這個數字結合出來

這邊還有數字
稍微偷看一下
每一年就是每一年的
用這個不同顏色是嗎
對每一年不同
你把那個 year 扔到那個 color 裡
它是
右邊有條線
是不是
右邊有條線
就是剛才如果把它加下來之後
它就會變
啊對因為現在是 discrete 的
那個illill
我认为这个是Table calculation,Table calculation是根据最低调的一个level,即使是自己的date也分年,然后把它每一个goo来做一个定位人次。
如果我们只是想根据后数字的话,这样的话它还ignore了年份的diameter,不会把它单独分开来做。
这个概念稍微有一点模糊,大家用的时候,可能用的多了就可以稍微理解一下。
Table calculation是怎么来做区分的。
目前入门的时候不太理解,是不是可以。
除了这个,大家还有什么问题呢?
下一步我们讲一下怎么样做两个data。
我们可以建一个新的data source,然后还是以listing为主。
然后我们可以把calendar放在那里,然后join的话就直接拖进来,然后它就自动的会以join的形式来把这两个算式变成一起。
然后join field,它一般默认的会猜一个出来,但你猜的不太准。
所以我们想join list ID,然后join source。
这样的话我们就把这两个table给join下来了。
然后可以建一个新的worksheet。
data稍微有点大,所以需要先tool一下。
然后这里面如果你有别的table,你可以接着往下join,它可以join多个table。
那你工作上会做很多事吗?
基本上都是在前期做。
看你这个data pipeline长什么样。
要是数据都很大的话,一般我们主持人一般都会在这个table server里面去做。
然后等的太慢,所以基本上都是在前期给他做。
前期就是用table,基本上就是在SQL里面给他做。
然后再放到一台table。
但是在SQL里面你怎么做table?
那就是一种etl的。
哦,etl,ok,ok,sql etl。
然后table如果想增加performance的话,它有一个table extract,不知道你们了解不了。
有的时候会extract versus the server-aligned version。
对,extract会快很多。
但是那个,嗯,它会找另外一个file里面去。
对。
但是你就说那个是有一个capacity的,一种table size的一个reputation。
嗯。
看这点吧?
嗯。
比较大,因为每行是一天的,大概有六个月还是一年的数据的数据。
嗯。
我先在加塑的时候做一下介绍一下这个Footer功能
DataSource可以直接加一个Footer
这个设计到Tablet的整个Python也是有一套系统的
我在这做了Footer和在之后做了Footer
这个处理的顺序比较高级
但一般来讲不太好
目前来讲不太好
我们去看DataSource
DataSource是一个Data和MathMovia的数据
我不知道这个Footer是怎么做的
是After John 放Footer On 还是Before
因为如果你要是Before的话
是Individual Place 放在上面
就像我们很多东西是Sigil Keyboard A 放Footer
然后在中央
很私底下那样做的
因为太大事情
但这里边可能就是
因为中的是一个Neighborhood Filter
那个Filter只存在Table 1
所以它肯定是Filter Listing First
然后再用Rest of the data to join with the calendar
但Table 1 还是可以加一个Filter
所以它可以再加一个Filter
给Talentor
Talentor没有一个Fuel的Fail
显示的是它用时
不是它剩下的时间
用时8分钟
这个就告诉你
你要是想在Table Server里
就会很慢
我一般喜欢Filter是Filter by Date
就是用多的
首先把它先Cut好
然后再一般这种生息
你要是做Total Type
就想看一下东西怎么样
然后把这个东西先做出来
可以那种
但是你要是说Production的话
它就需要一次Set time
或者是You want your data
在里面
那种举动
现在我们看到
Mesure里边就是包括了
Calendar地本的那两个Mesure
和之前的那四个Mesure
这也是
两个Table里不同的代码是分开的
同样的
我们可以当作一个大Table来处理
比如说
我们想看每一天
Availability都有多少
可以把Date放到Color里
Tablet
可以具体当每一天
然后可以
用Availability
Color来代表Availability
然后可以用Area
然后
可以定一个颜色
Availability是
绿色没有的话
可以穿空气
可以看到Availability
根据时间的走势
最近的Availability比较低
过两个星期
就比较高
然后
最后
到7月份
又有一个Drop
之前是4月份
Drop
通过这个能看到一些Pattern
一些Monthly Pattern
还有一些
像是Weekly Pattern
16号的Drip
23号的Drip
这种
合成化能
很直观的
很快速的展示出来
这种
每一天的走速是不变的
因为这个Listing就是那么多
每一天
是有一个Bluetooth
所以它是一度不考虑
比如说Newly Joined
新家人的话
有的人可能2016年以后加进来的
这个它就不考虑了
它只是看
Total Number里面有多少
Availability
这个是它16年
那时候拿到的数据
然后是往前看
往之后看
所以它总数是固定的
还不知道之后会来
先才
正好看那个Time Line
那个
有没有Time Period
在Animatics
里面
有没有一些More Involved Feature
就看Ecatapixel

具体
有什么问题可以通过
OK
你可以看Price
在7个电话区
Avage Price
在7个电话区
然后你可以再插一张
Bluetooth
然后
看Vidin Price
还是
Vidin Price
Vidin Price一个总式
然后比如说我们想
看一下
整体的Avage
就这个Time Period
它的Avage多少
然后可以插两个线
自己的Versions
然后
其实做这个是不需要伸展
或者说
其他记录并没有
它没有
Feednality

Optimize
你可以把
Detail Level
在Date里面转成
Wake Day
或者Wake Number
现在是Wake Number

差不多支持被方线的里面
给不到
上面全程的空间
但是你最想要的是
它的这个
Disolution
的空间
Forecast能干什么
Forecast
它是给你个
Trends
那也可以
给你Forecast
的功能
Forecast的时候它可能就可以
定义有没有Disnality的Factor
然后
每个可能都可以记下来
然后下一节课再继续分析
然后先Fill Stress
然后先把这节课准备的事情
做完然后
Diffuse Magnetism
的第二项Option
台词有很多
很多的功能
就是
勾运
OK
现在我们看到了
用到的Join
还可以比如说
Union
比如说
现在我们有Synergy
然后
如果我们想加入
Join
其实我刚才有点
Confused就是你们想要实现什么
你想要实现那种
Paramounts
其实我刚才就是想看
它是有没有一个Tapability
去Automatically
Considered Systemality
然后Provide you a Forecast
其实从刚才的那个看
它是其实有那个Building
的一个Tapability
对它是有一个
有一个Automatic Model
它有一个Automatic
Considered Systemality
所以你可以Toggle
这个Model
我在了解
Tapability
Time Intelligence
我在Paramount表演的
Time Intelligence 它就很Powerful
其实就是亏了一些Time
一些Variable Hall
像是Rolling Total
Past 3 Months
这些都是
Temperature
所以这些东西你在附近中也经常看
但是在Tabular我
最快我还没做
一分钟的Average都可以
都可以做
我有一个问题
就您刚才说那个
我可能听不懂你理解错了
你刚才说用Tabular的时候需要
Creative一些KPI是吗
KPI是这里面的它已经展示过来
还是另外一个新的功能
它其实就是一个Number
假如你们工作的Paramount
加上Operation Paramount
Each Model 之类的KPI
但是你这样吧
一个Dashboard里可能有十几个KPI
如果在Tabular里做的话
一个小的Number一个KPI
在Tabular里做一个Worksheet
然后花你20个Workshare
其实每个大的Workshare上面就一个小表
和一个Number
但是你不能在Data室里
跟它Combine在一样
可怕是吗
但是当时太可怕了
这确实有点麻烦
因为你也那么大一块
就一个Number是吗
就是Dashboard上
一个Kuibe就是必须要做一个表
但是它很好
你Easily
你想做什么你可以独立的考虑它
不用考虑Impact Other Style
因为我在Paramount做一些好多
因为已经很多Matter Brains
在做Future做的时候
很麻烦
但是它可以Consistently
Future across all views
有些Future和有些
你也可以一个一个东西
可以Specific
Specific for that view
就是各有利弊
然后很快的讲一下
Union的工作
在Data Source
现在我们家Wristen
我们有Postedun
直接Jog到它的下面
然后再Jog Table to Union
它就会根据
Common的这些ASK
做一个Union
这样的话你在数据里面
就是包含了两个
两个不同的文件
我就是想
像这种数字的处理
就是如果你实际上工作
是不是先把它做好
再Load进去
还是说Casper的
Panel也能处理很大量的
对,大数据
还是
能力还可以的
像我之前
现在做的这些
只有290
的Million
同时在这里处理
你要考虑一下
Column
的Services
它这个是Column
所以你如果有很多的Column
的话
当你有很多Column
的话,就像我们刚才要Join
的时候,就是很难Join
但是这个Union
好像好一点
Union基本上就是Pan

然后
时间差不多了
我们来讲一下建立大数
我可以再问一问题吗
就是
你现在做了
10个11个Cheat
如果说你数据Update的话
你只要U-Refresh,这11个都可以变
那就换句话说
我换了另外一组Table
然后这个Table我想做的数字处理
也是这些的话,我只要U-Refresh
也是可以运动,现在这WordCode是可以保存的

Column

那这里面比如说
如果是
它的一些DataBate的话
它会Refresh在不同的Dates
那最后如果
用在同一个
Dashboard上面的话
它会在Refresh上面
因为你不同的Date的话
有可能如果你Join
Date的话,就可能不少了
那这样子在我们的情况下
会不会出现那个,比如说
Lore或者什么
如果你用
LeftJoin或者RightJoin的话
如果另外一边没有的话
就会设置
如果就是相关的问题
你想换一个DataSource
然后同样的一个DataDation
你可以就是RefreshDataSource
然后可以打一个东西
然后Refresh
它这个Recognize的时候
它那个Column的名字
比如说
比如说我这个Table上有20个不同的Column
然后我只用了10个
做那个
RefreshDataSource
我下一个Table我就得10个
还是你Column可以多吧
如果你没用上具体我不太清楚
但感觉就是它会
自动的分析一下

会找你用到的那些
东西
但是而且你就是说你在这个
Build里边你
那些Build
它可能就是会有一些
需要改一下
不错不错
刚才那个我很可惜
假如它的Variable要是少
多的多的多的少可能都不行
因为我是以正的情况
我是已经Table Dashboard已经OK了
然后那个Data
Everything finished in the SQL
然后直接读到Table
就是先Refresh
然后我们就automated这个process
有些Variable我在征教里把它cut掉
就是没用嘛以前本来是6个Variable
其实它支撑到就是4个
然后就Critic4个Variable
然后就Replace那个Table
这个Table Dashboard就不Refresh
因为实际上它Table本身
它用的就是4个Variable
它虽然那个里面有6个Variable
它就用的是4个
然后我做的时候我说我干嘛还留那两个呢
就是说现在我重新Critic我自己
因为Source Table不一样的
所以它会有一个Variable
这样的话也就是说
其实只有4个Variable
那么这个Table Dashboard它还是不Refresh
然后没办法以后
就把那两个拿回来以后
6个等于6个然后Table它就扔了
它就Refresh了
那个是Sql Server到Table
这个是你属于
Table直接读的Data
所以我这个也不设
但我的意思就是说你到Table size
就像你说的假如它以前是6个
然后我换成了4个
这个情况下是不足的
我觉得应该是如果它的Table是
同一个Table
你在Table里面Change的话
应该不会影响到Table的方式
但如果你这个再换了一个Table
虽然是同样的Table那就不行
相当于它以前是6个
你的Refresh是Refresh你原来那个Source Table的话
那是可以的
其实所有的Column Name Column Type都一样
就是我把两个不用的东西
把它给删除了
其实他们用来的那个Source Table
就是不同
最开始的那个Source
最开始是一样的
只是原来我们以前就是
有部分那个Manual的你知道吗
然后就生成那个Sql Server
现在我就属于Ottoman
然后直接就是用Urtrix
直接把这些什么Guy John的
Guy Schumann Manipulator的
然后这么过来,中教就给Mode了两个外号

其实有点tricky

就是它对Source
要是改的话它就不然
WinCy就相当于BitSource
我们现在来讲一下
Dashboard
Dashboard的功能就是说
我们见到很多这个Individual Worksheet
怎么样把它们整合在
同一个View里边
同时再加一些交互的
功能在里边
就说刚才我们有一个MapView
我们可以直接给它
拖拽到这个
Dashboard里面
然后刚刚我们还做过
这个PriceDigivision
我们也可以把它
拉进来
这样可以同时看到
两个View在一起
然后比较好用的功能就是
你可以一键
把下面做成一个Surfer
像的话你选择
某一个Mark的时候
上面的也会
同样的
拖拽到那些Listings
同样的
如果把它也做成一个Surfer的话
比如说你
我去选
比如说
直分线
最快
然后下面的ZP也会
也会改变
这样交互
功能是非常非常好
非常强大的
然后比如说
我想加一些Surfer在这边
这边有的Surfer就是
你这个Worksheet可以用到的
那些View
如果没有的话我们可以回到
这个Worksheet
说我们想加
Numericode的一个Surfer
把这个Property加进来
这样的话
回到Dashboard里面
我们就有这个选择了
可以有Laggable的
就是说
我只关心
可以
这样的话
有一个Laggable的
Surfer
关于
Dashboard有什么
问题
基本上就是
Drag and drop
你怎么想
要给大家
design成什么样子的
比如说
我要是
Symmetrical
中间我想把它放成一个图
上面放一个Data
左边右边放一个Data
这个Design可以做吗
这个Template
就是Drag and drop
然后
就看这个Template怎么放这个位置
就是Template位置
可以用Container

还有这个HoleDumpContainer
VerticalContainer
然后你也可以做成Floating
它是在任意位置
用Container
可以
比如说
刚才我们是
相当于Tile的
可以Start with a vertical
或者HoleDumpContainer
这样的话每次你
加进来一个新的
Worksheet
它都是会
很像的排序
然后你也可以在Container里面
加别的Container
比如说我在这里面
可以加一个Vertical的
这样的话
你往这里面加的话
它就是会变成Vertical的
然后我们在这里面可以控制它的
大小
就是Size
然后可以加一些
Text的那种
可以加一些
比如你要加一个Pitle
或者什么的
可以加Text或者加个Logo
就不加了
还有
比如说
Button
Button基本上就是
Filtering
这是
Fanning的一个Fanning
这是一个Fanning
实际上也不Work
Fanning不是单独的
Fanning你要把它
放到你的Container里
你也是通过你的Resize
Filter
你可以把Filter的Card放到你的Dashboard里
放到你的Container里
你在之前的View里面
其实就可以加一些Filter
然后
可以把它在这边
做成一个Filter
然后如果我想
我们可以加
Dashboard外的Filter吗
这个就是Dashboard
我们这个Filter
刚才没到Build
Specific吗
比如说
这个Filter我想
Apply到所有的Word室
这可以定义
现在只是在自己的Word室
因为我想所有的Word室
用这个Filter
OK,所以你的Surface
可以用到所有的Word室

现在的话
就是加一个
右边的Dashboard
各种功能
FilterApply到所有的Word室
这个Bug-in好像
可以定义一些Navigation
你看
别的有
看大家还有什么
各种功能
恭喜
准备得比较
仓次
对,就非专业
把你专业的讲了
我会做很多这种
因为他们现在
就是Direction Change了
全部的Part-by-report
全部要Code-work
如果要用
Part-by-report的话
你现在用的是Part-by-report

你之前是用WebSite对吧
现在只是在
但是你存的时候把它存到网上去
每次用在刚才的WebSite
把它打开来的时候
可以到Tabletpub
然后你可以设定比如说管理权
谁可以Touch这个Data
谁可以Change这些都可以吗
还是只有你自己可以做这件事情
那这个Server Admin
但这个Tabletpub
是Tabletpub负责的
如果你是
公司的Tablet server是有Admin
可以控制每个人的权限
这个权限不刮也还可以
在Public上
可以在你自己的Homepage上控制
有谁可以View你的Homepage
然后你可以把它Hide掉
所以别人都看不到,就只有你自己能看见
所以Public是个网站
像现在
蛮内部的话
基本上我们通过AEB folder
的那个Permission
AEB.com去Control
Who can access your typebook
所以AEB.com现在也是用的Public是吗
当然是,不是
自己的Fublade
我想问一下
Tablet这个
它有好处
你现在都数据都在本机上

有没有比如说它在
Server端进行
Data loading和
一些processing
就是WinX
WinX
在本机做的话
是有这样的限制
它在这个是有那个规律的
基本上你可以就去
比如说你有一个
你自己Retrieve Cluster的一些Table
你就是Table built for the purpose
然后你就可以
connect directly to that table
那Table是在
Server
Table是在Cluster
就是这个
Oracle Table
在HCFS
然后
Table Server也可以
就是说
其实在上面编辑你的这个Opt
你不需要一个Table desktop
它在网上也可以
进行编辑
但它处理
在Server端
做的
Table Server
可以
Server Server可以
想问一下
因为我们在
Float的话
我们只能去View
他们已经View好的Dashboard
但是说我们如果自己想要View Dashboard的话
是要Astro
different condition是吗
你要是说

要是说你得看
你得先找到那个
你的那个组的
Server Admin
从他那里面可以叫一个Desktop License
好像要个License

因为我现在发现好像我们有一个Sentral
的一个Table
好像每个Org都自己的
有些是
一些Org share一个Server
然后
是跟Table的Pricing有关系
因为Table的Pricing是根据Different License
来Priced
所以他们可能会Control Developer License
然后Viewer License
我还想问一个
亚马贝夫的问题
就是那个如果这个Data在SharePoint上的话
想做一个Automated
的Pipeline给Transfer到
Redshift Cluster上的话
但这个Pipeline没有就是之前的
Syntax的Pipeline
有什么方法呢就是Automated
把SharePoint的数据每次都准到
你SharePoint是
Excel or Tax
Excel就是SharePoint可以download到Excel or Tax
我们现在的做法是
每次都把SharePoint数据download到Excel上
然后再把Excel
Update到Redshift
但这中间有一个人为介入的过程
就是我得下载下载文章
你的Source在哪来的
SharePoint
就是在SharePoint上
就是人为的去Enter
这个的话
是不是
SharePoint在Excel上
对数据就是在SharePoint上
所有的数据员都在SharePoint上
像我们都是
要这种情况
给它Load在EDX上
给它形成一个EDX feed
然后再从那个feed直接落进去
那个是一个Manual的过程
还是Automated的过程
因为你的这个Source
已经是Manual的过程
所以在
你的意思是说
如果要是SharePoint
可是你的这个SharePoint
的话
我知道
Currency有一个
功能
要是说Update
SharePort
那么一个Table
Custom Update
它是
RS Table可以直接
Return
这个Automated的这个schedule是要在
RS上设定是吧
还是在SharePoint上设定
我定期到时候去读
这种数据
我没有接触过
SharePoint这个Source
SharePoint太tricky了
非常tricky
我们选择
SharePoint和Share Drive
是一个
Similar的一般
所以我的那个
Experience就是说
Directly Point
RFT过去
Share
如果它可以直接读到Table上
那也最好了
直接连Table
这是最方便的
一个是Basicization,一个是Data Source
如果这个很难的话
每周都会有更新
有Want to Update,有Maker Data
所以我就觉得
还是先走一下
比较好
要Stable一些
Buy My Loader Share
这个就是我在发现
可是那个就是我说的那个
因为其实我没搞清楚
但是我的connection建立了
SharePoint它应该有一个
Share Drive Location
就是你刚说的那个
RFT就是一个
那是在超越Tesla的
一个内容化好
就是它有非Base的Location
它其实就在Close
就在Close
我的直播什么
那时候后来想起我那时候
我走的时候Oscic
跟我有一个workflow
Oscic直接做了SharePoint
这个workflow我Severalize Server
每一个月哪天
把这个workflow绕出来了
那你那个workflow你是不是用Page上
我不是,我用Oscic
我还真没听说
它就像一个workflow的
Cast
Rite
它抓一个小图标进去
这个它刚才问的那个
我其实
Oscic的图里的时间
可以的
Oscic既然能把SharePoint抓到
但是抓了就很快了
我有想到
其实你那个问题
你可不可以直接给它Share
在S3上
你直接给它Share到S3
我们现在就是手动的
把数字弄起来之后放到S3上去
然后S3那边
S3就读到S3上
我觉得这个是不是可以
就是那个
或者是
你可以考虑
就等于一个Page
对,我是想
今年五上六夜的Page
我觉得就是
是我老板不把这个分阶找出来的
SharePoint的Display是一个
一个文件吧
它有一个
有一个Map Drive
它就用Map Drive
你知道吗
Map Drive到你的Map Drive
那个是一次性
现在这个
然后你可能
你讲你Map Drive
然后Map Drive
我们现在是先把数字拿出来
然后稍微做一些处理
对对对