數(shù)據(jù)分析崗面試題與參考答案解析
1.怎么做惡意刷單檢測(cè)?
a. 選取特征利用機(jī)器學(xué)習(xí)方法做分類(lèi)。
特征: 結(jié)合商家特征和環(huán)境特征做商家惡意刷單分類(lèi)預(yù)測(cè),結(jié)合用戶(hù)行為特征和環(huán)境特征做用戶(hù)惡意刷單分類(lèi)預(yù)測(cè)。
1)商家特征:商家歷史銷(xiāo)量、信用、產(chǎn)品類(lèi)別、發(fā)貨快遞公司等。
2)用戶(hù)行為特征:用戶(hù)信用、下單量、下單路徑、瀏覽店鋪行為、支付賬號(hào)。
3)環(huán)境特征(主要是避免機(jī)器刷單):地區(qū)、ip、手機(jī)型號(hào)等。
注:構(gòu)造特征。刷單的評(píng)論文本可能套路較為一致,計(jì)算與已標(biāo)注評(píng)論文本的相似度作為特征。
機(jī)器學(xué)習(xí)方法: 決策樹(shù), 感知機(jī), 邏輯回歸, 支持向量機(jī), 隨機(jī)森林
b. 異常檢測(cè):ip地址經(jīng)常變動(dòng)(固定時(shí)間內(nèi)變動(dòng)次數(shù))、賬號(hào)近期交易成功率上升(固定時(shí)間內(nèi)交易成功率)------利用箱型圖進(jìn)行結(jié)構(gòu)化檢測(cè)。
機(jī)器學(xué)習(xí)中的異常檢測(cè)手段:
1)總體來(lái)講,異常檢測(cè)問(wèn)題可以概括為兩類(lèi):一是對(duì)結(jié)構(gòu)化數(shù)據(jù)的異常檢測(cè),二是對(duì)非結(jié)構(gòu)化數(shù)據(jù)(通過(guò)對(duì)圖像目標(biāo)檢測(cè),識(shí)別出異常點(diǎn))的異常檢測(cè)。
2)對(duì)結(jié)構(gòu)化數(shù)據(jù)的異常檢測(cè)的解決思想主要是通過(guò)找出與正常數(shù)據(jù)集差異較大的離群點(diǎn),把離群點(diǎn)作為異常點(diǎn)。常常面臨的問(wèn)題有二:一是需要定義一個(gè)清晰的決策邊界,從而界定正常點(diǎn)與異常點(diǎn);二是維數(shù)災(zāi)難及交叉指標(biāo)計(jì)算之間的高頻計(jì)算性能瓶頸。
3)結(jié)構(gòu)化的數(shù)據(jù)的異常檢測(cè)手段:圖形位置分布(箱型圖), 統(tǒng)計(jì)方法檢測(cè)(切比雪夫不等式的方法能夠有效地劃分出三個(gè)類(lèi)別,包括正常數(shù)據(jù)、異常數(shù)據(jù)、未知數(shù)據(jù))+距離檢測(cè)(距離位置檢測(cè)有一個(gè)非常強(qiáng)的假設(shè):正常的數(shù)據(jù)都比較集中,有較多的鄰居,而異常數(shù)據(jù)都特立獨(dú)行。未知數(shù)據(jù)的簇里面尋找出與正常數(shù)據(jù)更不相似的,或者和異常數(shù)據(jù)更相似的數(shù)據(jù)就可以了。)
2.K-means算法
a. k-means原理: 隨機(jī)選擇k個(gè)中心點(diǎn),把每個(gè)數(shù)據(jù)點(diǎn)分配到離它最近的中心點(diǎn),重新計(jì)算每個(gè)簇的質(zhì)心,直到質(zhì)心不發(fā)生變化。
b. 改進(jìn):
1) kmeans++:初始隨機(jī)點(diǎn)選擇盡可能遠(yuǎn),避免陷入局部解。
2 ) ISODATA:對(duì)于難以確定k的時(shí)候,使用該方法。思路是當(dāng)類(lèi)下的樣本小時(shí),剔除;類(lèi)下樣本數(shù)量多時(shí),拆分。
3 )kernel kmeans:kmeans用歐氏距離計(jì)算相似度,也可以使用kernel映射到高維空間再聚類(lèi)。
c. 遇到異常值:
1 )局部異常因子LOF:如果點(diǎn)p的密度明顯小于其鄰域點(diǎn)的密度,那么點(diǎn)p可能是異常值.。
2 ) 使用PCA或自動(dòng)編碼機(jī)進(jìn)行異常點(diǎn)檢測(cè):使用降維后的維度作為新的特征空間,其降維結(jié)果可以認(rèn)為剔除了異常值的影響(因?yàn)檫^(guò)程是保留使投影后方差最大的投影方向)。
3 ) winsorize:對(duì)于簡(jiǎn)單的,可以對(duì)單一維度做上下截取。
d. 評(píng)估聚類(lèi)算法的指標(biāo):
-
1 ) 外部法(基于有標(biāo)注):Jaccard系數(shù)、純度
2 ) 內(nèi)部法(無(wú)標(biāo)注):內(nèi)平方和WSS和外平方和BSS
3 ) 此外還要考慮到算法的時(shí)間空間復(fù)雜度、聚類(lèi)穩(wěn)定性等
e. k-means算法的問(wèn)題: 對(duì)異常值和初值敏感。當(dāng)有異常值是,質(zhì)心可能就會(huì)離大多數(shù)點(diǎn)比較遠(yuǎn)。比如1,2,3,4,100五個(gè)樣本,均值是22,這樣類(lèi)別中心就離樣本較遠(yuǎn),這時(shí)選取中位數(shù)做為質(zhì)心是更好的選擇,這就是k-Mediods(k-中值)聚類(lèi)算法。同時(shí)k-means是初值敏感的,即當(dāng)選取不同的初始值時(shí)分類(lèi)結(jié)果可能不同。
f. K值的選擇
1)這個(gè)真的沒(méi)有確定的做法,分幾類(lèi)主要取決于個(gè)人的經(jīng)驗(yàn)與感覺(jué),通常的做法是多嘗試幾個(gè)K值,看分成幾類(lèi)的結(jié)果更好解釋?zhuān)戏治瞿康牡取?br /> 2)對(duì)于難以確定k的時(shí)候,使用ISODATA,思路是當(dāng)類(lèi)下的樣本小時(shí),剔除;類(lèi)下樣本數(shù)量多時(shí),拆分。
3)手肘法,當(dāng)k小于真實(shí)聚類(lèi)數(shù)時(shí),由于k的增大會(huì)大幅增加每個(gè)簇的聚合程度,故SSE的下降幅度會(huì)很大,而當(dāng)k到達(dá)真實(shí)聚類(lèi)數(shù)時(shí),再增加k所得到的聚合程度回報(bào)會(huì)迅速變小,所以SSE的下降幅度會(huì)驟減,然后隨著k值的繼續(xù)增大而趨于平緩,也就是說(shuō)SSE和k的關(guān)系圖是一個(gè)手肘的形狀,而這個(gè)肘部對(duì)應(yīng)的k值就是數(shù)據(jù)的真實(shí)聚類(lèi)數(shù)。
4)使用輪廓系數(shù)(silhouette coefficient)來(lái)確定,選擇使系數(shù)較大所對(duì)應(yīng)的k值
kmeans最優(yōu)k值的確定方法-手肘法和輪廓系數(shù)法:https://www.jianshu.com/p/335b376174d4
g.初始的K個(gè)質(zhì)心怎么選?
最常用的方法是隨機(jī)選,初始質(zhì)心的選取對(duì)最終聚類(lèi)結(jié)果有影響,因此算法一定要多執(zhí)行幾次,哪個(gè)結(jié)果更reasonable,就用哪個(gè)結(jié)果。 當(dāng)然也有一些優(yōu)化的方法,第一種是選擇彼此距離最遠(yuǎn)的點(diǎn),具體來(lái)說(shuō)就是先選第一個(gè)點(diǎn),然后選離第一個(gè)點(diǎn)最遠(yuǎn)的當(dāng)?shù)诙€(gè)點(diǎn),然后選第三個(gè)點(diǎn),第三個(gè)點(diǎn)到第一、第二兩點(diǎn)的距離之和最小,以此類(lèi)推。第二種是先根據(jù)其他聚類(lèi)算法(如層次聚類(lèi))得到聚類(lèi)結(jié)果,從結(jié)果中每個(gè)分類(lèi)選一個(gè)點(diǎn)。
h. 層次聚類(lèi)算法思想:
1 )將每個(gè)對(duì)象歸為一類(lèi),共得到N類(lèi),每類(lèi)僅包含一個(gè)對(duì)象。類(lèi)與類(lèi)之間的距離就是它們包含的對(duì)象之間的距離。
2)找到最接近的兩個(gè)類(lèi)并合并成一類(lèi),于是總的類(lèi)數(shù)少了一個(gè)。
3)重新計(jì)算新的類(lèi)與所有舊類(lèi)之間的距離。
4)重復(fù)第2步和第3步,直到最后合并一個(gè)類(lèi)為止。
根據(jù)步驟3的不同,可將層次聚類(lèi)方法分為幾類(lèi):single-linkage,complete-linkage,average-linkage等。
i .K-means算法為什么在每次迭代更新時(shí)使用各簇中樣本點(diǎn)的平均值為聚類(lèi)中心
要想使損失函數(shù)(平方誤差)最小,聚類(lèi)中心要為各簇中樣本點(diǎn)的平均值。
https://blog.csdn.net/weiyongle1996/article/details/77925325
j. K-Means會(huì)不會(huì)陷入一直選質(zhì)心的過(guò)程,永遠(yuǎn)停不下來(lái)?
不會(huì),有數(shù)學(xué)證明K-Means一定會(huì)收斂,大致思路是利用SSE的概念(也就是誤差平方和),即每個(gè)點(diǎn)到自身所歸屬質(zhì)心的距離的平方和,這個(gè)平方和是一個(gè)函數(shù),然后能夠證明這個(gè)函數(shù)是可以最終收斂的函數(shù)。
k. 判斷每個(gè)點(diǎn)歸屬哪個(gè)質(zhì)心的距離怎么算?
歐幾里得聚類(lèi),余弦相似度
歌手大賽,三個(gè)評(píng)委給三個(gè)歌手打分,第一個(gè)評(píng)委的打分(10,8,9) 第二個(gè)評(píng)委的打分(4,3,2),第三個(gè)評(píng)委的打分(8,9,10)
如果采用余弦相似度來(lái)看每個(gè)評(píng)委的差異,雖然每個(gè)評(píng)委對(duì)同一個(gè)選手的評(píng)分不一樣,但第一、第二兩個(gè)評(píng)委對(duì)這四位歌手實(shí)力的排序是一樣的,只是第二個(gè)評(píng)委對(duì)滿(mǎn)分有更高的評(píng)判標(biāo)準(zhǔn),說(shuō)明第一、第二個(gè)評(píng)委對(duì)音樂(lè)的品味上是一致的。 因此,用余弦相似度來(lái)看,第一、第二個(gè)評(píng)委為一類(lèi)人,第三個(gè)評(píng)委為另外一類(lèi)。 如果采用歐氏距離, 第一和第三個(gè)評(píng)委的歐氏距離更近,就分成一類(lèi)人了,但其實(shí)不太合理,因?yàn)樗麄儗?duì)于四位選手的排名都是完全顛倒的。
l. k-means聚類(lèi)需要考慮單位一致
1)min-max標(biāo)準(zhǔn)化(離差標(biāo)準(zhǔn)化):對(duì)原始數(shù)據(jù)進(jìn)行線性變換,是結(jié)果落到【0,1】區(qū)間,轉(zhuǎn)換方法為 X’=(X-min)/(max-min),其中max為樣本數(shù)據(jù)最大值,min為樣本數(shù)據(jù)最小值。
2)z-score標(biāo)準(zhǔn)化(標(biāo)準(zhǔn)差標(biāo)準(zhǔn)化):處理后的數(shù)據(jù)符合標(biāo)準(zhǔn)正態(tài)分布(均值為0,方差為1),轉(zhuǎn)換公式:X減去均值,再除以標(biāo)準(zhǔn)差
m. 關(guān)于離群值?
答:離群值就是遠(yuǎn)離整體的,非常異常、非常特殊的數(shù)據(jù)點(diǎn),在聚類(lèi)之前應(yīng)該將這些“極大”“極小”之類(lèi)的離群數(shù)據(jù)都去掉,否則會(huì)對(duì)于聚類(lèi)的結(jié)果有影響。但是,離群值往往自身就很有分析的價(jià)值,可以把離群值單獨(dú)作為一類(lèi)來(lái)分析。
o. 用SPSS作出的K-Means聚類(lèi)結(jié)果,包含ANOVA(單因素方差分析),是什么意思?
簡(jiǎn)單說(shuō)就是判斷用于聚類(lèi)的變量是否對(duì)于聚類(lèi)結(jié)果有貢獻(xiàn),方差分析檢驗(yàn)結(jié)果越顯著的變量,說(shuō)明對(duì)聚類(lèi)結(jié)果越有影響。對(duì)于不顯著的變量,可以考慮從模型中剔除。
p. 業(yè)務(wù)專(zhuān)家的作用非常大,主要體現(xiàn)在聚類(lèi)變量的選擇和對(duì)于聚類(lèi)結(jié)果的解讀。
相關(guān)文章
今日頭條秋招數(shù)據(jù)分析崗面試題與參考答案整理
這篇文章主要介紹了今日頭條秋招數(shù)據(jù)分析崗面試題與參考答案,整理總結(jié)了今日頭條數(shù)據(jù)分析崗面試中的各種問(wèn)題、參考答案與個(gè)人心得體會(huì),需要的朋友可以參考下2019-12-11京東大數(shù)據(jù)方向Java實(shí)習(xí)面試經(jīng)歷簡(jiǎn)述【一面、二面】
這篇文章主要介紹了京東大數(shù)據(jù)方向Java實(shí)習(xí)面試經(jīng)歷,簡(jiǎn)單描述了京東大數(shù)據(jù)方向java面試一面與二面過(guò)程中所遇到的各種問(wèn)題,需要的朋友可以參考下2019-12-10大數(shù)據(jù)爬蟲(chóng)實(shí)習(xí)招聘面試題解析
這篇文章主要介紹了大數(shù)據(jù)爬蟲(chóng)實(shí)習(xí)招聘面試題,總結(jié)分析了大數(shù)據(jù)爬蟲(chóng)崗位招聘中的面試題及參考答案,需要的朋友可以參考下2019-11-29阿里大數(shù)據(jù)工程師面試流程與經(jīng)驗(yàn)總結(jié)
這篇文章主要介紹了阿里大數(shù)據(jù)工程師面試流程與經(jīng)驗(yàn),總結(jié)分析了阿里大數(shù)據(jù)工程師三輪面試的經(jīng)歷與相關(guān)問(wèn)題注意事項(xiàng),需要的朋友可以參考下2019-11-15大數(shù)據(jù)spark經(jīng)典面試題目與參考答案總結(jié)
這篇文章主要介紹了大數(shù)據(jù)spark經(jīng)典面試題目,整理總結(jié)了大數(shù)據(jù)spark面試中遇到的比較經(jīng)典的簡(jiǎn)答題與選擇題,涉及spark概念、原理、配置、使用等相關(guān)知識(shí)點(diǎn),需要的朋友可以參2019-10-24大數(shù)據(jù)相關(guān)常見(jiàn)面試題與答案整理
這篇文章主要介紹了大數(shù)據(jù)相關(guān)常見(jiàn)面試題與答案,總結(jié)分析了大數(shù)據(jù)相關(guān)的概念、技術(shù)、原理,需要的朋友可以參考下2019-10-21數(shù)據(jù)挖掘常見(jiàn)面試題與參考答案簡(jiǎn)析
這篇文章主要介紹了數(shù)據(jù)挖掘常見(jiàn)面試題與參考答案,簡(jiǎn)單分析了數(shù)據(jù)挖掘面試中比較常見(jiàn)的概念、知識(shí)點(diǎn)與解答技巧,需要的朋友可以參考下2019-10-17大數(shù)據(jù)基礎(chǔ)面試題考點(diǎn)與知識(shí)點(diǎn)整理
這篇文章主要介紹了大數(shù)據(jù)基礎(chǔ)面試題考點(diǎn)與知識(shí)點(diǎn),總結(jié)整理了大數(shù)據(jù)常見(jiàn)的各種知識(shí)點(diǎn)、難點(diǎn)、考點(diǎn)以及相關(guān)注意事項(xiàng),需要的朋友可以參考下2019-09-09BAT面試中的大數(shù)據(jù)相關(guān)問(wèn)題筆記
這篇文章主要介紹了BAT面試中的大數(shù)據(jù)相關(guān)問(wèn)題,涉及大數(shù)據(jù)相關(guān)的概念、原理、知識(shí)點(diǎn)與算法等問(wèn)題,需要的朋友可以參考下2019-08-30BAT大數(shù)據(jù)面試題與參考答案小結(jié)
這篇文章主要介紹了BAT大數(shù)據(jù)面試題與參考答案,總結(jié)分析了大數(shù)據(jù)常見(jiàn)的各種知識(shí)點(diǎn)、疑難問(wèn)題與參考答案,需要的朋友可以參考下2019-08-16

