常見的預測方法有單點預測,即確定性預測;區(qū)間預測;和概率預測三種方法。
單點預測,顧名思義,只能給出一個預測值,不能表達該預測值的可信度;
區(qū)間預測在單點預測的基礎上,給出某次預測值在某一區(qū)間上的可信度,即能夠給出一個預測范圍,以及以多大的可能性落在這個范圍;
概率預測是咋區(qū)間預測的基礎上,給出一個概率分布,預測出所有可能出現(xiàn)的結果,以及對應的概率。這種方法比較全面,能夠給出全局信息,適于風險相關的分析。目前在氣象、地震、水文和農(nóng)業(yè)相關方面用的比較多。
一、描述性統(tǒng)計
描述性統(tǒng)計是一類統(tǒng)計方法的匯總,揭示了數(shù)據(jù)分布特性。它主要包括數(shù)據(jù)的頻數(shù)分析、數(shù)據(jù)的集中趨勢分析、數(shù)據(jù)離散程度分析、數(shù)據(jù)的分布以及一些基本的統(tǒng)計圖形。
1、缺失值填充:常用方法有剔除法、均值法、決策樹法。
2、正態(tài)性檢驗:很多統(tǒng)計方法都要求數(shù)值服從或近似服從正態(tài)分布,所以在做數(shù)據(jù)分析之前需要進行正態(tài)性檢驗。常用方法:非參數(shù)檢驗的K-量檢驗、P-P圖、Q-Q圖、W檢驗、動差法。
二、回歸分析
回歸分析是應用極其廣泛的數(shù)據(jù)分析方法之一。它基于觀測數(shù)據(jù)建立變量間適當?shù)囊蕾囮P系,以分析數(shù)據(jù)內(nèi)在規(guī)律。
1. 一元線性分析
只有一個自變量X與因變量Y有關,X與Y都必須是連續(xù)型變量,因變量Y或其殘差必須服從正態(tài)分布。
2. 多元線性回歸分析
使用條件:分析多個自變量X與因變量Y的關系,X與Y都必須是連續(xù)型變量,因變量Y或其殘差必須服從正態(tài)分布。
3.Logistic回歸分析
線性回歸模型要求因變量是連續(xù)的正態(tài)分布變量,且自變量和因變量呈線性關系,而Logistic回歸模型對因變量的分布沒有要求,一般用于因變量是離散時的情況。
4. 其他回歸方法:非線性回歸、有序回歸、Probit回歸、加權回歸等。
三、方差分析
使用條件:各樣本須是相互獨立的隨機樣本;各樣本來自正態(tài)分布總體;各總體方差相等。
1. 單因素方差分析:一項試驗只有一個影響因素,或者存在多個影響因素時,只分析一個因素與響應變量的關系。
2. 多因素有交互方差分析:一頊實驗有多個影響因素,分析多個影響因素與響應變量的關系,同時考慮多個影響因素之間的關系
3. 多因素無交互方差分析:分析多個影響因素與響應變量的關系,但是影響因素之間沒有影響關系或忽略影響關系
4. 協(xié)方差分祈:傳統(tǒng)的方差分析存在明顯的弊端,無法控制分析中存在的某些隨機因素,降低了分析結果的準確度。協(xié)方差分析主要是在排除了協(xié)變量的影響后再對修正后的主效應進行方差分析,是將線性回歸與方差分析結合起來的一種分析方法。
四、假設檢驗
1. 參數(shù)檢驗
參數(shù)檢驗是在已知總體分布的條件下(一股要求總體服從正態(tài)分布)對一些主要的參數(shù)(如均值、百分數(shù)、方差、相關系數(shù)等)進行的檢驗 。
2. 非參數(shù)檢驗
非參數(shù)檢驗則不考慮總體分布是否已知,常常也不是針對總體參數(shù),而是針對總體的某些一般性假設(如總體分布的位罝是否相同,總體分布是否正態(tài))進行檢驗。
適用情況:順序類型的數(shù)據(jù)資料,這類數(shù)據(jù)的分布形態(tài)一般是未知的。
1)雖然是連續(xù)數(shù)據(jù),但總體分布形態(tài)未知或者非正態(tài);
2)總體分布雖然正態(tài),數(shù)據(jù)也是連續(xù)類型,但樣本容量極小,如10以下;
主要方法包括:卡方檢驗、秩和檢驗、二項檢驗、游程檢驗、K-量檢驗等。
一、掌握基礎、更新知識。
基本技術怎么強調(diào)都不過分。這里的術更多是(計算機、統(tǒng)計知識), 多年做數(shù)據(jù)分析、數(shù)據(jù)挖掘的經(jīng)歷來看、以及業(yè)界朋友的交流來看,這點大家深有感觸的。
數(shù)據(jù)庫查詢—SQL 數(shù)據(jù)分析師在計算機的層面的技能要求較低,主要是會SQL,因為這里解決一個數(shù)據(jù)提取的問題。有機會可以去逛逛一些專業(yè)的數(shù)據(jù)論壇,學習一些SQL技巧、新的函數(shù),對你工作效率的提高是很有幫助的。
統(tǒng)計知識與數(shù)據(jù)挖掘 你要掌握基礎的、成熟的數(shù)據(jù)建模方法、數(shù)據(jù)挖掘方法。例如:多元統(tǒng)計:回歸分析、因子分析、離散等,數(shù)據(jù)挖掘中的:決策樹、聚類、關聯(lián)規(guī)則、神經(jīng)網(wǎng)絡等。
但是還是應該關注一些博客、論壇中大家對于最新方法的介紹,或者是對老方法的新運用,不斷更新自己知識,才能跟上時代,也許你工作中根本不會用到,但是未來呢?行業(yè)知識 如果數(shù)據(jù)不結合具體的行業(yè)、業(yè)務知識,數(shù)據(jù)就是一堆數(shù)字,不代表任何東西。是冷冰冰,是不會產(chǎn)生任何價值的,數(shù)據(jù)驅動營銷、提高科學決策一切都是空的。
一名數(shù)據(jù)分析師,一定要對所在行業(yè)知識、業(yè)務知識有深入的了解。例如:看到某個數(shù)據(jù),你首先必須要知道,這個數(shù)據(jù)的統(tǒng)計口徑是什么?是如何取出來的?這個數(shù)據(jù)在這個行業(yè), 在相應的業(yè)務是在哪個環(huán)節(jié)是產(chǎn)生的?數(shù)值的代表業(yè)務發(fā)生了什么(背景是什么)?對于A部門來說,本月新會員有10萬,10萬好還是不好呢?先問問上面的這個問題:對于A部門,1、新會員的統(tǒng)計口徑是什么。
第一次在使用A部門的產(chǎn)品的會員?還是在站在公司角度上說,第一次在公司發(fā)展業(yè)務接觸的會員?2、是如何統(tǒng)計出來的。A:時間;是通過創(chuàng)建時間,還是業(yè)務完成時間。
B:業(yè)務場景。是只要與業(yè)務發(fā)接觸,例如下了單,還是要業(yè)務完成后,到成功支付。
3、這個數(shù)據(jù)是在哪個環(huán)節(jié)統(tǒng)計出來。在注冊環(huán)節(jié),在下單環(huán)節(jié),在成功支付環(huán)節(jié)。
4、這個數(shù)據(jù)代表著什么。10萬高嗎?與歷史相同比較?是否做了營銷活動?這個行業(yè)處理行業(yè)生命同期哪個階段?在前面二點,更多要求你能按業(yè)務邏輯,來進行數(shù)據(jù)的提取(更多是寫SQL代碼從數(shù)據(jù)庫取出數(shù)據(jù))。
后面二點,更重要是對業(yè)務了解,更行業(yè)知識了解,你才能進行相應的數(shù)據(jù)解讀,才能讓數(shù)據(jù)產(chǎn)生真正的價值,不是嗎?對于新進入數(shù)據(jù)行業(yè)或者剛進入數(shù)據(jù)行業(yè)的朋友來說:行業(yè)知識都重要,也許你看到很多的數(shù)據(jù)行業(yè)的同仁,在微博或者寫文章說,數(shù)據(jù)分析思想、行業(yè)知識、業(yè)務知識很重要。我非常同意。
因為作為數(shù)據(jù)分析師,在發(fā)表任何觀點的時候,都不要忘記你居于的背景是什么?但大家一定不要忘記了一些基本的技術,不要把基礎去忘記了,如果一名數(shù)據(jù)分析師不會寫SQL,那麻煩就大了。哈哈。
你只有把數(shù)據(jù)先取對了,才能正確的分析,否則一切都是錯誤了,甚至會導致致命的結論。
新同學,還是好好花時間把基礎技能學好。因為基礎技能你可以在短期內(nèi)快速提高,但是在行業(yè)、業(yè)務知識的是一點一滴的積累起來的,有時候是急不來的,這更需要花時間慢慢去沉淀下來。
不要過于追求很高級、高深的統(tǒng)計方法,我提倡有空還是要多去學習基本的統(tǒng)計學知識,從而提高工作效率,達到事半功倍。以我經(jīng)驗來說,我負責任告訴新進的同學,永遠不要忘記基本知識、基本技能的學習。
二、要有三心。1、細心。
2、耐心。3、靜心。
數(shù)據(jù)分析師其實是一個細活,特別是在前文提到的例子中的前面二點。而且在數(shù)據(jù)分析過程中,是一個不斷循環(huán)迭代的過程,所以一定在耐心,不怕麻煩,能靜下心來不斷去修改自己的分析思路。
三、形成自己結構化的思維。數(shù)據(jù)分析師一定要嚴謹。
而嚴謹一定要很強的結構化思維,如何提高結構化思維,也許只需要工作隊中不斷的實踐。但是我推薦你用mindmanagement,首先把你的整個思路整理出來,然后根據(jù)分析不斷深入、得到的信息不斷增加的情況下去完善你的結構,慢慢你會形成一套自己的思想。
當然有空的時候去看看《麥肯錫思維》、結構化邏輯思維訓練的書也不錯。在我以為多看看你身邊更資深同事的報告,多問問他們是怎么去考慮這個問題的,別人的思想是怎么樣的?他是怎么構建整個分析體系的。
四、業(yè)務、行業(yè)、商業(yè)知識。當你掌握好前面的基本知識和一些技巧性東西的時候,你應該在業(yè)務、行業(yè)、商業(yè)知識的學習與積累上了。
這個放在最后,不是不重要,而且非常重要,如果前面三點是決定你能否進入這個行業(yè),那么這則是你進入這個行業(yè)后,能否成功的最根本的因素。 數(shù)據(jù)與具體行業(yè)知識的關系,比作池塘中魚與水的關系一點都不過分,數(shù)據(jù)(魚)離開了行業(yè)、業(yè)務背景(水)是死的,是不可能是“活”。
而沒有“魚”的水,更像是“死”水,你去根本不知道看什么(方向在哪)。如何提高業(yè)務知識,特別是沒有相關背景的同學。
很簡單,我總結了幾點:1、多向業(yè)務部門的同事請教,多溝通。多向他們請教,數(shù)據(jù)分析師與業(yè)務部門沒有利益沖突,而更向是共生體,所以如果你態(tài)度好,相信業(yè)務部門的同事也很愿意把他們知道的告訴你。
2、永遠不要忘記了google大神,定制一些行業(yè)的關鍵字,每天都先看看定制的郵件。3、每天有空去瀏。
Time Series Analysis Methods
Simple Moving Average Formula
Weighted Moving Average Formula
Exponential Smoothing Model
Logistic Regre等方法都可以解決。
根據(jù)你的實際,最簡單的就是選前幾個月的銷售額進行平均。
也可以將越靠近的月份銷售額給較大的權重,加權平均。
還可以將前面的數(shù)據(jù)進行回歸分析,得出下個月的銷售額。
都是理論方法,可能會受到季節(jié)因素、環(huán)境因素、營銷因素等的影響,還有待實際驗證。
總的分兩種:
1 列表法
將實驗數(shù)據(jù)按一定規(guī)律用列表方式表達出來是記錄和處理實驗數(shù)據(jù)最常用的方法。表格的設計要求對應關系清楚、簡單明了、有利于發(fā)現(xiàn)相關量之間的物理關系;此外還要求在標題欄中注明物理量名稱、符號、數(shù)量級和單位等;根據(jù)需要還可以列出除原始數(shù)據(jù)以外的計算欄目和統(tǒng)計欄目等。最后還要求寫明表格名稱、主要測量儀器的型號、量程和準確度等級、有關環(huán)境條件參數(shù)如溫度、濕度等。
2 作圖法
作圖法可以最醒目地表達物理量間的變化關系。從圖線上還可以簡便求出實驗需要的某些結果(如直線的斜率和截距值等),讀出沒有進行觀測的對應點(內(nèi)插法),或在一定條件下從圖線的延伸部分讀到測量范圍以外的對應點(外推法)。此外,還可以把某些復雜的函數(shù)關系,通過一定的變換用直線圖表示出來。例如半導體熱敏電阻的電阻與溫度關系為,取對數(shù)后得到,若用半對數(shù)坐標紙,以lgR為縱軸,以1/T為橫軸畫圖,則為一條直線。
定量預測方法有:
加權算術平均法
用各種權數(shù)算得的平均數(shù)稱為加權算術平均數(shù),它可以自然數(shù)作權數(shù),也可以項目出現(xiàn)的次數(shù)作權數(shù),所求平均數(shù)值即為測定值。
趨勢平均預測法
趨勢平均預測法是以過去發(fā)生的實際數(shù)為依據(jù),在算術平均數(shù)的基礎上,假定未來時期的數(shù)值是它近期數(shù)值直接繼續(xù),而同較遠時期的數(shù)值關系較小的一種預測方法。
指數(shù)平滑法
指數(shù)平滑法是以一個指標本身過去變化的趨勢作為預測未來的依據(jù)的一種方法。對未來預測時,考慮則近期資料的影響應比遠期為大,因而對不同時期的資料不同的權數(shù),越是近期資料權數(shù)越大,反之權數(shù)越小。
(4)平均發(fā)展速度法
(5)一元線性回歸預測法
根據(jù)x、y現(xiàn)有數(shù)據(jù),尋求合理的a、b回歸系數(shù),得出一條變動直線,并使線上各點至實際資料上的對應點之間的距離最小。
設變動直線方程為:y=a+bx
(6)高低點法
高低點法是利用代數(shù)式y(tǒng)=a+bx,選用一定歷史資料中的最高業(yè)務量與最低業(yè)務量的總成本(或總費用)之差△y,與兩者業(yè)務量之差△x進行對比,求出b,然后再求出a的方法。
數(shù)據(jù)分析的三個常用方法:
1. 數(shù)據(jù)趨勢分析
趨勢分析一般而言,適用于產(chǎn)品核心指標的長期跟蹤,比如,點擊率,GMV,活躍用戶數(shù)等。做出簡單的數(shù)據(jù)趨勢圖,并不算是趨勢分析,趨勢分析更多的是需要明確數(shù)據(jù)的變化,以及對變化原因進行分析。
趨勢分析,最好的產(chǎn)出是比值。在趨勢分析的時候需要明確幾個概念:環(huán)比,同比,定基比。環(huán)比是指,是本期統(tǒng)計數(shù)據(jù)與上期比較,例如2019年2月份與2019年1月份相比較,環(huán)比可以知道最近的變化趨勢,但是會有些季節(jié)性差異。為了消除季節(jié)差異,于是有了同比的概念,例如2019年2月份和2018年2月份進行比較。定基比更好理解,就是和某個基點進行比較,比如2018年1月作為基點,定基比則為2019年2月和2018年1月進行比較。
比如:2019年2月份某APP月活躍用戶數(shù)我2000萬,相比1月份,環(huán)比增加2%,相比去年2月份,同比增長20%。趨勢分析另一個核心目的則是對趨勢做出解釋,對于趨勢線中明顯的拐點,發(fā)生了什么事情要給出合理的解釋,無論是外部原因還是內(nèi)部原因。
2. 數(shù)據(jù)對比分析
數(shù)據(jù)的趨勢變化獨立的看,其實很多情況下并不能說明問題,比如如果一個企業(yè)盈利增長10%,我們并無法判斷這個企業(yè)的好壞,如果這個企業(yè)所處行業(yè)的其他企業(yè)普遍為負增長,則5%很多,如果行業(yè)其他企業(yè)增長平均為50%,則這是一個很差的數(shù)據(jù)。
對比分析,就是給孤立的數(shù)據(jù)一個合理的參考系,否則孤立的數(shù)據(jù)毫無意義。在此我向大家推薦一個大數(shù)據(jù)技術交流圈: 658558542 突破技術瓶頸,提升思維能力 。
一般而言,對比的數(shù)據(jù)是數(shù)據(jù)的基本面,比如行業(yè)的情況,全站的情況等。有的時候,在產(chǎn)品迭代測試的時候,為了增加說服力,會人為的設置對比的基準。也就是A/B test。
比較試驗最關鍵的是A/B兩組只保持單一變量,其他條件保持一致。比如測試首頁改版的效果,就需要保持A/B兩組用戶質(zhì)量保持相同,上線時間保持相同,來源渠道相同等。只有這樣才能得到比較有說服力的數(shù)據(jù)。
3. 數(shù)據(jù)細分分析
在得到一些初步結論的時候,需要進一步地細拆,因為在一些綜合指標的使用過程中,會抹殺一些關鍵的數(shù)據(jù)細節(jié),而指標本身的變化,也需要分析變化產(chǎn)生的原因。這里的細分一定要進行多維度的細拆。常見的拆分方法包括:
分時 :不同時間短數(shù)據(jù)是否有變化。
分渠道 :不同來源的流量或者產(chǎn)品是否有變化。
分用戶 :新注冊用戶和老用戶相比是否有差異,高等級用戶和低等級用戶相比是否有差異。
分地區(qū) :不同地區(qū)的數(shù)據(jù)是否有變化。
組成拆分 :比如搜索由搜索詞組成,可以拆分不同搜索詞;店鋪流量由不用店鋪產(chǎn)生,可以分拆不同的店鋪。
細分分析是一個非常重要的手段,多問一些為什么,才是得到結論的關鍵,而一步一步拆分,就是在不斷問為什么的過程。
借助工具,未至科技魔方是一款大數(shù)據(jù)模型平臺,是一款基于服務總線與分布式云計算兩大技術架構的一款數(shù)據(jù)分析、挖掘的工具平臺,其采用分布式文件系統(tǒng)對數(shù)據(jù)進行存儲,支持海量數(shù)據(jù)的處理。
采用多種的數(shù)據(jù)采集技術,支持結構化數(shù)據(jù)及非結構化數(shù)據(jù)的采集。通過圖形化的模型搭建工具,支持流程化的模型配置。
通過第三方插件技術,很容易將其他工具及服務集成到平臺中去。數(shù)據(jù)分析研判平臺就是海量信息的采集,數(shù)據(jù)模型的搭建,數(shù)據(jù)的挖掘、分析最后形成知識服務于實戰(zhàn)、服務于決策的過程,平臺主要包括數(shù)據(jù)采集部分,模型配置部分,模型執(zhí)行部分及成果展示部分等。
聲明:本網(wǎng)站尊重并保護知識產(chǎn)權,根據(jù)《信息網(wǎng)絡傳播權保護條例》,如果我們轉載的作品侵犯了您的權利,請在一個月內(nèi)通知我們,我們會及時刪除。
蜀ICP備2020033479號-4 Copyright ? 2016 學習鳥. 頁面生成時間:2.925秒