2021年7月16日 星期五

統計學,最強的商業武器(商務篇)

 統計學,最強的商業武器(商務篇):把數據資料轉換成獲利能力的智慧

第1章 用於經營策略的統計學

- 對於相差懸殊的資料,有時先做「取對數」處理,再用於分析,結果會更為貼切。
- 對於解釋變數的組合也可能產生疑問。可藉由加入「相乘之值」(稱為交互作用)
作為解釋變數來分析的方式以獲得答案。
- 也有一種將解釋變數的平方值(稱作平方項)納入分析的技巧可用。
- 即使分析得不夠完整,「似乎能賺到30億日圓」的分析結果一值無法實現的狀態,
和開始採取行動「投入幾千萬日圓來嘗試驗證」這兩者,到底何者較為明智?
- 在進行與經營策略有關的分析時,做為分析對象的企業數量往往有限,
就算可能的解述變數多達一百個,也很難全都用上。因此,必須以逐步排除法等變數選擇演算法,
以及你自己的眼睛來做取捨,將影響獲利的重要解釋變數給挑出來。
- 變異量成分分析(Components of Variance Analysis或Variance Components Analysis),
它可被理解為包含隨機效果(Random Effects)之混合效果模型(Mixed Effects Models)的一部分。
- 一般的多元迴歸分析屬於固定效果模型(Fixed Effects Models)。

第2章 用於人事的統計學

- 羅吉斯迴歸結果的解讀:比值比(Odds Ratio):
對於像性別這種質化的解釋變數,會採取
「當解釋變數符合某條件時,為優秀員工的機率大約會變成幾倍」的解讀方式。
而對於量化的,像人格五大特質的得分或支出的費用金額等以數字大小表示的解釋變數,
則要採取這些數值「每增加1,為優秀員工的機率大約會有增加為幾倍之傾向」的解讀方式。
- 95%的信賴區間代表的是,收集無限多數據應該就能得知的比值比「大概就在這個範圍內」。
此範圍的兩端若是都比1大,或反之都比1小的話,p值應該會小於0.05,亦即都表示了此結果
「不太可能是單純由資料的變動性所造成」,是可信賴的。

第3章 用於行銷的統計學

- 「不考慮顧客需求,總之大量販賣相同產品,成本才能壓低」與
「曾對每位顧客的需求販賣對應產品,才容易銷售」這兩者的平衡,
在現代行銷中是以所謂「市場區隔(Segmentation)」的觀念來解決。
簡言之,就是將市場整體分割(區隔)成數個需求或生或風格相似的小群體(Segment),以思考行銷策略。
- 而考慮要集中火力針對這些區隔中的何者進行行銷這件事,也稱為目標市場選擇(Targeting)。
- 一旦能決定出鎖定的顧客族群,並充分理解這些的人,接著便可考慮「要賣什麼,又要如何賣?」
具體來說,「要賣什麼」指的就是所提供的商品及服務,
而在那之前應先於抽象層次「用一句話來解釋」自己打算賣的東西,
亦即應先思考定位(Positioning)這點,也是現代行銷的準則之一。
- 行銷數據分析的步驟
  1. 設定分析的目標對象
  2. 包含應分析變數的資料收集
  3. 分析所得之資料
  4. 解讀與行動的規劃
- 多元迴歸分析也好,羅吉斯回歸也罷,都是基於出現在分析結果中的解釋變數
「彼此之間無加乘效果或相互作用(在專業術語中稱之為交互作用)」
此一假設,來推估解釋變數和成果之間的關聯性。
- 例如:若有一批資料所畫出的圖表如上圖所示,那麼從這批資料能得到的多元回歸結果。
在此例中,女性的平均消費金額高於男性但未必呈現出年齡越大消費金額越高的傾向。
而男性雖然平均消費金額低於女性,可是隨著年另增加,消費金額卻有隨之升高的趨勢。
在這種情況下,會得到「若性別相同,年齡大的比較會買」且「若年齡相同,女性比較會買」的結果。
不過,實際上消費金額最高的市場區隔,是位於圖右上方的「60歲以上的男性」。
這是因為被忽略了基礎假設「解釋變數之間的交互作用」實際上真的存在的關係。
雖然光是年齡大這件事與消費金額沒有關聯性,但卻存在有「為男性且年齡大」的交互作用。
- 聚類分析所用的變數要能夠提示「怎樣的行銷策略可能有效」,或者更具體地說,
怎樣的產品、價格、通路、促銷是較為合理的。
而一旦獲得足以為所有聚類命名的具說服力的分析結果,便要進行成果的比較。
換言之,像是做為成果的運動服飾之年平均消費金額,或者肯定與該成果相關的消費次數、
所購買的商品數量、單次的消費金額等解釋變數,都最好別用於聚類分析。
- 在市場區隔方面,基於交互作用的問題,「就算將所有具顯著影響力的解釋變數都組合起來,也不見得就能成為理想的市場區隔」,但在定位方面卻非如此。若能藉由可用一句話表達的定位,
將出現在分析中的所有解釋變數都改變成能讓成果提高的狀態,就是個非常好的策略。
- 之所以會有這樣的差異,應該是因為相對於市場區隔是在做「選擇」,定位則是在「符合條件」。
要「選擇」具有某種特徵的東西時,就等於「不選」不具該特徵的東西,
但要同時「符合」多種特徵並非不可能。
- 只不過一旦試圖同時符合太多條件,定位往往就會變得不夠清楚,而無法以一句話來表達,
那樣就本末倒置了。因此,首先要選出主要的行為控制因素,然後再思考有無容易同時符合的條件。
- 比值比或迴歸係數及p值等雖可做為大略的標準,提供思考策略時的線索,
但卻無法告訴我們「要製造出這種變化,到底有多少實際上的可能性」。
這些所顯示的不過是「一旦製造出變化,可能產生多大影響」罷了。
- 為了判斷「是否為好的分歧」,有一些指標可以利用,像是資訊熵(Information Entropy)及
吉尼係數(Gini Coefficient)、卡方檢定值等,而這些指標的選用區別了不同的分析方法。
例如:使用資訊熵的,包括名為C4.5及C5.0的演算法,
CART(Classification And Regression Tree,分類與迴歸數)演算法則多半使用吉尼係數。
還有使用卡方檢定值的方法叫做CAID(Chi-Squared Automatic Interaction Detection)演算法。

第4章 用於營運管理的統計學

- 交叉驗證法(Cross Validation),就是將進行擬合的資料和檢驗其精準度用的資料隨機分群。
一般基於「用來訓練預測模型」之意,通常將前者稱為訓練資料,
而用來檢驗其精準度的後者稱作測試資料。
- 最常見的所謂10折(10-fold)交叉驗證,就是先將整體資料隨機分成10個群組。
然後以其中的9個群組為訓練資料,剩下的1個群組為測試資料的方法,
反覆進行10次,值到每個群組都當過一次測試資料為止,藉此驗證其精準度。

2021年6月26日 星期六

人工智慧在台灣:產業轉型的契機與挑戰

 人工智慧在台灣:產業轉型的契機與挑戰

Part 1 人工智慧

第二章 機器學習是什麼?

- 機器學習與統計最大的差別在於它們的目的。
統計學的目的在於基於樣本(Sample)找出真相(Universe)。
例如全台灣2,300萬人口,能不能只選出1,000人各問他們幾個問題,
就能夠了解全台灣所有人的生活型態、就業狀態及政治傾向?
機器學習目的是讓電腦從歷史資料裡,學到如何處理新的資料以解決問題。
例如能不能從醫生的X光判讀結果,學習到怎麼看新的X片?
能不能從一個人的刷卡及繳費行為,預測她若借十萬元會不會準時還款?

- 深度學習與其他方法有個根本上的差異,在於是否能夠
自動進行「特徵工程」(feature engineering)。
- 在機器學習模型開發過程中,發想及定義這些衍生變數的過程,就叫做特徵工程。
- 簡單用一句話來說,深度學習帶來的最大貢獻就是,自動化的特徵工程。
不但自動化,而且可以找出比人類所定義的衍生變數更好、預測力更強的特徵。
- 傳統機器學習從資料學到規則,比起專家系統更為準確,
但傳統機器學習,需要人們基於觀測值來定義特徵(衍生變數);
而深度學習連定義特徵(特徵工程)都幫我們做了。
而且一個深度學習模型,可以同時進行特徵工程以及規則學習,準確度還比以往更高。
- 無論選擇哪一種類型的題目,以及使用哪一種模型,資料都是專案成敗的關鍵。
以最常用的監督式學習來說,若觀測值與決策的關聯性低、雜訊太高,或是資料量不夠大,
都會影響機器學習的準確度。

Part 2 人工智慧與產業發展

第五章 產業人工智慧化經驗談

- 根據國際研調機構顧能(Gartner)的一篇報告,資料分析可分為四個層次。
這四種階段,分別要回答不同問題
1.描述型分析是為了解釋「發生了什麼」
2.診斷型分析則是告知「為什麼發生」
通常將這兩種資料分析型態歸類於傳統商業智慧平台的能力,還不屬於人工智慧。
- 3.預測分析能解釋「未來是否發生」,與4.指示型分析說明「如何讓它發生」,
就屬於人工智慧的範疇。因為預測和指示,是擁有人類智慧才能進行的工作。
- 描述型分析評估現況及了解問題,解釋型分析提供問題的初步判斷,
而預測及最佳化提供改善和解決問題的工具。
- 描述型分析指的是利用統計及資料視覺化,將事實呈現出來,幫助觀看者正確評估情勢;
其中,一個重要但常被忽略的目的是,找出無法從原始資料中判讀出來的隱性資訊。

- 零售業與金融業的共通日常決策問題之中,最常被關注的應該是發送廣告文宣。
針對某份文宣,篩選出哪些客戶可能較感興趣,畢竟發送文宣需要成本,同時也避免讓收件者反感而退訂。篩選客戶的演算法稱為推薦系統。
- 在推薦系統之外,如何設計個人化文宣也是門學問。
個人化文宣指的是,內容並不完全由行銷團隊設計,而是透過以演算法,根據顧客的屬性及購買行為,來進行全自動的量身訂做。

- 在金融業中,人工智慧的應用可以大略分為五個面向:風險、行銷、服務、市場及作業流程。
風險面向就是對未來風險盡可能的精準預測,這裡提到的風險,
主要是信用風險、市場風險、流動風險及作業風險等,
保險業的情境裡包含保險精算,銀行業的情境裡包含預測帳戶的盜用甚至買賣,以及信用卡盜刷等。
- 在行銷及服務面向,發送廣告文宣及個人化文宣設計就是一例。
同時,也可以將機器學習應用在商品及服務的改良。
例如改良網頁及手機APP介面、信用卡的優惠設計、保單的參數組合、設計行銷活動,甚至到分行的抽號機制及座椅安排,都有許多發會的空間。
- 再進一步,以文字或語音客服機器人來提供理財顧問,或保單規劃的服務,也都在可預測的未來之中,大幅延伸金融業的客戶服務範圍。
- 對於金融市場的掌握度,無論是大眾熟知的投資工具,如股票、基金、ETF、債券,或是與總體經濟息息相關的利率、匯率,無論希望做某種程度的預測,或設計交易策略,或是設計衍生商品,或做市場撮合(market making),機器學習與深度學習都是重要的關鍵技術。

Part 3 迎向未來的準備

第九章 給白領工作者的建議
- 若要讓人工智慧發揮所長,企業必須容許及鼓勵實驗,允許各種嘗試與變化,要知道實驗可以幫助我們確認未知,但也可能會犯錯,甚至導致更差的成效,因次企業必須有容錯的機制及文化。
- 最理想的做法是,在實驗的各種變化中蒐集資料,建立更好的機器學習模型;
接著再以機器學習模型去導引更好的實驗設計,蒐集更多的資料,在實驗與人工智慧建模的反覆運用中,逐漸找到業務執行的最佳做法,同時也讓人工智慧更聰明,能夠為未來的需求做出指引。

2021年6月23日 星期三

SAS參考書

1.2005/09 華泰文化<SAS應用之資料處理> 林豐政編著
2.2015/10 <資料採礦運用 以SAS Enterprise Miner為工具> 李淑娟著
3.2018/02 清華大學出版社<The Little SAS Book中文版> Lora D. Delwiche,Susan J. Slaughter著
4.2012/09 梅霖文化<資料採礦運用 以SAS Enterprise Miner為工具> 曾淑峰著

2021年6月20日 星期日

數位「真」轉型:來自全球五大數位轉型銀行的實戰案例

數位「真」轉型:來自全球五大數位轉型銀行的實戰案例
Doing Digital: Lessons from Leaders

第一章 銀行為何需要進行數位轉型 
- 許多人可以有宏偉的想法,但是如果他們不能實現這些想法,那麼它們僅是一些想法,永遠不會成為任何事物。
- 銀行既有引擎又有車輛,但由於願景和領導力有限,因此它只是將一批馬栓在前面,這不是一匹跑得更快的馬;實際上,它是一批速度較慢的馬,因為它正拖著一輛重型車輛在後面轉來轉去。
重新思考基礎架構,修建道路和橋梁並重新改造系統,不要只將新功能添加到舊功能中,而希望它能奏效。
- 數位轉型需要對銀行的核心進行全面轉變,對銀行的文化、系統、組織和流程的核心做改變,
而不僅是活動和專案。
- 銀行知道他們需要進行數位轉型,但是許多銀行領導者,特別是執行長和董事長,卻不知道該做什麼,也不知道該怎麼做。他們不知道如何領導數位轉型,因此他們只懂做出一點數位改變。他們在專案、人員、計畫、系統和架構上投資了數十億美元,卻迴避了組織改造、文化變革、管理重組、系統重建更換核心系統等重大問題,原因在於後者既冒險又困難,而且這些領導者並不瞭解面對數位革命是他們必須做的。擁有這些領導者的銀行將在未來十年內不復存在,但他們不會消失,但是會被能確實做到這一點的銀行所併購。
 
第二章 轉型規劃 
- 如果你總是總是按著自己一直以來的方式做事情,那麼你就總是只能獲得一值擁有的那些...甚至還會少一些。
- 銀行數位轉型失敗的原因之一,是因為如果負責轉型的單位不是組織的核心,核心組織不會希望他們成功,且不斷地攻擊他們。或許,更重要的是,這個新部門的員工是業務的另一邊,而且往往並不是真正瞭解核心業務的領域。他們做了許多看起來很吸引人的事,但並沒有真正推動業務發展。
所以業務單位必須負責這項轉型,不能有人站在旁邊不參與。
 
第五章 數位轉型值得嗎?
- 數位轉型核心:
1.獲客
--藉由更廣泛的通路增加獲客率
--降低獲客成本
2.交易
--少紙化
--創造即時滿足客戶需求
--降低成本
3.參與
--推動增加「黏著度」的客戶行為
--透過情境行銷進行交叉銷售
--增加每位客戶的收益
4.生態系統
--從管路企業到平台企業
--資料
--以洞察力為導向

- 如果你改變的是系統,而不是改變組織架構,你將無法生存。
如果你在系統上投資,但不改變核心系統架構,你將無法生存。
如果你單純為了降低成本,而不是為了更好的用戶體驗而使用科技,則你將無法生存。
- 關鍵因素是如果你不把數位視為銀行架構和文化的轉型專案,
反而把它當作一個系統專案或一個通路來對待,那麼你將無法生存。

2021年6月12日 星期六

認識資料科學的第一本書

認識資料科學的第一本書
Data Analytics Made Accessible

Ch01|資料分析概觀

- 資料類型:
名目資料(Nominal)、次序資料(Ordinal)、區間資料(Interval)、比值資料(Ratio Data)。

Ch02|商業智慧

- 客戶關係管理
  1. 極大化行銷活動的回報
  2. 增進客戶留存率(流失分析)
  3. 極大化客戶價值(交叉、追加銷售)
  4. 找出高價值客戶,並滿足他們
  5. 管理品牌形象
- 零售業
  1. 最佳化不同區域的庫存水準
  2. 改善商店陳列與銷售宣傳
  3. 為季節效應安排最佳物流
  4. 減少因有限賞味期的損失
- 銀行業
  1. 自動化借貸申請流程
  2. 偵測詐欺交易
  3. 極大化客戶價值(交叉、追加銷售)
  4. 運用預估做出最佳現金準備
- 金融服務
  1. 預測債券與股票價格的變動
  2. 評估事件影響對市場造成的移動
- 保險業
  1. 預估索賠成本以利更好的商業規劃
  2. 決定最佳利率計畫
  3. 對特定客戶進行最佳行銷
  4. 發現並避免詐欺行為
- 電信業
  1. 客戶流失管理
  2. 行銷與產品規劃
  3. 網路故障管理
  4. 詐騙管理

Ch04|資料探勘

- 分類技術的共同衡量標準便是預測精確度。
預測精確度 = (正確預測) / 預測合計
- 混淆矩陣(Confusion Matrix)

- TP,True Positive:當一個真的正類資料點被分類為正值。
- TN,True Negative:當一個真的負類資料點被分類為負值。
- FP,False Positive:當一個真的正類資料點被分類為負值。
- FN,False Negative:當一個真的負類資料點被分類為正值。
- 預測精確度 = (TP+TN)/(TP+TN+FP+FN)

Ch06|決策樹

-決策樹基於諸多理由,可說是最受歡迎的資料探勘技術:
1.決策樹對於分析人員與管理者而言,都一樣容易了解與使用。它亦具有高度預測準確度。
2.決策樹會從所有可用的決策制定變數中,自動選擇最相關的變數。
3.決策樹容許資料品質的問題,並且不需要使用者準備太多資料。
4.即使非線性關係,決策樹也能處理得很好。
- 較受歡迎的演算法有:C5、CART、CHAID。
- 決策樹演算法基於三項主要元素而有所不同:
  1. 分支準則(Splitting Criteria)
  2. 停止條件
  3. 修剪

Ch07|迴歸 Regression

- 迴歸模型的精確度,全然依賴使用的資料集,而不是依賴演算法或其他工具。
- 羅吉斯回歸(Logistic Regression)模型使用機率分數作為因變數的預測值。
羅吉斯回歸取用因變數的勝算(odds)自然對數(以logit來表示),以此建立一個連續標準,
作為因變數的轉換版本。
- 迴歸模型的不足:
1.迴歸模型無法掩蓋不良資料品質的問題,如果資料沒有好好整理,移除遺失的數值,
或是不符合常態分配,其效用便會打折。
2.迴歸模型受共線性問題而拖累。
3.如果迴歸模型中包含大量變數,模型也可能變得笨重、難以信賴。所有加入模型中的變數,
不論其對模型預測能力的貢獻如何,皆會反應在迴歸方程式中。迴歸模型並沒有自動修剪的概念。
4.迴歸模型不會自動處理非線性,使用者得自行想像需要加入何種額外條件才能改善迴歸模型的適合度。
5.迴歸模型只適合數值資料,而不適合類別資料。不過還是可以藉由建立多個帶有是/否值的新變數,來處理類別變數。

Ch08|類神經網路 ANN,Artificial Neural Network

- 類神經網路之所以受歡迎,是因為它們最終將能夠達到高度預測精準度。
在執行起來也相對簡單,並沒有任何資料品質的問題。
然而ANN需要許多資料進行訓練,才能發展出好的預測能力。
- ANN的好處:
1.ANN的使用限制並不多。它可以自行處理(辨識/模型)高度非線性的關係,
而無須使用者或分析師做太多事情。
2.他們可以處理各種問題類型,包括分類、群集、關聯...等。
3.ANN可容許資料品質問題,並不會限制資料必須遵守嚴格的常態與/或獨立假設。
4.他們可以兼具處理數值與類別變數。
- ANN的缺點:
1.它們被視為黑盒子解決方案,缺乏解釋力。
2.處理大量的變數可能十分困難(特別是豐富的名目屬性)。
3.訓練ANN需要大量的資料集。

Ch09|群集分析 Cluster Analysis

Ch10|關聯規則探勘 Association Rule Mining

- 常用的演算法為Apriori,Eclat,FP-Growth

Ch11|文字探勘 Text Mining

- 詞彙文件矩陣(Term Document Matrix)

Ch12|單純貝式分析 Baive-Bayes

Ch13|支援向量機 SVM,Support Vector Machines

- SVM演算法的核心乃是核方法(Kernel Methods)。
- SVM的優點:
1.即使特徵數量比起實例數量大很多,也能夠運作良好。它能運用在含有大量特徵空間的資料集上,
例如過濾垃圾郵件的例子,其中有大量的單字是垃圾訊息中會出現的潛在特徵。
2.即使最佳決策邊界為非線性曲線,SVM會轉換變數以建立新的維度。
- SVM的限制:
1.它只在實數(Real Number)上運作良好。
2.它只能處理二元分類問題。不過我們可以建立一系列階層式SVM來解決此限制。
- SVM適用於文字探勘,例如過濾垃圾郵件以及詐騙偵測。

Ch14|網路探勘

- 網路探勘可區分為三種不同類型:網路使用探勘、網路內容探勘、網路架構探勘。

- 使用模式可透過「點選流分析(Clickstream Analysis)」來進行分析,也就是依點擊順序的模式以及造訪網站時停留的位置以及時間長度,來分析網路活動。
- 網路使用探勘有許多商業上的應用。它可依據先前學習的規則與用戶特寫,(1)協助預測使用者行為,並可協助決定客戶的生命週期價值。藉由觀察網站中各頁面的(2)關聯規則,也有助於設計跨產品間的交叉行銷策略。網站使用分析可協助(3)評估促銷活動,觀察使用者是否受網站吸引,並使用與活動相關的頁面。網站使用探勘可依據用戶的興趣與特寫,(4)對用戶展現動態的資訊。這包括依據用戶存取模式,對用戶群組發布特定的線上廣告與優惠券。

Ch15|社群網路分析

- 影像力流模式(Influence Flow Model)

2021年6月5日 星期六

Bank4.0:金融常在,銀行不再?

 Bank4.0:金融常在,銀行不再?

- 在過去的40年期間,我們從認定實體分行是唯一可以取得銀行服務的通路,轉換到
多通路(Multi-Channel),再轉換到全通路(Omni-Channel),
最終成為數位的全通路(Digital Omni-Channel),客戶最終只會使用數位通路來取得銀行服務。
- 如果現在的銀行只是將分行及人員轉型以數位化的方式執行,你將會錯失最後機會。
銀行業需要重新設計以適應科技無所不在的世界,銀行想與客戶保持相關的唯一途徑,
就是創造符合客戶目的之體驗,顯然仍以分行為基礎逐步演化的方法是不夠的。

第一章 回到第一原理

- 賈伯斯深信科技的力量唯有人們開始使用,才得以發揮。
- 未來的銀行家將完全不同於今日的銀行家,未來的銀行家將會是科技專家,讓客戶在數位的環境中體驗銀行服務。
- 你在山腰上看到的風景,跟在山腳下是非常不一樣的。那些爬到山頂上的人,心態已經不一樣了;
未來三十年,這世界的變化會遠遠超過大家的想像力。
- 馬雲提出的經商建議:要記得:問題越大,機會越大。在危機中找到轉機。

第二章 監管者的兩難

- 想要萬事順利,卻只付出最小的失敗代價,這個機率坦白來說是零。
事實上,在銀行4.0的模式裡,最可能出的差錯就是我們用糟糕的方式監管他,
或是我們無法在未來證明這個產業的價值,好讓我們的機構保持全球競爭力。

第三章 內嵌式銀行業務系統

- 挑戰者/金融科技銀行與傳統銀行最根本的差別,在於他們的使命-挑戰者/金融科技銀行想要徹底簡化銀行業務體驗,但傳統銀行似乎更傾向要你選擇他們銀行的產品,而非競爭對手的產品。

第四章 從產品、通路到體驗

- 接下來五年左右,對金融服務收益與成長能力而言,下列幾種工作至關重要:
  1. 數據科學家
  2. 機器學習專家
  3. 體驗設計師/體驗創作人(storyteller)
  4. 行為心理學家
  5. 區塊鏈整合工程師
  6. 合規與風險管理程式工程師
  7. 社群行銷專家
  8.  身分代理機構
- 挑戰者/金融科技公司的組織架構一反傳統,注重的關鍵績效指標是活躍用戶、每日投入使用程度
和累積性的活動,例如顧客歷年的貸款紀錄,以及與去年同期相較的成長。
他們公司整體規模成長的目的,是為了在網路擴張的同時也能加速網路觸及客戶的速度。
- 這使得我們在面對新的銀行4.0組織架構時,該想的不是種標示出各種策略性業務單位的圖表,
而是橫跨整個組織的各項核心能力,在一種矩陣式架構裡共同分擔任務、達成客戶目標等等。
平心而論,今日典型的銀行要想改組成這種架構,是極為艱鉅的挑戰。

第六章 金融科技和科技金融:是敵是友?

- 在大多數銀行家的DNA裡根本沒有創新這種東西,
在他們的職涯中,所受的訓練都是要辨識風險並規避風險,但創新卻是要冒小風險,
接受快速且便宜的失敗,然後從這些錯誤中汲取教訓,以迅速找到正確答案。
- 很多時候在銀行的文化裡,新措施所帶來的改變會被視為一中威脅,
所以銀行就會出現如同免疫系統攻擊病毒般的反應加以抵抗。
- 銀行需要面對和處理其根本缺陷:欠缺執行速度和專注力。說到底,我們還是要回到一個事實,
那就是如果你想在銀行內獲得快速、便宜的創新,那麼就應該改變內部文化,才能有效地善用技術合作夥伴。

第七章 人工智慧在銀行業務的角色

- 銀行應用AI的能力面向和誘因

第九章 適應或死亡

- 多年來,數百家銀行都已設立創新部門,但當創新部門的負責人因為有更好的工作而離開,
這些部門就只能逐漸凋零,或者因為與銀行的文化不和而收掉。
這裡的問題不在於創新團隊不適合銀行文化,而是銀行的免疫系統努力抵制新事物,
但這樣做不利於改變。銀行把改變視為風險,而風險正是銀行最不想承擔的東西。
- 我們不能用我們製造問題時的思維來解決問題。

第十章 結論:銀行4.0的發展路線圖

- 長期以來,產品部門一直是人們爭奪預算並定義產品結構的地方。
抵押貸款、信用卡和活期儲蓄存款(CASA)都消失了,上述產品與其相關部門轉型成更具吸引力、
更容易操作的用戶體驗,而不是將分行的實體申請表轉換成電子表單。如果你的組織結構被爭奪預算的產引團隊主導,該如何把體驗當成第一優先?這是不可能的。
- 銀行在與科技金融和金融科技玩家爭奪營收和客戶關係時,產品本身不會創造關係或信任,
但你提供服務的能力才會。

2021年5月23日 星期日

行銷資料科學

 行銷資料科學|大數據x市場分析x人工智慧

PART 1 概論篇

Chapter 01 何謂行銷資料科學
- 何謂資料科學?

- 行銷資料科學家的工作包括:

  1. 產生規範性見解-包含戰略和戰術見解,以提高行銷效率。
  2. 探索性資料分析。
  3. 度量和方法選擇。
  4. A/B測試。
  5. 為管理層和其他專業人員提供諮詢,培訓和協助,幫助他們處理和理解各項組織數據。

- 行銷資料科學家所需的技能包括:

  1. SQL
  2. 資料視覺化
  3. 熟悉Python或R語言
  4. 能夠預測與建立模型(統計和機器學習方法)
  5. 人際關係技能-能和資料工程師、業務管理和其他人員協同合作

Chapter 02 行銷資料的類型、來源與管理

- 研究資料


- 資料的整理

--遺漏值的填補

1.數值變數:常使用的方法是以線性迴歸的方式來預測遺漏值,
稱為「預測均值匹配」(PMM,Predictive Mean Matching)。
2.二元變數:羅吉斯迴歸(Logistic Regression)進行預測。
3.超過二元以上的分類變數:貝氏多元迴歸(Bayesian Polytomous Regression)來處理。

Chapter 03 行銷資料科學技術概念
- 資料蒐集
- 網路結構探勘(Web Structure Mining):檢視網站的設計,一般可透過網路爬文技術,
利用R或Python等語言來開發爬蟲工具。
- 網路使用探勘(Web Usage Mining):企圖發現使用者的瀏覽特徵。

- 資料分析

--資料轉換(Data Transformation):主要再進行資料減縮與投影(Data Reduction and Projection),
在操作上,使用降維(Dimensionality Reduction)技術,來減少所考慮變數的有效數量。
--選擇資料探勘方法(Choosing the Data Mining Method):
分類(Classification)、分群(Clustering)、關聯(Association)等分析方法。

* 常見的機器學習演算法



- Apriori演算法是關聯規則學習或是關聯分析(Associative Analysis)的經典演算法之一。
在行銷資料科學領域,稱為購物籃分析(Market Basket Analysis)。
關聯分析主要透過「支持度(Support)」和「信賴度(Confidence)」來對商品項目之間關聯性進行篩選。在進行關聯分析時,通常會先設定最小支持度(Min Support)與最小信賴度(Min Confidence),
另外還會考量提升度(Lift)。

- 類神經網路(ANN,Artificl Neural Network)

--激發函數(Activation Function)

--前向傳播法(Forward Propagation)

--反向傳播法(Backward Progagation)

- 支持向量機(SVM,Support Vector Machine)
   -線性可分支持向量機
   -非線性可分支持向量機
      --核函數(Kernel Function)、特徵空間(Feature Space)
 
Chapter 04 整合行銷資料科學與行銷研究

- 行銷研究主要將資料分成「初級資料」與「次級資料」。初級資料的蒐集方式,又可分成:

調查法(Survey Research)、實驗法(Experimentation)、觀察法(Observation)、深度訪談法(Depth Interview)。


PART 2 大數據篇

Chapter 06 大數據行銷分析工具

- 大數據行銷分析工具


- 行銷分析階層

- 行為側寫(Marketing Profiling)則是將「側寫」這樣的概念與技術運用到行銷領域,
做法則是透過數據分析來描繪消費者的圖像。
- 行為定向(Behavioral Targeting)是指網站和廣告商使用一系列技術蒐集與分析個人的搜尋
與瀏覽行為等資訊。

* 推薦系統

--內容過濾(Content-Based Filtering)主要基於客戶「過去」對某些商品和服務的偏好,
提出推薦。舉例來說,A顧客購買A產品,而A產品與B產品有相似性,此時,系統就自動推薦B產品給A顧客。
--協同過濾則是使用「同類客戶」來進行客戶偏好的預測,來進行推薦,以下是常見的類型:
  1. 使用者基處的協同過濾(User-Based Collaborative Filtering Recommendation)
  2. 項目基礎的協同推薦(Item-Based Collaborative Filtering Recommendation)
  3. 模型基礎的協同推薦(Model-Based Collaborative Filtering Recommendation)

- 成交路徑(Path to Purchase)

- 網站分析(Web Analytics)目前主要有兩種方法:

1. 日誌分析(Log Analysis)即分析使用者瀏覽器與網站伺服器互動歷程中,所產生的網站日誌檔(web log files)以判斷點擊數(hits)、網頁檢視(page views)、網站停留時間(time on site)等,以了解網站的使用狀況與經營成效。

2. 加入網頁標籤,在每一網頁插入Jave Script告知第三方分析服務的伺服器(如:Google Analytics),
某些頁面已被瀏覽器所讀取。

--要分析或比較網頁內容好不好,有許多的衡量指標可參考,常見的指標除了上述提到的點擊數(hits)、網頁檢視(page views),還包括訪問量(Visits)、訪客(Visitor)、新訪客(New Visitor)、重複訪客(Repeat Visitor)等等。

--如果企業或網站負責人沒有後續的配套措施與相對應的行動,有人就戲稱這就好像到大醫院花錢做了一堆電腦斷層或核磁共振,找到病因之後,卻不做後續治療,讓前面的網站分析做白工了。

- 歸因分析(Attribution Analytics)

--行銷人可以使用歸因分析來規劃未來的行銷活動,透過分析哪些行銷活動(媒體、廣告...等)
最具有成本效益和影響力,以提升廣告支出回報率(Return on Ad Spend,ROAS)或者
取得有效的名單(Cost Per Lead,CPL)等。

-- 網路廣告的快速資增長,企業也同步獲得更多的數據來追蹤廣告的有效性,並且發展出更多評估廣告效果的方式,例如每次點擊成本(Cost Per Click,CPC),每千次曝光成本(Cost Per 1000 impression,CPM),每次完成行動成本(Cost Per Action,CPA)和點擊轉換率(Conversion Rate,CVR)...等。

- 趨勢分析(Trend Analytics)

  1.  定性法(Qualitative Method):判斷法、調查法。
  2. 定量法(Quantitative Method):時間序列分析法、因果分析法(迴歸模式、計量經濟模式)


PART 3 行銷篇

Chapter 07 市場分析與行銷資料科學

- 文章字詞矩陣(DTM,Document Term Matrix)

- 輿情分析
深度類神經網路(卷積式網路Convolutional Neural Network,如CNN,RCNN,Resnet)。
--利用機器學習找出關鍵性的預警貼文:單純貝氏(Naive Bayes)、

- 行銷漏斗(The Marketing Funnel)模型

--過濾性:能通過一階層的過濾,稱為「轉換率」(Conversion Rate) ;
反之則是「流失率」(Churn Rate) 。
-- 提高轉換率的方法,研究顧客的每一個可能的「接觸點(touch point)」是個很棒的切入方式。
「接觸點」意指顧客會接觸到企業產品或服務的任何機會,從消費者尚未購物的平常生活即已開始,到實際接觸的購買體驗,一直到售後的各種可能場景。

- RFM模型可協助公司找出「新客(近期曾經前來公司消費的客人)」、「常客(經常前來消費的客人)」,以及「貴客(消費金額大的重要客人」。


Chapter 08 STP 理論與行銷資料科學

- 企業在經過評估各種市場區隔後,接下來就是從中選定一個或多個「區隔市場」,以作為目標市場。依據哈佛大學教Derek F.  Abell的研究,在目標市場選擇策略中,可以選用以下五種方式來進行。

  1. 單一市場集中化(Single-Segment Concentration)
  2. 選擇性專業化(Selective Segment Specialization)
  3. 產品專業化(Product Specialization)
  4. 市場專業化(Market Specialization)
  5. 全市場涵蓋(Full Market Coverage)


Chapter 10 價值溝通與行銷資料科學
- 行銷管理學裡,將傳統行銷方式區分成所謂的「推式策略(Push)」與「拉式策略(Pull)」兩大類。

- 拉式策略(Pull):意指企業透過於廣告、銷售促進等方式,引發消費者的購買慾望,將消費者「拉」到企業手上;推式測略(Push):則是由企業藉由人員推銷、銷售促進等方式,將產品透過一層層的配銷通路,「推」到最終消費者的手上。

- Inbound Marketing可譯為「集客式行銷」。是一種透過內容行銷(Content Marketing)、社交媒體行銷(Social Medial Marketing)、搜尋引擎優化(Search Engine Optimization,SEO)等技術,吸引消費者主動上門的行銷策略。
- Outbound Marketing議為「推播式行銷」,是指企業透過電視、電話、報紙、電台、看板、
郵件等工具,主動將產品訊息傳播給消費者,並促使消費者在心中建立起對企業的印象。

PART 4 策略篇
Chapter 11 行銷資料科學與策略

- 關於資料科學的分析,常見的分類有以下三種:

  1. 描述性分析(Descriptive Analytics)
  2. 預測性分析(Predictive Analytics)
  3. 指式性分析(Precriptive Analytics)

- 「描述性分析」能解釋已經發生的事,協助企業分析出消費者是誰?或是買了些什麼?
- 「預測性分析」能協助企業解決可能發生的事,
例如分析出消費者可能還會購買什麼?進而提前給予消費者相關的產品資訊。
- 「指示性分析」則能指導實際執行時該如何做,
舉例來說,當消費者走到某商圈時,手機會主動收到適合自己的附近店家折價券。
- 除此之外,尚有提出「診斷性分析(Diagnostic Analytics)」、
「自動化分析(Automating Analytics)」。

分析1.0

- 屬於「傳統分析時代(Traditional Analytics)」,其中統計分析以「敘述性分析(Descriptive)」為主,
亦即「分析過去的事」。分析的資料屬於內部且較小量的結構化資料。
- 在企業部分,分析的目的,在透過分析展現營運效率與增進內部決策有效性。舉例來說,
公司建立各種營運報表,如:營業額、毛利率、淨利率等營運指標,皆是屬於分析1.0時代。

分析2.0

- 屬於大數據時代,統計分析以「預測性分析(Predictive)」為主,亦即「使用過去資料預測未來」。

分析3.0

- 屬於資料經濟時代,以「指示性分析(Prescriptive)」為主,亦即「運用模型發展最佳行動」。
分析資料以結合大量結構化與非結構化資料為主。

- 顧客流失(Customer Curn)分析的應用包含:

  1. 顧客獲得(Customer Acquisition)
  2. 顧客關係發展(Relationship Development)
  3. 顧客留存(Customer Retention)
  4. 顧客流失率分析(Customer Churn Rate Analytics)