說故事的技藝
2022年7月11日 星期一
2022年1月14日 星期五
2021年9月4日 星期六
消費者行為市場分析技術(上)
- (就商品/服務而言)消費者有哪些偏好?
- 消費者(在分配有限預算時)有哪些限制?
- 在資源有限的情況下,消費者會怎麼選擇?
- 買家的議價能力
- 供應商的議價能力
- 新進廠商的威脅
- 現有同業的競爭
- 替代品的威脅
- 企業可以打價格戰(當低價產品提供者)。
- 企業可以塑造差異,專注於高階產品。
- 企業也可以區隔市場,專心經營規模較小的利基市場。
- 營運卓越(致力追求低成本)。
- 產品領導(專注發展較高階的差異化產品)。
- 貼近顧客(一種差異化/市場區隔策略)。
- 含有新資訊
- 專注於了解消費者行為
- 量化因果關係
- 提供競爭優勢
- 傳達財務意義
- 描述性分析主要關注已發生的事;
- 預測性分析會運用統計分析法,依指定的輸入變數變化(例如價格),計算輸出變數(例如銷量)的相應變動;
- 時效性分析是一種試圖將某些數據(通常是獲利)最佳化的機制。
- 如同稍早所提,依變數是事件發生前經過的時間,因此分析中已經內建了時間。
- 設限觀察值。設限觀察值包含尚未發生事件的觀察值,以及研究中因故無法掌握動向的觀察值,
- 事件發生前經過的時間,
- 事件是否發生,因此需採用設限觀察值。
- 時序資料:從單一橫斷面擷取多個觀察項,例如股價、單週銷量摘要。
- 合併的橫斷面資料:自多個橫斷面收及兩個以上樣本,例如社會/人口問卷調查、地區或子市場的營收。
- 追蹤資料:自兩個以上橫斷面,匯集兩個以上觀察項,例如不同企業組織在不同時間點的時序資料、地區或子市場,在不同時間的彙總資料。
2021年8月7日 星期六
2021年6月23日 星期三
2021年6月12日 星期六
認識資料科學的第一本書
Data Analytics Made Accessible
Ch01|資料分析概觀
名目資料(Nominal)、次序資料(Ordinal)、區間資料(Interval)、比值資料(Ratio Data)。
Ch02|商業智慧
- 極大化行銷活動的回報
- 增進客戶留存率(流失分析)
- 極大化客戶價值(交叉、追加銷售)
- 找出高價值客戶,並滿足他們
- 管理品牌形象
- 最佳化不同區域的庫存水準
- 改善商店陳列與銷售宣傳
- 為季節效應安排最佳物流
- 減少因有限賞味期的損失
- 自動化借貸申請流程
- 偵測詐欺交易
- 極大化客戶價值(交叉、追加銷售)
- 運用預估做出最佳現金準備
- 預測債券與股票價格的變動
- 評估事件影響對市場造成的移動
- 預估索賠成本以利更好的商業規劃
- 決定最佳利率計畫
- 對特定客戶進行最佳行銷
- 發現並避免詐欺行為
- 客戶流失管理
- 行銷與產品規劃
- 網路故障管理
- 詐騙管理
Ch04|資料探勘
- 分類技術的共同衡量標準便是預測精確度。
預測精確度 = (正確預測) / 預測合計
- 混淆矩陣(Confusion Matrix)
- TP,True Positive:當一個真的正類資料點被分類為正值。- TN,True Negative:當一個真的負類資料點被分類為負值。- FP,False Positive:當一個真的正類資料點被分類為負值。- FN,False Negative:當一個真的負類資料點被分類為正值。
Ch06|決策樹
1.決策樹對於分析人員與管理者而言,都一樣容易了解與使用。它亦具有高度預測準確度。
2.決策樹會從所有可用的決策制定變數中,自動選擇最相關的變數。
3.決策樹容許資料品質的問題,並且不需要使用者準備太多資料。
4.即使非線性關係,決策樹也能處理得很好。
- 較受歡迎的演算法有:C5、CART、CHAID。
- 分支準則(Splitting Criteria)
- 停止條件
- 修剪
Ch07|迴歸 Regression
作為因變數的轉換版本。
- 迴歸模型的不足:
1.迴歸模型無法掩蓋不良資料品質的問題,如果資料沒有好好整理,移除遺失的數值,
2.迴歸模型受共線性問題而拖累。
3.如果迴歸模型中包含大量變數,模型也可能變得笨重、難以信賴。所有加入模型中的變數,
4.迴歸模型不會自動處理非線性,使用者得自行想像需要加入何種額外條件才能改善迴歸模型的適合度。
5.迴歸模型只適合數值資料,而不適合類別資料。不過還是可以藉由建立多個帶有是/否值的新變數,來處理類別變數。
Ch08|類神經網路 ANN,Artificial Neural Network
- ANN的好處:
1.ANN的使用限制並不多。它可以自行處理(辨識/模型)高度非線性的關係,
2.他們可以處理各種問題類型,包括分類、群集、關聯...等。
3.ANN可容許資料品質問題,並不會限制資料必須遵守嚴格的常態與/或獨立假設。
4.他們可以兼具處理數值與類別變數。
- ANN的缺點:
1.它們被視為黑盒子解決方案,缺乏解釋力。
2.處理大量的變數可能十分困難(特別是豐富的名目屬性)。
3.訓練ANN需要大量的資料集。
Ch09|群集分析 Cluster Analysis
Ch10|關聯規則探勘 Association Rule Mining
Ch11|文字探勘 Text Mining
Ch12|單純貝式分析 Baive-Bayes
Ch13|支援向量機 SVM,Support Vector Machines
- SVM的優點:
1.即使特徵數量比起實例數量大很多,也能夠運作良好。它能運用在含有大量特徵空間的資料集上,
2.即使最佳決策邊界為非線性曲線,SVM會轉換變數以建立新的維度。
- SVM的限制:
1.它只在實數(Real Number)上運作良好。
2.它只能處理二元分類問題。不過我們可以建立一系列階層式SVM來解決此限制。
- SVM適用於文字探勘,例如過濾垃圾郵件以及詐騙偵測。
Ch14|網路探勘
- 網路使用探勘有許多商業上的應用。它可依據先前學習的規則與用戶特寫,(1)協助預測使用者行為,並可協助決定客戶的生命週期價值。藉由觀察網站中各頁面的(2)關聯規則,也有助於設計跨產品間的交叉行銷策略。網站使用分析可協助(3)評估促銷活動,觀察使用者是否受網站吸引,並使用與活動相關的頁面。網站使用探勘可依據用戶的興趣與特寫,(4)對用戶展現動態的資訊。這包括依據用戶存取模式,對用戶群組發布特定的線上廣告與優惠券。
Ch15|社群網路分析
- 影像力流模式(Influence Flow Model)
2021年5月23日 星期日
行銷資料科學
行銷資料科學|大數據x市場分析x人工智慧
PART 1 概論篇
- 何謂資料科學?
- 行銷資料科學家的工作包括:
- 產生規範性見解-包含戰略和戰術見解,以提高行銷效率。
- 探索性資料分析。
- 度量和方法選擇。
- A/B測試。
- 為管理層和其他專業人員提供諮詢,培訓和協助,幫助他們處理和理解各項組織數據。
- 行銷資料科學家所需的技能包括:
- SQL
- 資料視覺化
- 熟悉Python或R語言
- 能夠預測與建立模型(統計和機器學習方法)
- 人際關係技能-能和資料工程師、業務管理和其他人員協同合作
Chapter 02 行銷資料的類型、來源與管理
- 研究資料
- 資料的整理
--遺漏值的填補
稱為「預測均值匹配」(PMM,Predictive Mean Matching)。
2.二元變數:羅吉斯迴歸(Logistic Regression)進行預測。
3.超過二元以上的分類變數:貝氏多元迴歸(Bayesian Polytomous Regression)來處理。
Chapter 03 行銷資料科學技術概念
- 資料蒐集
利用R或Python等語言來開發爬蟲工具。
- 網路使用探勘(Web Usage Mining):企圖發現使用者的瀏覽特徵。
- 資料分析
在操作上,使用降維(Dimensionality Reduction)技術,來減少所考慮變數的有效數量。
分類(Classification)、分群(Clustering)、關聯(Association)等分析方法。
* 常見的機器學習演算法
- 類神經網路(ANN,Artificl Neural Network)
--激發函數(Activation Function)
--前向傳播法(Forward Propagation)
--反向傳播法(Backward Progagation)
-線性可分支持向量機
-非線性可分支持向量機
--核函數(Kernel Function)、特徵空間(Feature Space)
Chapter 04 整合行銷資料科學與行銷研究
- 行銷研究主要將資料分成「初級資料」與「次級資料」。初級資料的蒐集方式,又可分成:
調查法(Survey Research)、實驗法(Experimentation)、觀察法(Observation)、深度訪談法(Depth Interview)。
PART 2 大數據篇
Chapter 06 大數據行銷分析工具
- 大數據行銷分析工具
- 行銷分析階層
- 行為定向(Behavioral Targeting)是指網站和廣告商使用一系列技術蒐集與分析個人的搜尋
* 推薦系統
提出推薦。舉例來說,A顧客購買A產品,而A產品與B產品有相似性,此時,系統就自動推薦B產品給A顧客。
- 使用者基處的協同過濾(User-Based Collaborative Filtering Recommendation)
- 項目基礎的協同推薦(Item-Based Collaborative Filtering Recommendation)
- 模型基礎的協同推薦(Model-Based Collaborative Filtering Recommendation)
- 成交路徑(Path to Purchase)
- 網站分析(Web Analytics)目前主要有兩種方法:
1. 日誌分析(Log Analysis)即分析使用者瀏覽器與網站伺服器互動歷程中,所產生的網站日誌檔(web log files)以判斷點擊數(hits)、網頁檢視(page views)、網站停留時間(time on site)等,以了解網站的使用狀況與經營成效。
某些頁面已被瀏覽器所讀取。
--要分析或比較網頁內容好不好,有許多的衡量指標可參考,常見的指標除了上述提到的點擊數(hits)、網頁檢視(page views),還包括訪問量(Visits)、訪客(Visitor)、新訪客(New Visitor)、重複訪客(Repeat Visitor)等等。
- 歸因分析(Attribution Analytics)
最具有成本效益和影響力,以提升廣告支出回報率(Return on Ad Spend,ROAS)或者
取得有效的名單(Cost Per Lead,CPL)等。
-- 網路廣告的快速資增長,企業也同步獲得更多的數據來追蹤廣告的有效性,並且發展出更多評估廣告效果的方式,例如每次點擊成本(Cost Per Click,CPC),每千次曝光成本(Cost Per 1000 impression,CPM),每次完成行動成本(Cost Per Action,CPA)和點擊轉換率(Conversion Rate,CVR)...等。
- 趨勢分析(Trend Analytics)
- 定性法(Qualitative Method):判斷法、調查法。
- 定量法(Quantitative Method):時間序列分析法、因果分析法(迴歸模式、計量經濟模式)
PART 3 行銷篇
Chapter 07 市場分析與行銷資料科學
- 文章字詞矩陣(DTM,Document Term Matrix)
深度類神經網路(卷積式網路Convolutional Neural Network,如CNN,RCNN,Resnet)。
- 行銷漏斗(The Marketing Funnel)模型
反之則是「流失率」(Churn Rate) 。
「接觸點」意指顧客會接觸到企業產品或服務的任何機會,從消費者尚未購物的平常生活即已開始,到實際接觸的購買體驗,一直到售後的各種可能場景。
- RFM模型可協助公司找出「新客(近期曾經前來公司消費的客人)」、「常客(經常前來消費的客人)」,以及「貴客(消費金額大的重要客人」。
Chapter 08 STP 理論與行銷資料科學
- 企業在經過評估各種市場區隔後,接下來就是從中選定一個或多個「區隔市場」,以作為目標市場。依據哈佛大學教Derek F. Abell的研究,在目標市場選擇策略中,可以選用以下五種方式來進行。
- 單一市場集中化(Single-Segment Concentration)
- 選擇性專業化(Selective Segment Specialization)
- 產品專業化(Product Specialization)
- 市場專業化(Market Specialization)
- 全市場涵蓋(Full Market Coverage)
Chapter 10 價值溝通與行銷資料科學
- 行銷管理學裡,將傳統行銷方式區分成所謂的「推式策略(Push)」與「拉式策略(Pull)」兩大類。
- 拉式策略(Pull):意指企業透過於廣告、銷售促進等方式,引發消費者的購買慾望,將消費者「拉」到企業手上;推式測略(Push):則是由企業藉由人員推銷、銷售促進等方式,將產品透過一層層的配銷通路,「推」到最終消費者的手上。
- Outbound Marketing議為「推播式行銷」,是指企業透過電視、電話、報紙、電台、看板、
PART 4 策略篇
Chapter 11 行銷資料科學與策略
- 關於資料科學的分析,常見的分類有以下三種:
- 描述性分析(Descriptive Analytics)
- 預測性分析(Predictive Analytics)
- 指式性分析(Precriptive Analytics)
- 「預測性分析」能協助企業解決可能發生的事,
- 「指示性分析」則能指導實際執行時該如何做,
- 除此之外,尚有提出「診斷性分析(Diagnostic Analytics)」、
分析1.0
分析2.0
- 屬於大數據時代,統計分析以「預測性分析(Predictive)」為主,亦即「使用過去資料預測未來」。
分析3.0
分析資料以結合大量結構化與非結構化資料為主。
- 顧客流失(Customer Curn)分析的應用包含:
- 顧客獲得(Customer Acquisition)
- 顧客關係發展(Relationship Development)
- 顧客留存(Customer Retention)
- 顧客流失率分析(Customer Churn Rate Analytics)
2020年9月19日 星期六
世界第一簡單機器學習
世界第一簡單機器學習
2019年4月
第1章 怎麼做迴歸?
- 正規化的方法分為兩種,Ridge迴歸盡可能減少大數值的係數,和Lasso迴歸增加數值趨近零的係數。
第2章 怎麼進行識別?
- 模型的輸出為權重w的函數,所以當w改變,誤差的值也會不同。遇到這樣的問題,我們可用梯度下降法(Gradient Descent)來求解。
- 由所有的訓練資料D計算梯度的方法,稱為批量梯度下降法(Batch Gradient Descent);將D分割成適當的大小,以此為單位計算梯度的方法稱為小批量梯度下降法(Mini-batch Gradient Descen);由D隨機選出一個資料,僅以此資料計算梯度的方法,稱為隨機梯度下降法(Stochastic Gradient Descent)。
- ID3是演算法是建立決策樹的最基本步驟。
- 亂度Entropy和資訊量
- 將原資料的亂度減去分割後的資料亂度,得到詢問可獲得的資訊量,該量成為資訊增益量Gain。
- 關於資料集算度的計算方法,除了上述的亂度(Entropy)之外,還有一種方法是以下面的式子計算吉尼係數(Gini Cofficient)。
Gini(D)=1-Pyes^2-Pno^2
- 奧卡姆剃刀(Occam's Razor),目的是「選擇符合資料且最單純的假說」。
- 決策樹會過於適應訓練資料容易發生過度學習(Overfitting)。
第3章 評估結果
- 要掌握機器學習未知資料時的性能。其中,最簡單的方法是,將手邊的資料分割成訓練用和評估用。稱為分割學習法,機器在學習時先不使用評估資料,等到要計算準確率時才使用。這樣一來就能模擬遇到未知資料的情況。
- 會影響訓練結果的超參數(Hyperparameter),比如線性迴歸中正則化須的權重數、決策樹訓練的樹木深度等等。調查配置訓練的超參數是否妥當,這個過程就稱為檢驗。若在檢驗作業中使用評估資料的話,評估用資料就不能算是未知資料了。
- 所以,使用分割學習法來評估性能時,一開始應該將資料分成訓練用、檢驗用、評估用三部分
- 對資料進行分割,資料的分割份數稱為折數(fold),通常會採用10折交叉驗證。
- 評估用資料元素數為1的分割法,另外稱為留一法(Leave-one-out)。
- 準確率是在評估資料中,正確辨識類別的資料比例。為了簡化說明,舉例二分類識別問題的評估法。這是有沒有罹患某種疾病、是不是垃圾信件等問題。符合預設條件的訓練資料為正例(positive)、不符合的資料為負例(negative)。
- 混淆矩陣(Confusion Matrix)
- 只有準確度是不夠的:未罹患疾病的人數遠比罹患疾病的人數還多的情況,也就是資料中的負例比正例多很多的意思。比如1000人中僅1人罹患疾病的極端情況,使用全部判定為負的分類器,這樣準確率會是0.999。為了能夠區分這樣的情況,我們需要以其他指標來評估機器學習的結果。
- 根據上表,準確度Accuracy= TP+TN / TP+FN+FP+TN (正解數除以全部資料數就是準確率)。
- 精確度Precision,這是分類器判定為正時,可以多麼相信該結果的指標。
Presision = TP / TP+FP (正確判定為正的數量除以分類器判定為positive的數量就是精確度)。
舉例:被判定罹患某種疾病且該診斷為正的正確比例。
- 召回率Recall=TP / TP+FN (正確判定為正的數量除以所有正例的數量就是召回率)。
例:對象資料中的所有病患中,有多少人被正確診斷罹患疾病。
- 精確度和召回率往往是此消彼長的關係,一邊數值高,另一邊數值就低。
舉例來說,罹患某疾病的症狀很明顯時,分類器才判定為正的精確率會高,不過這樣了話會忽略掉輕微症狀,造成召回率變低。相反地,優先提高召回率,稍微有一些症狀就判定為正,使用這樣的分類器,會導致雖然漏掉病患的情況減少,但可能造成很多沒有生病的人需要接受精密檢查。
- 於是,我們會用下面的式子定義綜合判斷精確率和召回率的指標F值。
F-measure = 2 X Precision x Recall / Precision + Recall
- 若是三種類別的情況,混淆矩陣會變成3x3。由混淆矩陣求出各類別的性能,平均後的數值為巨觀平均(Macro Average);由類別計算TP、FP、FN、TN相加後,除以資料數的數值為微觀平均(Micro Average)。
第4章 深度學習
- 卷積神經網路(Convolutional Neural Network)
- 前饋式神經網路(Feedforward Neural Network)
- softmax函數
- 反向傳播法(Backpropagation)
- 自動編碼器(Autoencoder)
- rectified liner函數,使用此函數的單元稱為ReLU(Rectified Linear Unit)。
- 使用Keras資料庫,Keras封裝了常用的TensorFlow深度學習庫,能夠做到更高階的敘述,可用簡潔的程式碼編寫深度學習的典型問題。
第5章 整體學習Ensemble Learning
裝袋法Bagging
隨機森林Random Forest
- 裝袋法、隨機森林是藉由改變使用的資料集,或者改變分類器的構成條件,做成不同的分類器。與此相對,不斷加入專門減少錯誤的分類器,形成反應不同的分類器集合,稱為提升法。
提升法Bossting
- AdaBoost(Adaptive Boosting):以變更權重的資料集訓練下一個的分類器,依序形成不同的分類器。後面做成的分類器會優先識別上一個分類器錯誤判斷的資料,具有與上一個分類器不同且能夠彌補弱點的效果。
- 另外一種方式是使用損失函數。以提升法結果作成的複合分類器,可用來定義損失函數。其中,追分的分類器會選擇損失函數值減少最多的。這種方式的提升法稱為梯度提升Gradient Boosting。
- 機器學習工具Weka內建diabets.arff資料。
第6章 非監督式學習
6.1.1 集群分析
6.1.2 階層式集群分析(Hierarchical Clustering)
- 群集間的相似度可用下面的方法定義:單一連結(Single Linkage)、完全連結法(Complete Linkage)、中心法(Centroid Method)、Ward法
- k-means法、EM演算法
EM演算法基本步驟跟k-means法相同,一開始先用亂數決定隨機的平均向量和共變異數矩陣(Covariance Matrix),這相當於在特定空間中隨意的場所放置隨意的常態分佈。
6.2 矩陣分解
- 假定用戶與商品之間存在幾項潛在因素。潛在因素是指,在分組用戶、商品時類似視點的條件,像是「女性」、「居住地」、「喜歡甜食」等等。但是,這些是在沒有監督的情況下從資料中選出,所以未必每個都能如此解釋。
- 交替最小平方法(Alternating Least Squares)。
- 非負矩陣分解(NMF)
- 分解機模型(Factorization Machine)
6.3 分割式集群分析(Partitional Clustering)
2020年3月13日 星期五
文科生也看得懂的資料科學
Numsense! Data Science for the Layman: No Math Added














































