顯示具有 Big Data 標籤的文章。 顯示所有文章
顯示具有 Big Data 標籤的文章。 顯示所有文章

2024年5月19日 星期日

數據識讀者

數據識讀者:數據素養教父教你如何用數據溝通、工作與生活
Jordan Morrow

第一章 數據的世界
- 一旦世界各地的組織不具備強大的數據與分析策略,數據技能差距就會擴大。
與其制定明確的策略,同時明文規定公司允許內部在軟體、科技和學習投資等相互流通,
公司卻寧可去購入數據與分析的軟體和科技來替他們完成所有的事。
如此一來,他們把科技當成策略、強迫人們使用,就無法透過策略明確地指出要用那些科技才對,
便可能導致內部人力不願採納、重回老路,以前怎麼做,現在就怎麼做。
一旦重回老路,新科技也就像擺在架上的玩具那樣,盡是沾染灰塵而以,毫無用處。
- 因此組織慘遭到致命的雙重打擊:
第一,內部人力並沒有有效利用與採納組織所投資的軟體;
第二,內部人力抗拒了組織原先為他們好所購入的那些投資與科技,在數據技能上不見成長,
反而更加落後了。

第二章 分析法的四大層次
- 分析法是以四大層次為前提,亦即:
  1. 描述性層次(descriptive)
  2. 診斷性層次(diagnostic)
  3. 預測性層次(predictive)
  4. 指示性層次(Prescriptive)

第三章 定義數據素養
- 在描述性分析法中,對組織內許多不同的人和部門而言,「用數據工作」可能意味著諸多不同的事。切記,描述性分析法就是為組織描述發生過甚麼事,或著正在發生什麼事。
當我們利用「用數據工作」的這項特點,「描述以往發生過什麼事」正好就是我們所在尋找的定義。
- 診斷性分析法-抑或找出描述性分析法背後的「原因」也是一樣,「用數據工作」四處可見。
- 在預測性分析法與指示性分析法中,人們用數據工作的方式很多,從協助建構出數據源的不同團隊,到用數據工作以建立分析和預測的數據科學家,乃至讀取數據的終端使用團隊,他們用數據工作的方式都不盡相同。

第四章 數據素養之傘
- 無論如何,即便公司在說服自己真的需要數據科學家後想方設法地錄用這些人,他們之後仍會為了如何使用這些數據科學家,或是如何把他們融入整體架構所苦,而這通常是公司本身缺乏數據與策略使然。
- 一旦論及要在組織文化中順利推動數據與分析法,提升內部人力在數據素養方面的技能將有助個人藉由眼前的策略取得成功。
- 組織若想在數據與分析法上取得成功,數據治理是不可或缺的,而數據素養則是協助賦予個人能力,使其透過治理獲得成功。

第五章 讀取並訴說數據的語言
- 組織中的數據暢流

第六章 結合數據素養及分析法四大層次
- 分析法的第一個層次即描述性分析法,簡言之,就是觀察性分析法,我們只要大致回顧過往事件,
即可從中獲得知識、取得理解。這是組織不可或缺的面向。
組織必須知道以往發生過什麼,才有助於規劃未來、了解銷售趨勢為何下滑、清楚行銷活動的表現如何,還有其它數不完的原因。
- 分析法四大層次的第二個層次是診斷性分析法;我想要稱之為分析法「原因」的層次。
一如大家所知,描述性分析法是一種觀察性分析法,它觀察正在發生何事,但卻不會告訴我們為何發生。
- 於是,我們進入到分析法的第二個層次,也就是數據素養的本質。能夠找出事情發生的原因可讓公司組織真正地催生Insight,Insight又可進而幫助公司找到解答與決策。倘若你思考一下,我們是能進行觀察,但唯有正在透過數據素養中的技能和能力深入探討時,Insight-或者「原因」才變的顯而易見。就來看看數據素養和診斷性分析法是如何搭配得天衣無縫吧。
- 數據分析師:數據分析師經由數據普及化、握有數據,而被賦予了數據的力量。數據分析師或許正是那個利用數據工作,建構數據視覺化,繼而篩查、掌控數據,以看出描述性分析法現況如何得人。
- 數據科學家:數據科學家會密集地用數據工作,以找出事物背後的原因。有了原因,我們才會在分析法的第三個層次中更深入探討這點,做出預測,並且設計模型。

第七章 數據素養的學習步驟
- 在通往數據與分析法的道路上,最大的路障和阻礙莫過於組織文化。
組織文化若還沒準備好接納數據與分析法的工作,投資適當的軟體、科技和數據就未必能發揮作用。
領導團隊必須確保公司正在正確的文化架構、文化結構上,同時強化賦權增能,這樣個人和公司才能妥善藉由數據與分析法獲得成功。

第八章 數據素養的三個C
  • 數據素養的第一個C:好奇心
  • 數據素養的第二個C:創意
  • 數據素養的第三個C:批判性思考
第九章 數據啟發的決策
- 你有問題想用數據解答,同時明白或認為自己清楚想要哪種數據而且必須解決問題。
那麼,你能像幫你取得那種數據的團隊充分傳達這點也就變得無比重要。
你會希望取得並用以答題的數據必須具體,你的需求也必須明確等等。
數據的問題和要求模糊不清,不僅會讓你想在正確使用數據時感到挫折,還會嚴重妨礙你成功地透過數具啟發做出決策。
- 偏誤:基本上被定義為「相較於其它事、其它人或其它團體,人們對於某件事、某個人或某個團體之好的偏見,而且常被認為有欠公允。
- 我想要協助各位釐清得第一種偏誤,就是確認偏誤(confirmation bias)。
基本上,確認偏誤就是我們全找數據去支援既有的觀念、想法等等;
我們並沒有對所有的數據敞開心胸,而只是找到支持既有的觀念、想法等等。
這種偏誤隨處可見:在業務上、政治上,還有個人生活上都很普遍。
- 數據啟發決策。
- 受到數據啟發的決策架構之相關步驟
  1. 提問
  2. 取得
  3. 分析
  4. 整合
  5. 決策
  6. 重覆
第十章 數據素養和數據與分析策略
- 有時,我認為組織把工具或是有如神話、難以理解的數據驅動文化看作是一種策略。
請容我強調一下:工具和文化並非策略,而是促使事情成功的元件。
在此,我用蓋房子當作類比吧。想像一下,你想要蓋一棟超棒的房子,所以買了些許的木材和釘子、一把鐵鎚,可能還有一些其它的工具。你沒有畫出藍圖,但你預計這樣不會有問題、可以順利完成,於是隨便雇用幾個路人,對他們說:「為我蓋出一棟夢想中的房子吧。」這會有多麼成功?很遺憾地,你不會成功。
但如今想像一下,你畫好了藍圖、聘請專業的承包商,並讓人人都準備好為你蓋起這棟夢中的房子。
你的計劃具備了蓋房子的文化,而這就是數據驅動的文化。


第十一章 展開數據與分析法之旅
- 我們不能總是侷限在過去還有以往做事的方式,應該要有所警覺,
準備投入嶄新的事務並對此感到興奮。
- 本書不是要探討怎麼培養心態-這類的書已經很多-而是要探討為了在數據與分析法上獲得成功,我們人人都該小心、明白這個世界正在快速進化。我們越是了解未來、數據、一般的分析法和趨勢,將來在數據的旅途上也就準備的越充分。

2024年1月21日 星期日

造局者:思考框架的威力

造局者:思考框架的威力
Framers: Human Advantage in an Age of Technology and Turmoil

第1章  決策[建立思考框架和能否做出好決策,息息相關]
- 提升建立思考框架的能力,有賴於開放心胸,擁抱許多不同的思考框架。
策略一:不斷充實自己的框架庫。
策略二:透過「認知採集」的過程,培育好奇心;
而如果實在已經別無他法,策略三則是要敢跳進認知上的未知領域。
- 多元性是思考框架對社群、國家和文明的重要性。
我們該追求的目標是框架的多元性:培養差異、歌頌差異,而不是希望大家對世界都抱持同質的觀點。我們需要勇敢一點,好讓自己能看到色彩繽紛,而不是像個色盲。

第2章    建立思考框架[建立思考框架是人類的核心能力,AI無法模仿]
- 就算是地球的地圖投影,也會因為將球體投射成2D平面的方式各有不同,而有許多不同的地圖畫法,各有其優缺點。所以,「哪種地圖最好?」這個問題本身並沒有意義,而會因為使用的情境與目的,
而有不同的答案。
- 至於思考框架也是如此,並沒有什麼「最正確的」思考框架,都是看情況、看目的而定。
- 2014年春天,伊波拉病毒在西非爆發,國際組織也立刻找來許多專家進行研究、全力圍堵。
當時處理這項危機的兩大國際組織就是聯合國的世界衛生組織(WHO)以及無國界醫師(MSF)這個國際援助組織。這兩個組織的專家都很清楚,這場戰鬥最重要的武器就是資訊。
然而,雖然當時兩者手中的資料數據完全相同,得出的結論卻完全相反。
這裡並不是他們的分析出了問題,而是因為用了不同的思考框架,
各自對疫情的背景環境與未來傳播規模,有不同的看法。
- 新冠肺炎時亦同,所有國家都取得同樣的資料數據,但因為對新冠肺炎的思考框架不同,就會定出不同選項、採取不同行動,而這就影響了危機爆發後的結果。以英國與紐西蘭為例,就可以看出不同的思考框架會帶來怎樣不同的結果。
- 同樣的資料,卻因為不同的思考框架,而有了不同的行動,而結果也全然不同。
思考框架能協助我們前往想抵達的地方,但我們得先選定方向。

第3章  因果關係[人類會推斷因果,而又常常出錯;但這其實是好事]
第4章  反事實[想像另一個現實,能讓我們在這個現實表現得更好】
- 反事實就是讓我能夠看得比現實更遠的方式。
要是無法想像「本來可能如何」、「現在已經如何」、「未來可能如何」,
我們就會永遠受困在當下,只能討論「現在如何」。
- 反事實思維並不等於隨心所欲做白日夢,也不是智識上的插科打諢、隨意搞笑。
不同於讓議事隨意流動、自由聯想,要做到反事實的思考,需要專注、需要目標導向,
反事實是要用來了解世界、做好行動的準備。
- 反事實也需要依賴在我們思考框架中對因果關係的理解,好讓我能夠在想像中讓時間前進或後退,
又會是取出某個情境發生的事,想像它發生在另一個情境時會如何。
- 而「反事實思維」與「因果推論」這兩項要素也能夠相輔相成。
沒有因果關係,各種事件只會向汪洋大海淹沒我們,卻毫無意義;
沒有反事實思維,則會讓我們受困在現實,無從選擇。
- 反事實之所以這麼有用,是因為能夠提醒我們還有各種選項,讓我們能看得更廣,而不是執著在某個選項。我想像及篩選不同選項的時候,同時也會思考因果關係;但相對的,光是思考單一因果關係的時候,卻無法激發我們的想像力。正因如此,「能夠想像出平行現實」就成了建立成功思考框架的核心要素。

第5章  限制條件[為無限加上限制,反而有助於引爆創意和創造力]
- 三大原則之一:可變性原則、最小變動原則、一致性原則。
第6章  另啟思考框架 [有時候就是該切換框架,或是創造新的思考框架]
- 另啟思考框架有三R:Repertoire(現有框架庫)、Repurpose(借用並調整)、Reinvent(重新發明)
第7章  學習[擴充框架庫、勤於認知採集、實行白紙策略]
- 多元性的優勢不是來自於數量,而是來自於差異。找出七百個類似的想法,不如找出七個不同想法來的有價值;就像是如果一個工具箱能有七種不同的工具(錘子、起子、板手之類),絕對會比裝了七百把錘子的工具箱更實用。
- 認知採集(Conitive Foraging):不一定是為了取得新的思考框架,但就是去尋找對這個世界的嶄新思考方式與觀點。
這裡就是要積極探尋各種新想法、新體驗與新觀點,就像是用認真嚴肅的態度來發展我們的好奇心,
而目標則是要在自己現有的領域之外,取得多元的觀點、不同的視角、豐富的概念。
- 「認知採集」就是:不斷去尋找自己不熟悉的體驗,包括認識新朋友、閱讀題材廣泛的各種書刊、造訪自己平常不會去的地方。這些都是為了培養出開放、好奇的心胸。
這代表需要結識不在自己原本領域的人,這不是為了能得到新朋友的幫助,而是為了接觸到新知,刺激自己的心智。
- 芝加哥大學布斯商學院的社會學家伯特(Ronald Burt)研究組織中的個人,希望了解資訊會如何影響一個人的績效表現。伯特把公司裡的兩種典型人物拿來做比較,分別稱為「詹姆士」和「羅伯特」。詹姆士代表的是內向型的人,遵守規則、注重效率。他們的社交網路會塞進許許多多類似而冗贅的資訊。相反的,羅伯特代表的人會和許多其他領域有連結,喜好多元資訊,會尋找各種新觀點。羅伯特們能夠跨越所謂的結構洞(structural hole,會讓各個組織與領域彼此孤立),這些人都是認知採集者,會接觸到多元多樣的思維方式,也就常能用新觀點來看事物。他們之所以會去建立和維持人際關係,並不是為了解決某項特定的問題,而是因為覺得光是「接觸到其它觀點及視角」就已經很有價值。
- 想預測未來,最好的辦法就是去發明未來。-電腦科學先驅凱依(Alan Kay)
- 擴充框架庫裡的框架樣式、勤於認知採集、實行白紙策略,分別適用於不同的情況。
其中的差異可以這麼比擬:擴充框架庫就像是去讀相關的書籍;認知採集則是廣泛閱讀各種不同學科的書籍刊物和文章;至於白紙策略則是熱情擁抱所有知識。
- 官僚制度常常聽不到這些「企業裡的卡珊德拉」的高聲吶喊-有些員工早已預見災難,也提出可能的糾正措施,卻總是被無視。英特爾傳奇共同創辦人葛洛夫(Andy Grove)認為這種員工對企業的成功至關重要,還特地在自己的回憶錄花了整整一章來談這些「大有幫助的卡珊德拉」,讚揚這些人「帶來新觀點」。
- 沙子掉到牡蠣裡,並不會產出珍珠。

第8章  多元性 [擁抱變化、運用教育、鼓勵遷徙、容許摩擦]
第9章  警惕 [我們要避免思想僵固;我們需要機敏的心智]
- 建立思考框架,其實是結合了兩種截然不同的程序。
第一種是要建構和應用思考框架,指的是要運用因果關係、反事實與限制條件這三要素。
這種程序能讓人迅速找出有用的選項,並且準備迅速採取行動。我們的人生大半都是應用思考框架,
而且這也很合理:在大致熟悉的情境中,這種方式可以最有效率的幫助我們做出決策。
- 至於第二種程序,則是要切換到不同的思考框架,也就是另啟思考框架。
這件事的風險遠遠更高,但因為能讓我們對現實有新的選擇,也可能讓我們得以找出新方式來應對挑戰。在局勢穩定、條件如常的時候,通常不需要另啟思考框架。
但如果情境有所不同,另啟思考框架就常常是很優秀的策略。

衍生閱讀:
1.人類大命運:從智人到神人
2.雜訊
3.快思慢想
4.民約論

2023年6月10日 星期六

資料煉金術

資料煉金術

第2章 資料煉金術—「資料就是新的石油」,這是不當的比喻
- 某些細節的價值,必須從大局來看才能瞭解,但又只有知道所有細節的人,才能看到大局。
智慧手機應用程式商店的經營者,能夠知道自己有哪些個別顧客、顧客各有何偏好和習慣。
彙集這些資訊,就能對整個市場有了既全面又細緻的瞭解,據以調整商業模式,可以用來打造應用程式或行銷應用程式、銷售音樂和影片等內容,也可以設計出個人化的廣告。
- 人工智慧專家、資料科學家、量化分析專家,瞭解演算法的秘密,才能看穿並掌握大數據深藏不露的見解。

第7章 資訊財富自由— 重燃創新之火,讓人人都能享有數位紅利
- 如果以為只要開放政治上開始追求開放資料,就能迅速扭轉根深蒂固的官僚文化,這是太過樂觀了。這裡需要的是思惟方式的徹底改變。正因如此,如果想要開放政府資料,需要投資的絕不只是開放資料所需的科技基本建設與組織架構調整,而是需要對公部門的員工提供教育,提升他們的資料素養。

2022年8月29日 星期一

失控的數據

失控的數據:數字管理的誤用與濫用,如何影響我們的生活與工作,甚至引發災難

- 能夠被精確衡量的東西大大掩蓋了真正重要的東西。
- 「訓練」與「教育」的不同,在於「訓練」是要讓人能夠生產與生存,
「教育」則是讓生存具有意義。
- 能夠被評量的項目都是最容易評量的項目。
- 當指標變成評量的標準時,那些無法呈現出短期效益的計劃就會遭到捨棄。
- 因那些可以評量出績效的工作而獲得獎勵的員工,就不會多花力氣在其它的工作上。
結果就是,指標這個方法取代了公司的目標,然而這個方法原本應該是要協助完成目標的。
- 重視短期目標的代價,就是犧牲了對長期發展的考量。

2021年3月5日 星期五

AI行銷學:為顧客量身訂做的全通路轉型策略

 AI行銷學:為顧客量身訂做的全通路轉型策略
Make It All About Me: Leveraging Omnichannel and AI for Marketing Success

前言  朝全通路轉型的六項修練

第一項修練  辨識顧客並取得行銷許可
第二項修練  蒐集資料
- 顧客資料多貼近顧客?
   1.顧客提供的資料:提交的資料(sumitted data)或檔案資料(profile data)
   2.有關顧客行為的資料:行為資料(behavioral data)
   3.有關顧客想法或感覺的資料:情緒資料(emotional data)
1.提交的資料:顧客告訴我們什麼?
- 提交的資料有個缺點,那就是顧客在提交資料中的陳述往往與實際情況不同。
- 要領:創造提供資料的誘因、使提供資料的流程便利容易、使用遊戲化手法來激勵用戶提供更多資料。

2.行為資料:顧客做了什麼?
(1).交易、電子郵件與點擊資料 
(2).行銷活動資料 
(3).來自網站的行為資料 
(4).來自客服中心及聊天室的資料 
(5).物聯網(來自裝置的資料)
- 要領:在顧客未登入時蒐集網站上的行為資料、鼓勵登入、保留登入帳戶、創造一個用戶喜愛同時也能取得資料的服務(例如:IMDB、Nike+)、實體商店的行為資料(建立會員制蒐集資料、使用顧客的手機來蒐集資料、行動的銷售點系統)、把資料蒐集內建在產品中(例如:Netflix、Spotify)、來自其他組織的行為資料。

3.情緒資料:顧客有什麼感覺?
(1)問卷調查 
(2)情感分析(sentiment analysis)
- 透過第三方增補資料:鄧白氏(Dun & Bradstreet)、益博睿(Experian)
- 來自其他網站的「入市潛在顧客」(in-market)資料

- 全通路整合與顧客檔案
- 蒐集資料的成熟度面貌
第三項修練  資料分析與人工智慧
- 持續對所有顧客進行評分,標記(tagging)最相似的客群,並根據這個洞察充實自動系統裡每位顧客的紀錄。藉由這種做法,顧客關係管理團隊就能變得更加迎合顧客的需求。
- 使用資料分析來辨識每位顧客的「下一步最佳行動」(Next Best Action)。
*各種分析*
*描述性分析(Descriptive Analytics):
包括傳統統計學,但它在商業中可能涉及在試算表上計算、查詢資料庫、產生商業智慧與數據儀表板,而這些全都提供「後見之明」的觀點。
商業智慧經常會把資料總合成關鍵績效指標,再由使用者透過人為的方式深入探究,期望可以從中找出相關的型態。
視覺化工具也可以視為描述性分析的一個層面,因為它能幫助探索與了解目前或歷史的資料。
從簡單、靜態的圖表(可由試算表得出的圓形圖、直方圖等),到高度互動且動態展現的多維度資料,皆屬視覺化的範圍,它能讓你穿梭其中,感受如同虛擬實境般的體驗。

*前瞻分析(forward-looking analysis)並不是新技術,到目前為止它主要涉及的是預測,這是一種根據以往趨勢與型態為主的「總體層級」預測方法:營收、獲利、顧客留存率等等朝什麼方向發展?
這種預測可以提供概括性的了解,有助於整體規劃,但無助於客製化溝通與互動所需要的詳細資訊。

*預測性分析也是從歷史資料著手,不過機器學習演算法會自動探索資料,找出和特定商業結果有關的型態與關係,例如一位顧客購買某類產品的傾向。
這些型態是行銷人員可以使用的洞察,而演算法也會產生可以直接採取行動的「模型」,模型能夠評估任何現狀或是全新情境,並自動預估結果,至於預測模型所得出每個情況的簡單評估通常是代表一種傾向或評分。

*指示行分析(Prescriptive Analytics)會把一個預測模型產生的結果(例如代表一個預測結果發生可能性的「評分」轉化為一個可直接行動的決策,做法是把這個評分結合商業邏輯,藉此決定每個情況的最佳作法。(例如是否推出行銷活動?應該推薦什麼商品?以及應該採用哪個通路?)
由於預測性分析和指示行分析都仰賴機器學習,因此可以將它們視為人工智慧的範疇。在書中通常只用「人工智慧」這個詞來概括代表這些進階的分析。

*進階分析(advanced analysis,其實指的是演變而成的整個技術)可應用在任何擁有資料的產業領域(風險、財務、網路規劃、營運、供應鏈等等),只要透過分析,便能在決策中注入智慧,得出更好的結果。即使是和行銷有關的應用領域也很廣泛:銷售分析、行銷組合歸因與規劃(marketing mix attribution and planning)、品項規劃(assortment planning)等等,全都可以應用進階分析和機器學習來進行改造。

*人工智慧能力:演算法與模型*
- 你的市場或客群有哪些區隔?有什麼特徵和檔案資料可以用來區別每位顧客,讓你能將他們都視為各具特色的個體?這是跟「誰」(who?)有關的基本提問,而針對每位顧客,你需要了解:
--什麼?(what)他們對什麼訊息有反應?他們會購買什麼產品?
怎麼樣的溝通內容最能有效吸引他們到商店購買?
--如何?(how)他們選擇如何和你互動,亦即他們透過什麼通路和你互動?
如果他們購買的是服務型產品,他們如何使用?他們如何付款?
--何時?(when)他們偏好何時與你互動?他們在一天當中的哪個時間最能接受你的溝通訊息?
長期來看,他們何時移動至顧客生命週期的不同階段,而在他們的購買旅程中,那些點對你而言最為關鍵?

*人工智慧模型與演算法的主要能力*
*分類(classification)可以幫助你做出區別。
例如區別產品的購買者與非購買者。你可以用它來預測誰會購買(或不夠買),分類演算法也可能會產生典型的購買者和非購買者大致的樣貌,而這些資料是最能區別的特徵。

*評分(scoring)可以預測某件事發生的可能性:
一位顧客可能的回應、是否購買、是否終止使用一項服務等等。
雖然就某種程度而言,這與分類工作相同,但它會針對每位顧客或每種情況給出一個評分,
供你做出相關的決策。例如對顧客排序並進行比較。

*群集或自動市場區隔(auto-segmentation)演算法可以幫助你辨識「自然產生的」客群,
並描繪出這些群集的樣貌。

*關聯分析(association analysis)可以辨識出往往會同時發生的項目,這經常應用在辨識出一起購買的商品,因而時常稱為「購物車分析」(basket analysis)。
這種分析可能產出像「當一起購買A產品和B產品時,購買C產品的可能性為72%」這樣的規則。你可以使用這個方法作為交差銷售推薦的基礎,這種關聯性分析的資料基礎不僅限於單一交易購買的產品,它也可以檢視這位顧客購買的所有產品。

*序列偵測(sequence detection)與關聯分析類似,但它辨識的是一堆商品或一系列事件在一段期間的發生順序。
這類演算法能夠偵測出產生良好結果(例如購買或升級)的型態,使你得以建立通往好成果的「捷徑」,或是辨識出導向壞結果(例如取消合約)的路徑,並設法避開這些路徑。
它可以用在很多領域,例如辨識隱引領顧客至購買網站的造訪途徑,或是發出早期警訊(例如顧客終止使用某項服務)的訓序列事件。

*預測(forecasting)或估計(estimation)會針對未來將發生的某件事提供一個預測數值,
例如一位顧客會在一項新產品或服務上的消費量,或是顧客終身價值。

- 人工神經網路(neural network)模型和決策樹(decision tree)模型都可用來評分。
人工神經網路模型在模仿人類下意識決策的應用領域特別有效,例如影像處理與型態辨識;
不過,它們在行銷領域也有用處,因為它們能產生一個連續系列的評分,因而足以做到
細緻的個人區別。
- 決策樹是以樹狀架構得出決策的模型,決策樹的模型會產生一種並不精細的「塊狀」評分分類,
而被歸類為同個塊狀的所有案例彼此之間也沒有區別。
- 人工神經網路模型可以做到精細區別,但高度不透明;
決策樹模型具有高透明性,但缺乏精細度。
- 其他進階方法包括拿人工神經網路模型得出的結果來訓練某個決策樹模型(而非使用歷史的回應資料來訓練),因此便能幫助了解人工神經網路模型如何得出決策,亦即消除或降低人工神經網路模型的不透明性。

- 機器學習能促成一種資料導向的方法,它使用群集演算法(clustering algorithms),並客觀的根據實際資料來自動產生市場區隔模型。稱此為「自動市場區隔」(auto-segmentation)。
- 以自動市場區隔建立的群集模型則是動態的,它們將自動區分既有顧客或新顧客至最吻合的市場,並持續重新評估既有顧客,追蹤他們在各市場區隔之間的漂移。
- 資料準備與特徵工程。在機器學習演算法開始運作前,通常需要進行資料準備,而這會涉及一般會遇到的問題,例如辨識與處理資料品質,或是可能導致對演算法構成挑戰或偏誤結果的數值分配不均。有些方法可以幫助確保演算法去學習那些不常發生的結果的型態,例如超採樣(oversampling)和低採樣(undersampling),基本上,超採樣就是要演算法多注意那些不常發生的結果,低採樣則是要演算法少去注意那些經常發生的結果。

- 將優化法應用在行銷活動與顧客互動時會考量以下條件,包括:
每個個別顧客的預測行為(他們對各種推薦產品或行銷訊息做出回應的傾向、可能購買的傾向、通路偏好等等);參數(例如不同類型顧客互動的成本);限制條件(例如通路容量、整體預算);
目標(例如使顧客回應率或營收最大化)。
而一個數學優化引擎會運算這整個情境,得出一份在限制條件下獲得最佳整體成果(指達成目標方面)的計畫,實際上就是對每位顧客的最適推薦產品或互動。

- 在顧客關係的任何一個點上,你可以對他們採取很多行動,當中有些行動無疑是推薦產品,
然而其他行動並不直接聚焦在銷售,它們可能會是:
對顧客的抱怨做出道歉或補償;搶先調整某項服務的費用,雖然降低當期的營收,
但有助於提高顧客忠誠度與潛在的顧客終身價值(customer lifetime value);
提供免費訓練、指導或資訊,幫助顧客從購買的產品上獲得更大的效益等等。

- 從何處著手?挑選容易實現的目標:
它配合行銷目標嗎?它能帶來價值嗎?它可能帶來什麼價值?這個分析方法的困難度高嗎?
需要什麼資料?分析結果容易應用在行動上嗎?
- 資料分析與人工智慧的成熟度面貌
第四項修練  溝通與服務
- 你的溝通訊息未必要聚焦在是當作出合適的產品推薦,而是應該設計成為顧客提供更多價值的適當服務訊息,不意圖銷售任何東西。
這也是許多組織聚焦在建立「下一步最佳行動」的顧客關係,而非「下一個最佳推薦產品」的原因。
- 零售業的顧客生命週期三階段與關鍵時點
- 不要浪費折扣在那些通常以全價購買而不會追問的顧客身上,除非你試圖對他們交叉銷售一項新類型的產品。
*維繫階段:1.紅利點數即將失效 2.淨推薦評分(Net Promoter Score,NPS) 
3.重新取得行銷許可 4.挽回顧客的優惠措施
- 以顧客為中心的戰術成熟度
- 由資料中的特定條件引法的一次性行動稱為「觸發行動」(triggered actions),
例如觸發電子郵件、觸發訊息或觸發溝通流程(trigger flows,在顧客生命週期的同個時點上有多個相關的溝通相互同時發生)。

*拼湊專屬的行銷技術堆疊
-顧客關係管理、行銷自動化平台、多通路行銷樞紐(MMH,Multichannel marketing Hub)、
需求面平台(DSP,Demand-Side Platform)、內容管理系統(CMS,Content Management System)、
社群媒體管理(SMM,Social Media Menagement)、影響力人士關係管理系統(IRM,Influencer Relationship Management)、數位資產管理(DAM,Digital Asset Management)、
行銷資源管理(MRM,Marketing Resource Management)
- 溝通與服務的成熟度面貌
第五項修練  績效分析
*低成熟度:銷售與品牌業績表現
- 銷售數字、市場占有率、品牌知名度、品牌認知
*中成熟度:通路與行銷活動
- 人潮、曝光、網站造訪、頁面瀏覽、互動與觸及量、購物車規模、轉化率、提升度、銷售模型
*高成熟度:顧客面指標
- 新顧客增加量、顧客流失率、顧客終身價值與顧客忠誠度
- 其他顧客指標:荷包占有率(荷包占有率是指目前顧客在特定產品或服務類別的預算花在你的事業上的比例)、
每筆名單成本(cost per lead,CPL)、顧客獲取成本、維繫顧客的成本(cost of retention)
*以顧客為中心的指標優劣
- 淨推薦評分
- 品牌的淨推薦評分=推薦者所占的比例(%)-批評者所占的比率(%)
- 顧客推薦的價值
- 評量品牌認知
- 能見度:展示關鍵績效指標與傳送報告。
如果你的員工只能看到他們部份工作的果實,那麼他們最終可能只注重那些工作。
- 提高關鍵績效指標的能見度十分重要,讓無關緊要的評量指標失去能見度也很重要。

*設下標準
-我們的績效比預算高還是低?
-我的表現比同事好嗎?無論是個人之間的比較,或分店之間的比較,
和公司裡擁有相同職責與績效目標的人或單位相互比較都具有激勵作用。
-在部門層級,這種標準有助於促進團隊精神與團結。然而,在個人層級就必須審慎使用,
因為如果公司需要員工彼此合作,就必須確保個別員工在達成自己的績效數字時,
不會因為只聚焦在個人之間的互相競爭而導致達到次佳的結果。
-我們的表現比上週好嗎?

*過度數字導向的陷阱
-太過純粹聚焦在數字目標的第一個危險是,過度聚焦在期望成效以外的目標;
其次,可能會創造出員工沒有動機或空間互相協助的工作環境。
-另一種潛在危險是,數字無法呈現組織的本質。舉例來說,如果你的顧客體驗高度取決於員工滿意度(顧問業即為一例),過度聚焦在每月預算可能會導致一個不愉快的工作環境,
而產生的連鎖效應是:不滿的員工導致不滿的顧客,因而更難達成下一個月的績效數字。
- 績效分析的成熟度面貌
第六項修練  組織與管理
- 數量型事業(volume-based business)
- 目標客戶行銷(account-based business)
- 目標與獎勵應該反映最有益於長期顧客獲利能力的因素,不可在無意間鼓勵個別銷售通路內的局部優化(次佳化),卻犧牲全組織的最優化。
- 組織與管理的成熟度面貌

2021年2月2日 星期二

AI必修課:日本情感研究權威的人工智慧秒懂攻略

 AI必修課:日本情感研究權威的人工智慧秒懂攻略

第二章 人工智慧擅長與不擅長處理的事

- 聲音辨識系統會使用兩種技術以防止雜音造成錯誤判斷,一種是判斷人類說話時間區段的技術(聲音檢出),另一種則是去除混入雜音的技術(雜音去除)。

- 用比較專業的術語來講,聲音辨識是將輸入的訊號轉換成聲音特徵向量(將聲音的各種特徵數值化後的資料),再從一系列的聲音特徵向量推敲出對應的單字。

- 過去將聲音轉換成正確文字的過程可分為兩種模型,分別是「聲音模型」與「語音模型」。

- 聲音轉換成文字的過程是先分頭進行再匯合出結果。「聲音模型」就像是聲音的單字辭典,「語音模型」則是由上下文預測是那些單字組成。

- 隱馬可夫模型(HMM,Hidden Markov Model)

- 利用聲音模型或語言模型分別進行處理,想要正確預測出後面的單字仍有其極限。

- 語意網路(Semantic Network)在人工智慧發展初期便是著名的研究。

- 單字與其意義並不是任意存放在大腦記憶中,而是以聯想串聯起各單字所代表的概念,並將其意義相近的單字一起記憶下來。

- 潛在語意分析(LSA,latent semantic analysis)

第三章 人工智慧如何從資訊中學習?

- 機器學習大致上可以分為「監督式學習」、「非監督式學習」、「強化學習」等三種。

- 卷積式類神經網路(CNN,Convolutional Neural Network):CNN所使用的是誤差反向傳播法來調整權重,完成學習過程。

--卷積層(convolution layer)

--池化層(pooling layer)

--局部比對正規化層(LCN,local contract normalization)

--鏈結層(fullyconnected layer)

- 遞迴式類神經網路(RNN,Recurrent Neural Network):RNN是一種在聲音、語言、影片等序列式的資料處理上具有優勢的類神經網路。

- 波爾茲曼機

- AI三大家:深度學習的「類神經網路」、專家系統、遺傳演算法。

- 遺傳演算法(GA,Genetic Algorithm):GA常被應用在遊戲、股票交易、飛行路徑最佳化、飛機機翼大小最佳化等領域中。

2020年10月9日 星期五

將大數據由「潮流」化為「營收」的8個法則

 將大數據由「潮流」化為「營收」的8個法則:由理論落實到工作現場

2019/08/02

第2章 大數據的活用要以「目的」為前提

- 想要提高營業額的目標,基本上有3種方法可供參考:1.讓客源增加(不要減少)、2.提高購買單價、3.提高購買或來店的頻率。

- 想要「讓客源增加(不要減少)」,就必須做顧客分析;想要「提高購買單價」,就一定得掌握過去的購買紀錄和需求。想要「提高購買或來店的頻率」,針對鎖定的顧客發生提醒或具效果的促銷活動,都是有效的方法。

- 活用大數據提升銷售額的策略

- 在「提高購買單價」方面的有效對策,可以選擇前述的「推薦商品」或「商品開發」這兩種方法。

- 「降低成本或風險,實現提升品質」是強化企業的「價值」與「品牌」的對策。而且,降低成本也是提高獲利率不可或缺的戰略。

第3章 活用大數據的進階方法

- 大數據活用專案的流程

- 「樣本的假設成立」也可以說是以增加營業額的目的導向,思考著要分析什麼要素的步驟。

- 營業額可以透過「顧客數 X 顧客單價 X 頻率」的公式算出。選項就是增加顧客數、增加顧客單價或提高來店頻率的其中之一。

- 再稍微思考一下,即使是要增加顧客數,也會有是否需要增加新顧客、是否需要讓觀望顧客復活等不同的方向,因此成為分析對象的]數據或分析方法也會隨著改變。

第4章 活用大數據邁向成功的8個法則

- 大數據是工具,而非目的。

- 在目的明確之後,才開始導入行動。當目的不只一個時,也要依照優先順序進行。

- 不要花費太多時間蒐集事例。只要設定好目的,就先試試看。

- 有效活用外部人才的方案(Kaggle)。

2020年9月19日 星期六

世界第一簡單機器學習

 世界第一簡單機器學習

2019年4月

第1章 怎麼做迴歸?

- 正規化的方法分為兩種,Ridge迴歸盡可能減少大數值的係數,和Lasso迴歸增加數值趨近零的係數。    

第2章 怎麼進行識別?    

- 模型的輸出為權重w的函數,所以當w改變,誤差的值也會不同。遇到這樣的問題,我們可用梯度下降法(Gradient Descent)來求解。

- 由所有的訓練資料D計算梯度的方法,稱為批量梯度下降法(Batch Gradient Descent);將D分割成適當的大小,以此為單位計算梯度的方法稱為小批量梯度下降法(Mini-batch Gradient Descen);由D隨機選出一個資料,僅以此資料計算梯度的方法,稱為隨機梯度下降法(Stochastic Gradient Descent)。

- ID3是演算法是建立決策樹的最基本步驟。

- 亂度Entropy和資訊量

- 將原資料的亂度減去分割後的資料亂度,得到詢問可獲得的資訊量,該量成為資訊增益量Gain。

- 關於資料集算度的計算方法,除了上述的亂度(Entropy)之外,還有一種方法是以下面的式子計算吉尼係數(Gini Cofficient)。

Gini(D)=1-Pyes^2-Pno^2

- 奧卡姆剃刀(Occam's Razor),目的是「選擇符合資料且最單純的假說」。

- 決策樹會過於適應訓練資料容易發生過度學習(Overfitting)。

第3章 評估結果    

- 要掌握機器學習未知資料時的性能。其中,最簡單的方法是,將手邊的資料分割成訓練用和評估用。稱為分割學習法,機器在學習時先不使用評估資料,等到要計算準確率時才使用。這樣一來就能模擬遇到未知資料的情況。  

- 會影響訓練結果的超參數(Hyperparameter),比如線性迴歸中正則化須的權重數、決策樹訓練的樹木深度等等。調查配置訓練的超參數是否妥當,這個過程就稱為檢驗。若在檢驗作業中使用評估資料的話,評估用資料就不能算是未知資料了。

- 所以,使用分割學習法來評估性能時,一開始應該將資料分成訓練用、檢驗用、評估用三部分


- 對資料進行分割,資料的分割份數稱為折數(fold),通常會採用10折交叉驗證。

- 評估用資料元素數為1的分割法,另外稱為留一法(Leave-one-out)。

- 準確率是在評估資料中,正確辨識類別的資料比例。為了簡化說明,舉例二分類識別問題的評估法。這是有沒有罹患某種疾病、是不是垃圾信件等問題。符合預設條件的訓練資料為正例(positive)、不符合的資料為負例(negative)。

- 混淆矩陣(Confusion Matrix)


- 只有準確度是不夠的:未罹患疾病的人數遠比罹患疾病的人數還多的情況,也就是資料中的負例比正例多很多的意思。比如1000人中僅1人罹患疾病的極端情況,使用全部判定為負的分類器,這樣準確率會是0.999。為了能夠區分這樣的情況,我們需要以其他指標來評估機器學習的結果。

- 根據上表,準確度Accuracy= TP+TN / TP+FN+FP+TN (正解數除以全部資料數就是準確率)。

- 精確度Precision,這是分類器判定為正時,可以多麼相信該結果的指標。

Presision = TP / TP+FP (正確判定為正的數量除以分類器判定為positive的數量就是精確度)。

舉例:被判定罹患某種疾病且該診斷為正的正確比例。

- 召回率Recall=TP / TP+FN (正確判定為正的數量除以所有正例的數量就是召回率)。

例:對象資料中的所有病患中,有多少人被正確診斷罹患疾病。

- 精確度和召回率往往是此消彼長的關係,一邊數值高,另一邊數值就低。

舉例來說,罹患某疾病的症狀很明顯時,分類器才判定為正的精確率會高,不過這樣了話會忽略掉輕微症狀,造成召回率變低。相反地,優先提高召回率,稍微有一些症狀就判定為正,使用這樣的分類器,會導致雖然漏掉病患的情況減少,但可能造成很多沒有生病的人需要接受精密檢查。

- 於是,我們會用下面的式子定義綜合判斷精確率和召回率的指標F值。

F-measure = 2 X Precision x Recall / Precision + Recall

- 若是三種類別的情況,混淆矩陣會變成3x3。由混淆矩陣求出各類別的性能,平均後的數值為巨觀平均(Macro Average);由類別計算TP、FP、FN、TN相加後,除以資料數的數值為微觀平均(Micro Average)。

第4章 深度學習    

- 卷積神經網路(Convolutional Neural Network)

- 前饋式神經網路(Feedforward Neural Network)

- softmax函數

- 反向傳播法(Backpropagation)

- 自動編碼器(Autoencoder)

- rectified liner函數,使用此函數的單元稱為ReLU(Rectified Linear Unit)。

- 使用Keras資料庫,Keras封裝了常用的TensorFlow深度學習庫,能夠做到更高階的敘述,可用簡潔的程式碼編寫深度學習的典型問題。

第5章 整體學習Ensemble Learning    

裝袋法Bagging    

隨機森林Random Forest    

- 裝袋法、隨機森林是藉由改變使用的資料集,或者改變分類器的構成條件,做成不同的分類器。與此相對,不斷加入專門減少錯誤的分類器,形成反應不同的分類器集合,稱為提升法。

提升法Bossting    

- AdaBoost(Adaptive Boosting):以變更權重的資料集訓練下一個的分類器,依序形成不同的分類器。後面做成的分類器會優先識別上一個分類器錯誤判斷的資料,具有與上一個分類器不同且能夠彌補弱點的效果。

- 另外一種方式是使用損失函數。以提升法結果作成的複合分類器,可用來定義損失函數。其中,追分的分類器會選擇損失函數值減少最多的。這種方式的提升法稱為梯度提升Gradient Boosting。

- 機器學習工具Weka內建diabets.arff資料。

第6章 非監督式學習

6.1.1 集群分析

6.1.2 階層式集群分析(Hierarchical Clustering)

- 群集間的相似度可用下面的方法定義:單一連結(Single Linkage)、完全連結法(Complete Linkage)、中心法(Centroid Method)、Ward法

- k-means法、EM演算法

EM演算法基本步驟跟k-means法相同,一開始先用亂數決定隨機的平均向量和共變異數矩陣(Covariance Matrix),這相當於在特定空間中隨意的場所放置隨意的常態分佈。

6.2 矩陣分解

- 假定用戶與商品之間存在幾項潛在因素。潛在因素是指,在分組用戶、商品時類似視點的條件,像是「女性」、「居住地」、「喜歡甜食」等等。但是,這些是在沒有監督的情況下從資料中選出,所以未必每個都能如此解釋。

- 交替最小平方法(Alternating Least Squares)。

- 非負矩陣分解(NMF)

- 分解機模型(Factorization Machine)

6.3 分割式集群分析(Partitional Clustering)


2020年6月16日 星期二

大數據的另一章

大數據的另一章!資料分析3.0時代,靠分析讀懂你的客戶,讓企業贏得競爭優勢
The Analytics Revolution: 
How to Improve Your Business By Making Analytics Operational In The Big Data Era
Bill Franks

Part01|分析革命已經開始
Chapter01 瞭解營運分析
- 國際分析研究所(International Institue for Analytics,IIA)建立的分析3.0框架。
-數據分析2.0:
- 專業分析人員在企業中部是演變為決策層的一員,就是對決策層有著直接的影響力。
專業分析人員不再是完全獨立於業務群體的幕後資源。
-數據分析3.0:
- 長期以來,客戶流失分析已經演進為尋找行為組合的特定模式,
這是因為行為組合比單一行為更具危險性。這一般稱作「路徑分析」(path analysis)。
如果一個客戶線上看到對帳單,首次了解手續費後請求取消手續費。這可能不是一件麻煩事。
但是,如果客戶透過致電客戶服務管道再次要求取消手續費,並且接下來又致電分支機構,
那麼對客戶的忽視就會加大其關閉帳戶的風險。

Part02|奠定分析基礎
Chapter04 想要預算?先制訂商業計畫
- 關注回報而非成本
最大化關注點:解決的業務問題、價值回報、差異性。
最小化關注點:需要的工具和技術、成本、持續改進。
- 很多企業會進行一個有針對性的概念驗證(proof of comcept,POC)作為第一步,
這是一個不錯的想法,但是別讓範圍有限的概念驗證作為終點。
只解決某個問題的一小部分並不能讓一個商業計畫獲得投資通過,特別是需要大量資金和人力的投資時。
- 展開新的營運分析的第一步不必走得太遠,第一步是要簡單證明這個新想法是有價值的。
一開始你並不需要一個完整的、生產就緒的流程,只要可足夠展示價值就行了,
然後利用累積的經驗去更加有效地設計和建立最終方案。
- 為了具備差異化潛力的分析來制訂商業計畫,而不是僅改善、提升現有的分析流程。

Chapter05 建立分析平台
- 基礎流程或政策問題的一個常見表象,就是它們對所涉及的技術的影響。
在很多案例中,看上去是技術問題,但其實不是。一定要區分開「技術問題是更大問題的表象」
與「技術確實是問題的誘因」兩種不同的情況。
- 資料倉儲學院(TDWI)
- 對大多數企業來說,使分析營運化不是一個技術問題,技術問題僅僅是潛在的政策和文化問題的表象。
- 除非即將到來的一項功能是絕對重要的,否則不要因將來可能出現的技術推延今天的投資決策。

Part03|分析營運化
Chapter07 資料分析
- CRISP-DM規定了傳統資料探勘過程的基本步驟。
- 另一個常見的模式是SAS研究所的SEMMA模式。
SEMMA代表「sample,explore,modify,modal,and assess」
(資料採樣、資料特徵探索、資料調整、模式研發和模式評價)。
- 在批次分析中用於預測對所有使用者的最佳推薦的演算法。
也可以用於預測對某一個目前正在瀏覽網頁的特定使用者的最佳推薦。
區別在於產生對目前特定使用者推薦的演算法使用的是最新資料。
- 大部分由大公司建立的分析過程都可以總結為兩個原則。
第一個是統計,其中包含了變異數分析(ANOVA)、迴歸分析以及顯著性檢驗。
第二個是預測,其中包含了傳統時間序列預測和投影預測技術。
這兩個分析原則已經無法滿足目前的要求,企業需要精通除統計和預測方法之外的更多分析原則。
像是模擬分析,蒙特卡羅(Monte Carlo)模擬是特別流行的方法。
- 最佳化分析原則也正得到越來越廣泛的使用。長久以來,最佳化都用於定價分析,
而近來其應用範圍得到了拓展。他透過分析變數和限制條件提供可能的最優方案。
蒙特卡羅模擬一一查看和量化各種可能的影響;最佳分析則從中找出最佳方案。
最佳方案通常用於重要變數可控制的情況。在定價分析中是可以控制商品的價格來獲得最優結果的,
而在退休計畫分析中,通膨率則是無法控制的,因此就不能使用這種方法。
- 為了處理資料流,「複雜事件處理原則(Complex Event Processing,CEP)」漸成主流,
CEP原則在資料流傳遞期間分析資料並快速做出決策,其也能夠同時運用大多數其他分析原則。
- 資料探勘、預測分析、人臉辨識演算法、圖形分析演算法、地理空間分析、文字分析、社群網路分析。
- 設計分析時,提出正確的問題比後面的其他工作對結果的影像更大。
- 分析結果往往取決於問題的定義、提問的內容、分析方案的設計,以及該方案一旦確立將為如何實施。與過程中的細節相比,選擇解決哪一個提問對結果的影響更大。
稍不注意,建立的分析可能就回答了錯誤問題的錯誤提問。
- 不可能探索到所有潛在的分析。當錯過了某些東西之後,總是會事後諸葛。
為此,不只記錄為什麼採取某些路徑,也記錄為什麼沒有選擇其他的路徑。
- 探索性分析允許一個寬泛的目標或有限的假說,而驗證性分析從一開始就高度集中並界線分明。
- 典型相關分析或迴歸分析可於確定那些路徑特徵與利息指標最相關。
在這種情況下,非統計學的路徑功能提供了新的資訊,可以用嚴格的統計方式進行分析。
統計方法增加了路徑分析的影響力。
- 提供解決方案,而不是分析說明。重點必須放在透過分析解決問題上。
證明一個過程是可行的,只關注結果而不是直接關注分析。
- 營運分析的發起人和使用者童常不了解或不關心分析,他們只想得到問題的解決方案。
如果不被問到風險,不必談論技術細節。

Chapter08 分析組織
- 資料科學家往往是電腦背景出身,使用Hadoop,用Python或R等語言寫程式。
傳統意義上的專業分析人員多半是統計、數學或運籌學背景,
使用的可能是關係式的分析伺服器環境,語言用的是SAS和SQL。
使用的平台或者語言不同,並不會改變背後的技能與思維方式。
- 認證分析專家(CAP,Certified Analytics Professional),該認證項目是由美國運籌管理協會
(INFORMS,Institute for Operations Research and the Management Sciences)贊助的。
- 分析完成之後,工作仍在進行。我們還得完成分析結果的行銷和推廣,建構營運過程支撐模式,
這樣才能儘可能大地發揮影響力。
- 專業分析人員是顧問、是導師、是教練,但不是因循守舊者,該表態就表態。
舉止不像專家,別人自然不會以專家視之。


2020年2月27日 星期四

解構大數據:如何運用大數據,打造人性化行銷模式

解構大數據:如何運用大數據,打造人性化行銷模式
財團法人台灣金融研訓院
當下思維
第一章 科技改變了一切
- 資料本身不會出錯,但我們蒐集、細察、瞭解資料的方式卻很容易出錯。

第二章 無中生有的觀點?
- 樣本的偏誤來源
1.自我選擇偏誤 2.涵蓋不全偏誤 3.存活者偏誤

第三章 選擇武器
表3.1 理論類別的分類法
- 分析:這是為了描述局勢是什麼樣子。
例如,我們需要知道可應付的市場規模:我們的業務究竟有多大的商機,不同客群的商機有何不同?
客群區隔可能屬於這一類,它幫我們找出符合事業需求的客群。
- 說明:這個理論類別可以稱為瞭解的理論,因為它的重點是教我們如何瞭解世界,產生新的認知。
市調大多是屬於這一類,它讓我們洞悉為什麼大家會有某種行為。
- 預測:這是理解之下的預測,所以和本書的多數討論息息相關。
不過,這裡應該承認一點,預測不見得一定要有因果關係。
- 說明與預測:就某方面來說,建立衡量指標的最佳實務做法是,
不僅可以瞭解現象背後的根本運作機制(亦即我們能說明為什麼會有某種變動),還可以進而預測變動。
例如,某種顧客滿意度的理論或方法看起來很適合套用在我們的事業上,我們據此設計衡量指標,
並預測特定結果(例如留客率或顧客價值)的效果。
所以我們不僅有預測結果的東西,還瞭解其背後的原理。
- 設計與行動:這種理論是描述如何做某事,也反映在設計思維的廣泛領域。
需要衡量的典型例子包括:找出大家常犯的錯誤、購物到結帳的平均時間、
駕駛人在某條路上的駕駛速度等等。
當我們衡量大家如何做某些活動時,就可以想辦法援引成功案例的經驗加以改進。
- 資料類別與商業目標模型,四種不同的類別概述如下:
1.績效管理:這裡使用的資料通常是由內部系統(例如CRM系統)建構與取得。
這種分析可用於平衡計分卡和儀表板,以便有效地管理事業,持續追蹤衡量指標。
2.資料探索:這種分析是以之前可能沒想過方式來探討交易型資料。
它往往是使用預測模型建構技巧,是有效探勘資料的有趣方式之一。
3.社群分析:這是持續衡量社群媒體上的品牌,建立品牌在知名度、參與度
、影響力等衡量指標的持續績效。
4.決策科學:涉及非交易型資料的實驗與分析,所以這可能包括在網路上撈資料的工具
,以便從社群媒體蒐集資料,然後用測試和情感分析。

第四章 危險和陷阱
- 優秀的資料科學家蘊含了以下特質:他們是「見多識廣的懷疑者」,以分析來權衡判斷
,必兼顧保持懷疑的態度、計量分析能力和資訊科技運用技巧。
- 對資料科學家來說,有一種認知功能非常重要:從資料中發現秩序、找出特定模式的能力。
- <原始資料,Lisa Gitelman>:分析必定會牽涉到決策,例如決定要看哪些資料,要產生什麼複合變數,什麼算是離群值等等。這些決策都涉及到人為判斷,往往立意良善,但是在判斷什麼重要以及為什麼時,會受到假設的牽引。重點是資料不會自己說話,是因為我們為資料說話,是我們賦予資料意義。
所以我們無法避免理論,大部分的時候,不論那些驅動了我們分析行動的顯性人類行為理論,
大部分的理論是隱性的,但它們人然影響我們的分析方法。
- 實際觀察永遠無法處理未來事件...唯有透過某種形式的模型/理論做概括歸納
,我們才能用過去的資訊處理未來的情況。
- 有理論及實務知識和經驗為基礎的假設如何產生資料,以衍生適切的見解。
所以資料的產生、處理和分析是在某個理解就夠的指引下進行的
,而不是測試所有可能抓到的變數之間是否有關係。
- 資料是從使用的架構中產生的,而且這不會是終點-這些關係會接著用來構思假設,
演繹測試那些假設是否成立。
- 大數據三大支柱:
1.大數據提供驗證平台,以及要驗證的素材
2.社會學是探索資料的理論架構來源
3.對消費者的瞭解將提供非常重要的情境,讓我們開始從雜訊過濾出訊號
-從瞭解消費者和不同類別的市場中產生訊息。

第五章 預測的力量
- Henry Mintzberg建議的「應變策略」(emergent strategy),該策略建議我們
不要依賴對長期未來的預測,而是應該把焦點放在迅速因應短期的變化。

- 企業可以採取的重要行動包含:
- 設計流程以瞭解資料的出處、定義該資料的代表性、並掌握該資料可以應用在哪些業務問題上。
市場調查人擁有多年的經驗,試圖從大量資料中設計具代表性的樣本,因此通常也擅長這些工作。
- 充分瞭解資料工廠與資料實驗室的不同。
工廠需要生產企業行銷日常所需的基礎消費者行為報告;
實驗室是創造新消費者洞察的地方。這兩種不同的需求太常被混為一談,以至於兩件事都做不好。

- 延伸閱讀<康乃爾最經典的思考邏輯課>、<黑天鵝效應>
、<讓資料自己說話>、<預測行銷>


2016年7月31日 星期日

Big Data:驅動大企業的幕後推手

Big Data:驅動大企業的幕後推手
2015/01/13

- 大數據商業模式成熟度指標:業務監控、業務探查、業務優化、數據賺錢、業務轉型
- 新的分析演算法:
支援向量機 Support Vector Machines
隨機森林 Random Forest
集成方法 Ensemble Methods
冠軍/挑戰者  Champion/Challenger
混淆矩陣 Confusion Matrix
小波轉換 Wavelet Transformation
文字探勘 Text Mining
情感分析 Sentiment Analysis
特性選擇 Feature Selection


2016年7月15日 星期五

大數據時代

大數據時代
2014/05/25

第一章 大數據概述
-IBM,Oracle,EMC,Microsoft,HP,Splunk,Clustrix,Junar,DataSift
-語音資料處理、影片資料處理、語意辨識、圖像資料處理

第二章 大數據時代已經到來
- 資料感知技術、資料傳輸技術、
資料處理技術(海量資料儲存、資料探勘、圖像影片智慧分析)、資料安全技術
- IBM 3A5步:掌控資訊(Align)、獲悉洞悉(Anticipate)、採取行動(Act)、學習和轉型;
二是全面的解決方案,主要包括Hadoop系統、串流計算(Stream Computing)、資料倉儲(Data Warehouse)和資料整合與治理(Information Integration and Governance)。

第四章 大數據顛覆媒體行業
- 用戶資料資訊的生態體系中有資料提供商、資料交易市場、資料分析及用戶定向提供商、
資料管理、廣告投放和效果跟蹤的幾部分參與者。
- 搜尋廣告vs內容廣告

第九章 資料科學
- 用資料的方法來研究科學vs用科學方法來研究資料
- 用資料的方法來研究科學問題,並不意味著就不需要模型了。
只是模型的出發點不一樣,不是從基本原理的角度去找模型。
就拿圖像處理的例子來說,基於基本原理的模型需要描述人的視覺化系統以及它與圖像之間的關係,
而通常的方法則可以是基於更為簡單的數學模型,如函數逼近的模型。
- 分析資料的第一步是賦予資料一定的數學結構,包括:
度量結構、網路結構、代數結構、拓樸結構、函數結構
- 資料科學的教育體系:
1. 數學的基礎知識(微積分、線性代數、概率論...)
2. 計算機科學的基本知識(程式語言、資料庫、資料結構、視覺化技術...)
3. 演算法方面的基本知識(數值代數、函數逼近、蒙特卡羅法..)
4. 資料的模型(迴歸、分類、聚類、參數估計...)
5. 專業課程(圖像處理、時間序列、影片處理、自然語言處理、文本處理、推薦系統...)
6. 其他專業課(生物資訊學、金融資料分析...)
- 未來的科研和教育體制應該由兩條主線組成:
1.基本原理 (物理學、化學、機械工程、生命科學、材料科學、天體物理、地球科學...)
2.以資料為主線(統計學、資料探勘、生物資訊學、天體資訊學...)

第十章 資料技術:當前進展及關鍵問題
- 資料探勘就是利用人工智慧、統計學、模式識別等技術,從大量的、含有雜訊的實際資料中提取其中隱含的、事先不為人知的有效資訊的過程。


2016年6月15日 星期三

大數據的力量

大數據的力量
2014/07/25

第一章 破解大數據興起之謎   
- 風險資本對大數據產業的青睞:
Cloudera,Palantir Technologies,Rocket Fuel,10gen,Nimble Storage
- IT廠商和諮詢公司引導大數據:IBM,McKinsey,Gartner
- Volume(量很大)、Variety(數據的型態更多樣)、Velocity(數據產生和處理的速度極快)、
Value(更大的價值)

第二章 感受大數據迎面衝擊  
2-2 變革教育與人力資源管理觀念
Coursera-美國史丹福大學的兩名電腦科學家創辦(達芙妮‧科勒和安德魯‧恩格),
edX-哈佛大學和麻省理工學院合資創辦,
Udacity-由史丹佛大學的人工智慧專家賽巴斯蒂安‧特龍創辦。
2-8 促進金融業務創新
- FICO是透過支付歷史、欠款金額和使用信用卡時間長度等信用報告進行評分,
在Fair Isaac公司的推廣下,已經成為美國最常用的信用評級方法。
- Lenddo,Neo Finance,Affirm,平安集團(眾安線上財產保險公司)

第三章 爭奪大數據戰略資源   
3-1 戰略儲備 ─ 商業巨頭擁「數」自重
- 百度,阿里巴巴,騰訊,新浪,Facebook,亞馬遜,

第四章 追蹤大數據領軍者動向  
4-1 SAS ─ 高性能數據分析研發的重鎮
4-2 IBM ─ 一切智慧的王者
- Congnos,SPSS,Netezza,InfoSphere BigInsights,Watson
4-3 SAP ─ 企業資源管理的巨擘
- 數據倉庫及數據倉庫解決方案主要是由記憶體計算的明星產品-即時數據平台HANA,以及分析型數據庫SAP Sybase IQ和交易型數據庫Sybase ASE構成,而企業資訊管理主要由SAP Information Steward、SAP NetWave、企業內容管理(ECM)來處理。
- SAP BusinessObjects business intelligence(BI)、SAP BusinessObjects Explorer and SAP Data Services
4-4 天雲趨勢 ─ 大數據開發的新銳力量
4-5 維富友 ─ 淘寶雙十一狂歡的背後英雄

第五章 引爆大數據人才戰爭   
5-1 大數據人才徵集令
- CTO負責的是企業的核心技術,比如製造型企業的生產技術;
CIO的職責在於提供符合企業現實情況和未來發展方向的資訊技術;
CDO則掌握企業內部最核心的數據資源,負責數據分析工作。
- 數據科學是一門交叉學科,涉及數學、統計學、電腦科學、數據視覺化技術以及具體行業的專業知識等。
- 當今業界許多數據科學家畢業於電腦科學、數學、經濟學和任何數據和計算精密型的領域。
- 數據科學家最基本、最通用的技能是寫代碼。用所有相關方面都能聽懂語言進行溝通,另一個是用數據講故事的特殊能力,透過口頭表達和視覺效果。
5-2 呼喚創新的教育培訓變革
- 員工可以透過數據庫技術、分散式計算技術、數據挖掘技術、機器學習技術、視覺化技術等知識和技能的培訓在專業技能上得到強化。
- 分散式計算技術(Hadoop技術等)在MapR,Cloudera,Hortonworks等均提供大量相關培訓課程。
- 北京航空航太大學軟體學院開設了大數據技術與應用高級班,招收已具有一定技術背景的IT從業者,力求為未來的大數據市場率先培養一批熟練掌握HDFS,Hadoop,MapReduce,Hbase等大數據技能,並擅長海量數據的採集、儲存、管理、挖掘與分析等經驗的人才。

5-3 開發數據寶藏的創業精神
- 大數據的開發可以分為兩類:1.數據驅動的應用:比如傳統上來講要依靠數據得以運轉的部門所需要的,如金融機構、零售商、物流企業等,基礎數據是其正常運作的基礎;
2.數據產品,即透過數據的再次開發形成嶄新的用途,如亞馬遜電子商務網站的推薦功能,就是在分析購物者行為數據的基礎上做出的有效推薦。

第六章 揭祕大數據關鍵技術   
6-1 智慧之道 ─ 數據挖掘技術
- 數據挖掘的任務主要是關聯分析、分群分析、分類、預測、時序模式和偏差分析等。
6-2 高效之道 ─ 分散式計算技術
6-3 即時之道 ─ 記憶體計算
6-4 投向更廣闊的技術視域 ─ 雲端運算、物聯網、行動運算


2016年4月3日 星期日

大數據玩行銷

大數據玩行銷
2015/09/10

- 不是用一個龐大的的計畫去解決所有問題,相反地,
我們選擇每次只專注把一個問題給答好,然後選定一個觀點快速切入,形成解決方案。
- 一般常碰到的迷思還有「本位主義」。
歸因企業各個部門基於各自的部門利益角度出發,所看到的問題,往往就像盲人摸象,各自侷限於各部門的數據與問題,造成集體誤判,而且局部解法只會讓問題剪不斷、理還亂,最終造成部門之間資源拉扯與摩擦。全視野的問題角度,不應只是高階管理人的責任,人人都需要有全視野的格局,才能看到真正的問題。
- 被動分析(Passive Analytics),- 預測分析(Predictive Analytics)
- 單一通路(Single Channel),多通路(Many Channel),多元通路(Multi Channel),全通路(Omni Channel)。全通路與多元通路的最大差異就在價值核心,前者以顧客為中心,後者以品牌為中心。
- Credit Karma(CK)創新金融公司,"Your Cedit Scores Should Be Free.And Now They Are."
- Progressive與Allstate推廣Pay As You Drive(PAYD)




2016年1月3日 星期日

大數據:教育篇:教學與學習的未來趨勢

大數據:教育篇:教學與學習的未來趨勢
2014/09/29

- 線上教育Coursera,可汗學院,MOOC(大規模開放式線上課程),SPOC(Small Private Online Course),Udacity,edX
- McGraw-Hill,News Corp,Pearson,Kaplan
- 演算學家必須具備巨量資料這項科技的相關訓練和學養,例如統計學、資料蒐集、資訊工程等。


2015年12月5日 星期六

大數據@工作力:如何運用巨量資料,打造個人與企業競爭優勢

大數據@工作力:如何運用巨量資料,打造個人與企業競爭優勢
Thomas H. Davenport
2014/11/25

第一章 為何企業與個人都需要大數據?
第二章 大數據將如何改變工作、企業與產業
第三章 發展大數據策略
- 你希望應用大數據實現什麼目標?
降低成本、縮短時間、發展新產品、支援內部事業決策
-如果公司內部缺乏資源做這樣的評估,幾家大數據導向的企業,
像是勤業眾信(Deloitte)、埃森哲(Accenture)以及IBM的全球服務事業群,
應該都會很樂意派出他們的顧問提供協助。

第四章 大數據的人才面
F資料科學家的特質:
1.駭客
會寫程式;(Python,Hive,Pig,Java,MapReduce/Hadoop)
能理解大數據技術架構
2.科學家
能提供佐證支援決策;即興;性急
3.可靠的顧問
良好的溝通能力與人際技巧;能設計決策架構;了解決策流程
4.量化分析師
能做統計分析;能做視覺資料分析;機器學習;能分析文字、影片或圖像等非結構資料
(數學,統計,自然語言處理NLP,Natural Language Processing)
- 有了大數據,組織會直接分析整個母體的資料。假如你不是根據樣本的結果推論母體情形,就不必再擔心什麼統計顯著性(觀察到的結果能否代表母體)的問題。
5.商業專家
懂得企業如何運作、如何賺錢;對於要把資料分析與大數據應用在哪些層面很有看法

C垂直型的資料科學家:
對於某些較狹隘的領域擁有很深入的知識。他們可能是熟知各種排序法則之運算複雜性的電腦科學家;可能是對特徵值、奇異值分解及其數值穩定性等無所不知的統計學家;可能是有幾年時間為應用程式介面API的開發及網路爬行技術撰寫Python程式碼(包括繪圖函式庫)的軟體工程師;可能有個出色的資料建模、資料倉儲、圖形資料庫、Hadoop與NoSQL專業知識的資料庫高手;也可能是專精貝式網路(Bayesian Network)、SAS與SVM的模型預測師。
C水平的資料科學家:
是商業資料分析師、統計學家、電腦科學家,以及特定領域專家的混合體。他們結合了願景與技術知識。他們或許不是特徵值、一般線性模型及其他辦過時的統計技術專家,卻懂得一些能應用未結構化資料、串流資料及大數據的更現代、更資料導向的技術...他們能設計出穩健、有效能、簡單、可複製、可擴充的程式碼與演算法則。

F資料科學家何處尋?
1.來自大學的資料科學家
資料科學學位->課程主要是碩士等級的課程;例如,加州大學、柏克萊大學,以及紐約大學。
線上課程->史丹佛與麻省理工學院等學校在線上提供大數據、機器學習、Python等腳本語言設計等課程。
商業資料分析課程(已加入資料科學內容)->北卡羅萊納州立大學(是所有這課程的始祖)、西北大學、紐約大學、史蒂芬斯理工學院、路易斯安納州立大學、田納西大學、巴拉馬大學、辛辛那提大學,以及舊金山大學等學校。
2.大學以外的來源
EMC,IBM,勤業眾信(Deloitte)(和印第安納大學的凱來商學院Kelly School of Business合作),埃森哲(Accenture)

第五章 大數據的技術
圖5-1 大數據技術概述

IBM,Oracle,SAP,Teradata,SAS,SPSS,R,機器學習
圖5-2大數據技術堆疊

儲存、平台基礎架構、資料、應用程式碼、商業觀點、應用程式
圖5-4大數據技術的生態系統

第六章 大數據的成功條件
第七章 我們可以從新創和線上企業學到什麼?
第八章 大企業怎麼做?

國際數據分析研究所、天睿Aster


2015年9月20日 星期日

開放資料大商機

開放資料大商機:當大數據全部免費!創新、創業、投資、行銷關鍵新趨勢
2015/04/20

第1部︱開放資料的力量
- 開放資料與大數據非常不同,但兩者有所重疊。開放資料是有使命的資料,其目的是提供開放、免費、透明的資料,運用這些資料可以改變企業經營、政府運作、管理種種交易的方式。
- 大數據的資料來源大致上是被動的,且通常是不公開地保存。大數據通常來自被動產生資料的源頭,這些資料的產生沒有目的,沒有方向,甚至不知道正在產生資料。
- 開放資料是公開且有目的的,這是刻意釋出的資料,任何人皆可取得、分析、並以他所想要的方式使用。
2 熱門創業——用政府資料賺錢
3 消費者網站——智能信息披露選擇引擎
4 管理資料洪水的新創公司
- 聚焦於遵從法規業務的公司:WebFilings,RR Donnelley
再發行資料的公司:Govini,Spikes Cavell
從事資料分析工作的公司:Informatica,環境系統研究公司(Esri),EMC,IBM,Oracle
提供基礎設備的公司:Socrata
-SAP,SAS,Esri,IBM,Palantir Technologies,Socrata,CRAN





2015年6月4日 星期四

Big Data大數據的獲利模式:圖解.案例.策略.實戰

Big Data大數據的獲利模式:圖解.案例.策略.實戰
2013/08/10
- 與其相信一個人的判斷,不如相信數千萬人的資料

★第一章 什麼是巨量資料
- 案例:Decide.com,FightCaster

★第二章 支撐巨量資料的技術
- Hadoop,NoSQL,串流資料(即時資料)處理:
IBM InfoSphere Streams,Oracle CEP,Sybase Sybase Aleri Streaming Platform,Hitachi uCosminexus Stream Data Platform,機器學習,統計分析

★第三章 以巨量資料為核心競爭力的企業 歐美企業篇
- 案例:eBay,Zynga,Centrica

★第四章 以巨量資料為核心競爭力的企業 日本企業篇
- 案例:KOMATSU,RECRIT,日本麥當勞

★第五章 巨量資料的運用模式★
- 巨量資料的運用案例:
1. 精準推薦商品或服務
2. 行為定位廣告
3. (運用地點資訊的)行銷
4. 揪出盜刷
5. 顧客流失分析
6. 預測設備故障
7. 驗出異常
8. 改善服務
9. 預測路況
10. 預測電力需求
11. 預測感冒流行
12. 預測股市行情
13. 油資成本的優化
- 巨量資料的運用模式

- 個別優化 X 批次處理
- 案例:美國先進保險公司(Progressive Corporation)


- 個別優化 X 即時資訊型模式的概念圖
- 案例:旅遊網站Expedia,美國特殊保險公司安信龍解決方案公司(Assurant Solutions)

- 全體優化 X 批次處理型
- 案例:Hotels.com,Google的reCAPTCHA


- 全體優化 X 即時資訊型
- 案例:FlightCaster,Decide.com


- 巨量資料的運用深度:掌握過去與現狀,發現行為模式,預測,優化

★第六章 巨量資料時代的隱私權問題★

★第七章 開放資料時代的到來與資料市場的興盛★
- 預測飛機房班出發時刻是否延遲的服務的新創企業FlightCaster,運用了航班準點績效和誤點(Airline On-Time Performance and Causes of Flight Delays)等資料。
- 天候企業(Climate Corporation)是一家天氣意外保險公司,以農家為對象,銷售"綜合天候保險",是由農家投保以預防收穫量因氣候惡劣而減產歉收的農作物保險。該公司整合了由美國農業部公開的過去六十年分農作物收穫量資料,藉以預測玉米、大豆、冬麥等的收穫量。
- 資料市集是將人口統計、環境、金融、零售、天氣、運動等各種資料彙集在同一處進行買賣的網站,等於是資料的一站式購足商店。
- 在美國除了Factual,Infochimps等新創企業所營運的資料市集外,大型供應商也投入了這塊市場,像是微軟的Windows Azure Marketplace,以及亞馬遜的Public Data Sets on AWS等。

★第八章 面對巨量資料時代該有的準備★
- 美國支付服務業者朝向資料整合公司發展:VISA,PayPal,美國運通
- 資料科學家指的是,運用統計分析或機器學習、分散式處理等技術,由大量資料中萃取出在商業上有意義的洞見,然後以簡單易懂的方式將它傳達給決策者的人才;或是用資料創造出全新服務的人才。
- 電腦科學家需具備的技能如下:
1. 電腦科學-必須具備Hadoop或Mahout等,對處理巨量資料越來越重要的大規模平行處理技術或機器學習的能力。
2. 數學、統計、資料探勘-數學、統計、操作SPAA或SAS等主要的統計分析軟體,其中"R"是最近相當受注目的開放原始碼統計分析用程式語言及執行環境。
3. 資料的可視化(Visualization)
- 資料科學家需具備的資質:溝通能力、創業家精神、好奇心
- 數學、統計、電腦工程、資料分析。分析學領域-預測分析、描述分析(Descriptive Analytics,包括商業智慧與資料探勘)及規則分析(Prescriptive Analytics,包括優化與模擬)。

- 資料探勘用的統計方法(多重邏輯迴歸分析、非線性迴歸分析、判別分析等)、
計量方法(時間序列分析、機率模型、優化)、決策分析(多目的決策分析、決策樹、影響圖、敏感度分析)、競爭優勢分析、資料庫(資料庫模型、資料庫設計)、預測分析(時間軸分析、主成分分析、非參數迴歸分析、統計流程控制)、資料管理(ETL、資料管控、管理、後設資料)、優化與捷思(整數規劃法、非線性規劃法、局部搜尋法、通用捷思演算法(模擬退火法、基因演算法)、巨量資料分析(非結構化資料概念學習、MapReduce技術、巨量資料分析)、資料探勘(分群法、關聯規則、因素分析、存活分析)、社群網路、文本分析、網路分析、財務分析、服務業分析、能源、健康照護、供應鏈管理、整合行銷溝通之機率模型、風險分析與營運分析用電腦模擬、軟體面的分析學(分析之組織面課題、IT與商務使用者、變革管理、資料課題、結果的展示與傳達方法)、綜合設計