學習資料科學,不再手忙腳亂
龐大的市場需求、優渥的薪資、具有影響力的工作內容,讓資料科學家被譽為「21 世紀最性感的職業」,也因為資料科學的火熱,從 R、Python 程式設計到機器學習、統計學等課程大量出現。要成為資料科學家,似乎要具備資料科學文氏圖(下圖)中的所有技能,但是,大家有沒有想過,到底要從哪個領域切入,才不會像無頭蒼蠅,這邊學一塊、那邊學一點,永遠看不見盡頭呢?
剛入門學生最渴望獲得的通常是「程式撰寫」與「數學統計」的能力,剛開始的我們也是如此,買了許多資料科學相關的課程 (下圖都是大鼻購買的課程),雖然課程內容相當豐富,但除了有點生硬外,常常學了也不知道可以用來解決什麼問題。最後的結果往往是:大部分的課程都沒堅持下來,或是堅持到底以為收穫滿滿,最後卻說不出到底學到了什麼。
商業分析能力 - 成為傑出資料科學家的關鍵
僅管「程式撰寫」與「統計知識」是一名資料科學家的必備技能,但常被忽略的「商業分析能力」反而是讓你脫穎而出的關鍵。在 Facebook 資料科學家的職缺介紹中,就經常強調產品知識及跨部門合作的能力。在面試中可能被詢問的問題是:「請你設計一個方法,找到每一個用戶最好的朋友?你會需要使用什麼數據?要使用哪種演算法實作?」你必須先了解 Facebook 的商業目標,才能夠定義什麼叫做「最好的朋友」;有了清楚的問題與目標定義,才能夠設計資料分析流程,並蒐集、整理相對應的資料,實作出讓產品經理滿意的模型與解決方案。這就是為什麼我們要強調「商業分析」的能力:辨認出正確的問題,才能真正解決問題,創造價值。
R 語言和 Python 是目前資料科學界最受歡迎的兩種程式語言,儘管工作中常需要交互使用兩種語言,為什麼我們在這門課程會選擇教授 R 語言呢?
R 是專注於「資料分析」的程式語言
「為了資料分析而生」的 R 語言專注於用戶導向的資料操作、統計建模以及視覺化分析;而 Python 作為一般化的程式語言,強調運作效率和程式的可讀性。因此,對於靠近工程端的資料工作者,Python 是比較適合的工具,但對於分析端的資料工作者,專注於「資料分析」的 R 語言絕對是最適合的程式語言。
R 是容易學習的「資料分析」工具
由於 R 是為了分析而設計的程式語言,許多資料分析的精神、流程與方法都已經內建於 R 語言的底層了!相較之下,Python 作為一般化的程式語言,除了得仰賴如 Pandas, SciPy, Numpy 等運算套件,學習時更需要花不少時間了解程式語言與電腦科學的相關知識。以 R 語言作為授課語言,可以讓學生專注於「資料分析」的學習,減少分心學習其他議題的時間。
R 能完成大部份資料分析專案的需求
下圖為 O’Reilly 資料科學薪資調查報告中「資料科學家常見的工作任務」:
其中 R 語言較擅長的任務有:
基本的探索性資料分析 (運用各類統計與視覺化套件)
運用資料分析解決特定的研究問題 (運用各類統計與機器學習套件)
與決策者溝通資料分析結果 (運用 R Markdown)
建立模型的 prototype (運用各類統計與機器學習套件)
建立視覺化圖表 (運用 ggplot2 / plotly / Shiny Apps)
與外部關係人溝通 (運用 R Markdown / Shiny Apps)
建立企業內部的資料儀表板 (運用 Shiny Apps)
相較於 Python 適合用於「量產/機器學習/深度學習」的使用情境,R 語言本身更擅長處理常見的資料分析專案任務。當然,Python 也可以完成這些任務,但生態體系較為複雜,也不像 R 語言一樣容易上手。
精準且熟練的「商業分析能力」,是傑出資料科學家的關鍵能力,少了這項能力,程式和統計的專業能力不但容易被忽略,更可能增加跨部門合作與解決問題的困難度。因此,我們開發了一套從「商業問題」出發的資料科學課程,強調「商業分析方法」與「模型運作原理」,帶領大家在實際個案中,學習重要的商業觀念,選擇適當的模型;課程中以「R 語言」進行資料建模,視覺化資料分析結果,並提出可以被執行的商業策略。這樣的訓練,將讓你以更高的層次看待資料科學,打開「成為資料科學家」的大門。
第一部份:R 語言程式設計特訓班
這門課程在一開始會提供沒有 R 語言經驗的同學三堂特訓班,以最少的時間教會你:
基本的 R 語言程式設計技巧
學習在 tidyverse 架構下進行資料的輸入、整理、轉換與整合
運用 ggplot2 與 plotly 進行互動式資料視覺化。
第二部份:資料科學方法論
根據過去的專案經驗,我們挑選了最常在工作中派上用場的六個方法,進行詳細的解說。同時,我們會搭配相關的商業個案,帶大家走過完整的資料專案流程,讓大家完全了解這些方法如何解決工作中遇到的商業問題。
以生活情境出發,快速理解演算法核心精神
我們認為:與其一下子跳入複雜的模型架構,不如先從生活中的例子出發,用最平易近人的方式了解演算法的核心精神!以下是課程的範例投影片:以「網路心理測驗」出發,幫助你理解決策樹的精髓所在。
不只有程式碼,重視模型原理
許多網路課程著重於工具的使用,我們除了教你工具,更會讓你了解模型背後的觀念與原理,在應用時便不會一知半解。以下是課程的範例投影片:用清楚的圖像方式,呈現 A/B 測試與變異數分析的操作機制。
串連商業問題與資料分析
在個案研究中,除了使用模型外,我們更會清楚解釋商業問題的背景知識及思考模式,讓不是商學院的學生也能快速上手商業分析技能。以下是課程的範例投影片:運用邏輯回歸 (logistic regression) 解決航空業的客戶流失與保留問題。
多元且真實的商業個案
這門課程的商業個案,多來自於兩位講師在工作中遇到的情境,加以改編而成。儘管使用簡化後的資料集合與情境,問題的背景與解決方法和實際情況非常相似。以下是課程的範例投影片:協助手遊產品經理擬定玩家 STP (Segmentation / Targeting / Positioning) 產品行銷策略。
手把手帶你完成資料科學專案
針對所有商業個案,我們都會撰寫 R Markdown 教學文件,除了看到程式碼與執行結果外,更能看到我們拆解問題的邏輯,讓你一次學會商業分析與程式設計。以下為課程的 R Markdown 範例:協助航空公司外部合作經理分析信用卡紅利活動成效,並透過 ggplot2 套件視覺化成果。
課堂作業會分成兩個部分:
選擇題
我們會以選擇題的形式檢視各同學是否能撰寫出正確的程式碼,以及回答對應的資料分析與商業問題。完成作業後,我們也會提供作業詳解供大家參考。
個案討論
日後會不定期針對不同商業案例和同學討論如何解這些問題,並依情況提供同學意見與回饋,幫著大家理解個案內容。
相關問題回答
開課前我們會在每個週末統一回覆同學提出的問題;開課後依照課程進度,暫定每月回覆 5 則同學關於課程或作業的問題。由於目前工作人員只有兩位講師,且講師都有其他正式工作,較難在上課人數未定時就給大家確定的回答頻率與回答形式(Hahow 回覆 / Facebook 社團回覆 / E-mail),還請各位同學見諒!
👉 2024.8.30 更新:目前在每份作業的「作業說明」加上了參考解答;請各位同學在繳交作業後,可以先核對解答的內容,如果有任何問題或是不清楚的地方,都歡迎再提問至問題討論區或是直接寄email和我們討論(詳細見課程公告,僅限購課學生可見)
這門課程是設計給想要成為「分析型資料科學家」的初學者,因此這門課期待你樂於思考,不排斥數學,更需要你動手寫寫 R 程式碼,雖然是一門入門課程,但得花不少心思,更需要你的主動學習(因為講師或其他同學不一定能立即回答你的問題)!
如果你是以下類型的人,這門課程應該很適合你:
商學院背景,想學習資料科學的大學或研究所學生
統計工程背景,想學習商業分析的大學或研究所學生
初入商業分析、資料分析領域的社會新鮮人
想理解資料科學方法與商業應用情境的主管
如果你是以下類型的人,希望你能把這筆錢省下來:
想要成為機器學習專家
想要單純學習程式設計技巧
想要學會 Kaggle 競賽的技巧
想要學會處理 GB 或 TB 等級資料
已經對於資料科學/商業分析非常了解的人
希望大家能透過資料分析社群多多介紹我們的課程,這是對我們最大的鼓勵!為了回饋大家,兩位講師將會在達成特地目標時,解鎖以下活動:
300%:商業分析師/ 資料分析師/ 資料科學家 履歷撰寫技巧
當課程募資人數超過目標人數的 300% 時,我們會加錄主題「履歷撰寫技巧」,幫助大家在求職時展現自己的實力與專案成果。同時,我們也會挑選一些適合的案例,幫大家的履歷更上一層樓!(注意:主要針對英文履歷撰寫,中文履歷兩位講師較無經驗,盡請見諒!)
600%:1 對 1 線上咖啡時間:抽出 10 位同學免費參加
當課程募資人數超過目標人數的 600% 時,我們將抽出 10 位同學,每位同學將能夠線上 諮詢兩位講師,每位講師各有 15 分鐘的 coffee-chat 時間,暢聊資料科學與職涯規劃!
1000%:舉辦實體工作坊,抽出 20 位同學免費參加
當課程募資人數超過目標人數的 1000% 時,我們抽出 20 位同學,舉辦實體工作坊,讓對資料科學有興趣的同學,能近距離與老師討論相關問題,更重要的是,同學們能夠互相交流討論,一同成長!
註 1:1-1 咖啡時間與工作坊的時間、地點、主題、形式、抽籤資格等細節,將於募資結束後另行公告於課程頁面及大鼻觀點粉絲專頁,抽籤結果會公佈於大鼻觀點粉絲專頁。
註 2:1-1 咖啡時間則由老師主動與同學約定雙方都可以的時間,約定後如有需要更改時間,需於三天前與講師協調,每人只能更改一次。於約定時間未能準時上線者,視為放棄咖啡時間權利。
註 3:工作坊的時間將為固定時間,因場地、人力與同學間的溝同協調,較難讓大家共同選擇時間。預計抽出 20 位正取與 10 位備取同學(備取同學也會有遞補順序),只要超過 5 人出席即會舉辦,若未超過 5 人能夠出席則改期辦理。改期後不會重新抽籤,依照原先正取與遞補順序依序通知詢問是否參加活動。
註 4:兩位講師保有募資解鎖最終解釋權,亦有修改活動內容的權利。黃大維 (大鼻)
國立臺灣大學統計碩士(初等統計學助教,評分:4.61 / 5.00)
國立清華大學計量財務金融學士,斐陶斐榮譽會員
曾任職英睿科技 (資料科學家)、優拓資訊 (實習資料科學家/產業分析師)、CHOCOLABS (實習資料科學家)、中央研究院數學所(暑期研習生)、北京大學經濟學院訪問學生,參與專案包含:推薦系統、使用者路徑分析、觀看次數預測系統、增強學習、自然語言視覺化、外匯交易、投資組合最佳化、選擇權套利等專案。
沈辰禧
國立臺灣大學商研所碩士
國立政治大學企管系學士
在校內有多次 R 語言公開教學經驗
曾在 Synergies Intelligent Systems 和鼎泰豐擔任實習資料分析師,有多種不同產業的資料專案經驗,如海運業訂單需求預測、餐飲營收分析、供應鏈視覺化、智能投顧演算法開發、半導體製程分析、臨床脈波辨識等專案。
