關於課程
課程包含
課程時長
課程總人數
觀看限制
最新消息
課程內容
假設...
今天系學會召開大會,即將審查年度預算及去年財務報表。負責的祕書處學弟帶著一只隨身碟上台,打開了數份 Excel 檔案,滔滔不絕的講起了去年度的預算分配、花費狀況及使用分析。身為資料科學大師的你半瞇著眼睛快睡著。突然,你發現,今年度的預算報告裡面有一些欄位是空白的、有一些欄位數字怪怪的;而有一些通過函數生成的資料,所採計的計算方式,似乎跟去年的算法不太一樣!
「學弟,你能跟我說說,你這些資料是怎麼處理的嗎?」
開課緣由
說到資料科學,大部分的人腦海中出現的都是超級計算機、錯綜複雜的報表、密密麻麻的程式碼等。其實,資料科學是一個相當廣闊的領域,例如資料工程(清理與操作、資料倉儲、資料倉儲)、統計、視覺化以及如何解釋結果等需要專業領域知識來協助的大學科。
那麼,要怎麼入門呢?網路上放 Google 一搜,結果百百種 ... 開始學習 R?可是 Python 好像比較熱門?我需要學習 Apache Spark 嗎?資料倉儲,那我需要學會怎麼架設、管理 SQL 資料庫嗎?深度學習好像很熱門,這也是我需要學習的嗎?
這堂課的主要動機,在於引入一個新形態的工具:Orange3。Orange3 是一個以流程圖做為介面,將資料處理過程展示出來的工具(又稱為:視覺化程式設計)。只要了解元件功能,就能夠輕鬆的把所有資料操作過程儲存下來,利於之後重複使用、或者與人討論資料處理的過程是否有瑕疵或改進空間、而且也不會更動到原始資料。

課程介紹
按照正規資料科學處理流程:獲取、清理與前置處理、建模、應用與視覺化四步,通過實際操作的講解,來讓大家對資料科學具體步驟有初步的了解。
- 清理:要以離群值、空值的清除為主。
- 視覺化:分布圖(distribution)、熱點圖(heatmap)、散佈圖(scatter plot)
- 建模:以迴歸(regression)、分類樹(classification tree)兩個基礎而常用的。
學完這堂課,可能離真正的資料科學還有一段距離;本課的主要目的還是以了解整體流程、引入適當工作流為主,讓大家可以更具體的分享流程。更深入的元件講解、資料庫使用等請待中階課程!
關於講者
塵世中一個迷途醫學生,自稱 medical hacker。
大二時參加了台中自由軟體愛好者聚會,接觸到了廣闊而複雜的大軟體界,開始玩起 Linux 及 Python,揮舞一把名為 Emacs 的小刀闖天涯。大三大四時著迷於醫學工程中的影像處理,學習了 Matlab 及許多訊號、圖像處理的數學理論。大五後接觸到了健保資料庫,遂一頭踏入了這個充斥的無盡骯髒資料的大寶庫,試圖從中挖掘一些有用的訊息來了解藥物、手術與疾病之間的關聯性。
