資料科學
一句話定義
用統計、機器學習、領域知識與工程能力,以數據解決可量化問題,把資料轉換成可以驅動決策、產品或產業價值的學科——三圈交集(領域知識 × 數學 × 程式)+ 三角色分工(分析師 / 科學家 / 工程師)+ 元命題「沒有單一最佳路徑,只有長成自己形狀的資料科學家」。
核心要點
實務定義:以數據解決量化問題
2026-05-06-程式猿吃香蕉-資料科學我想說的是上 把資料科學的核心定義壓到一句話:以數據來解決量化問題。這個定義刻意避開 AI / TensorFlow / 雲端平台等技術名詞,因為技術會變,但老闆和產品團隊真正想問的問題長期類似:能不能用資料更好地理解、預測或改善某個商業 / 產品現象?
2026-05-08-資料團隊主管視角資料職涯路徑 再補上主管視角:資料科學不只是「個人會不會分析」,也是資料團隊能不能把資料變成組織影響力;若報表與模型沒有被信任、採納並改變決策,就還停在交付物層,而不是價值層。
→ 這使資料科學更像一套問題思辨流程,而不是「把資料丟進模型」:
- 先判斷問題是否能被量化。
- 把軟性願望或經驗轉成可觀察指標。
- 再選擇演算法、資料架構、統計檢定與成效評估方式。
2026-05-09-IBM-Introduction-to-Data-Analytics筆記 再把這套思辨流程展成更基礎的 資料分析 工作流:理解問題與預期結果、設定明確指標、蒐集資料、清理資料、提取與分析、解釋結果、介紹發現。這讓資料科學不只是「模型 / AI / 職涯」主題,而是有一條從資料來源到決策採納的操作流水線。
三圈交集(Drew Conway-style 三圈圖)
資料科學需要三軸能力同時具備:
- 領域知識(Domain know-how)—— 你工作場域的專業知識;最不可被取代的軸——AI 工具會取代寫程式 / 做圖表 / 下 SQL 等動作,但領域專家對問題的直覺判斷仍歸人。對位 vault 的職涯哲學:切角 / 可遷移能力 / STAR原則 在資料科學職涯的具體應用。
- 數學 / 統計——統計推論、機器學習、深度學習、線性代數等理論基礎;門檻最高、累積最慢的軸。
- 程式 / 工程(城市能力)——Python / SQL / Spark / cloud / pipeline 等實作能力;ChatGPT 出世後加速最快但仍不可省略的軸。
三角色分工(2023-05 時點重新定位)
| 角色 | 重心 | AI 衝擊後的調整 | 高風險信號 |
|---|---|---|---|
| 資料分析師 | 資料分析 / 說故事 / 視覺化 / 商業洞察 | 從「做圖表」轉向「擬定策略」——Microsoft M365 Copilot / ChatGPT 等可以對話產生圖表,純工具型分析師被加速 | 只會 BI 工具(Power BI / Tableau / Excel)但說不出好故事 |
| 資料科學家 | 理論研究 / 看 paper / 解析論文 → 落地工程 | 高層職位 / 高薪 / 門檻高;從手刻演算法到操控預訓模型 + 解析 paper | 只會調超參數但無法把研究轉成商業應用 |
| 資料工程師 | data pipeline / 儲存 / 安全 / 大數據基礎建設 | 傳統後端 + 大數據 + 預訓模型操控者(Pandas-GPT / pre-trained model API);工程師等級轉職最快的位置 | 只會徒手自幹但不用開源工具 / GPT 加速 |
實務專案三角(ML / DE / DA)
Sobi 的資料科學專案會議範例,把同一個 field 拆成三種提問角度:
| 角度 | 專案早期要問什麼 | 貢獻 |
|---|---|---|
| 機器學習 | 適合用協同過濾、知識圖譜或其他模型嗎?要做到個人化還是分群即可? | 判斷技術 / 模型與問題的匹配度 |
| 資料工程 | 要即時推薦還是批次?資料儲存在哪裡?歷史資料要多長?模型多久更新? | 判斷資料管線、儲存、運算與上線條件 |
| 資料分析 | 成效指標是什麼?點擊率、轉換率、涵蓋率或長期用戶成長? | 定義問題與評估商業 impact |
→ 資料科學和傳統軟體開發的差異在於:專案初期通常不能直接從完整 spec 起跑。若只把「做個 AI 推薦」當需求,會把問題定義、資料條件、工程約束與商業成效全部壓扁成一個模糊願望。
資料專案落地:先 MVP,再擴大影響力
2026-05-08-資料團隊主管視角資料職涯路徑 補上資料專案從主管視角的落地約束:模型或資料功能常需要 research、evaluation、調參與 production,投入週期長且不一定立刻對使用者有感。
健康節奏是把資料專案也當成 MVP:
- 先對齊要解決什麼問題、要解到什麼程度。
- 先縮小範圍,用最小版本驗證 feature / 模型是否有效。
- 取得真實使用者或內部使用回饋後再迭代。
- 用 metrics 衡量可量化成效,用組織行為觀察衡量 data culture 類目標。
→ 資料專案最怕的不是做不出來,而是沒有先對齊「要解決什麼」與「願意付出多少成本」。這與 Goal-Signal-Metric / 設計即假說 同源:先定義 goal 與假說,再決定怎麼驗證。
量化問題三步驟
當產品討論停留在「常常聽音樂」「很愛某歌手」「聽很廣」這類軟性使用者經驗時,資料科學需要把它們轉成可度量座標:
- 找出可量化指標:例如頻率、深度、廣度。
- 定錨問題範圍,建立座標:例如用「音樂廣度」和「聆聽深度」觀察用戶落點。
- 將實際問題套入量化指標:例如推薦系統到底要提升黏著度、擴大探索廣度,還是另有新客 / 營收目標?
這與 Goal-Signal-Metric 的方向一致:先從目標與問題出發,再決定該觀察什麼訊號、落成什麼指標。
問題背後的焦慮:先重構題目,再分析
2026-05-06-程式猿吃香蕉-資料科學我想說的是中 補上資料科學實務的第二層難點:提問者提出的問題常常不是乾淨的量化題,而是混著焦慮與期待的願望。例如老闆問「用戶為何不來」,表面上是流失問題,但直接問題其實沒有資料,因為沒來的用戶不會留下足跡。
這時資料人的工作不是直接宣告「沒有資料」,也不是急著套模型,而是把問題改寫成可被內部資料回答的比較題:
- 比較設計初期 目標族群 與實際用戶輪廓:原本想服務誰?實際來的是誰?兩者差距是否代表行銷策略、產品設計或營運價值需要重估?
- 比較 顧客旅程地圖 / 行銷漏斗 中各階段轉換率:使用者在哪條路線走得最多?在哪一段放棄?哪個節點最值得優化?
→ 這裡的核心心法是「比較」:當問題本身沒有直接資料,先找出合理基準,把「為何不來」轉成「跟原本期待 / 旅程其他節點相比,哪裡不一樣」。
跟錢看 vs 跟產業看(Coco 觀點)
- 朝錢→科技產業(半導體 / 軟體 / 自駕車 / 電動車)——薪資相對較高
- 朝產業升級→傳產——薪資不一定高但讓整個產業升級、對人類社會有貢獻
兩條路都有空間;vault 對位:相對收入 / 生活方式設計 / DEAL框架 的「先決定生活,再反推工作」哲學。
從業職涯觀
「初階不必選定終身角色」原則
韋恩:
對於初階的資料工作者而言,工作就是想辦法找到資料、想辦法分析、想辦法產生結果——不要在初階就設定自己一定要成為哪一種角色;儘可能整個 workflow 走過一次,在市場當中看什麼缺多 / 容易找得到,就往那個地方走。
對位 vault 既有 切角 / STAR原則 / 履歷寫作 / 面試 等職涯工具,加上「初階廣度優先 / 中階再專精」的時序軸。
「角色隨團隊成熟度流動」原則
2026-05-08-資料團隊主管視角資料職涯路徑 補上資料團隊從 0 到 1、從 1 到 2 時的角色變化:
- 先架 pipeline:公司初期最需要 DE,把資料抽取、整理、建好基礎資料層。
- 再建立可重複使用的資料層:資料清理、商業邏輯與 transform 變重要,DA 需要更強的 domain knowledge,甚至跨向工程。
- 最後推動洞察採納:資料團隊不只被動接需求,而要主動提出洞察,讓產品、行銷、業務與管理層改變決策。
小團隊尤其不會有完全清楚的 DA / DE / DS 邊界;真正值錢的是能在公司當下需要時補上缺口,而不是先把自己鎖死在職稱。
入門能力:硬實力打底,軟實力證據化
本期主管視角也把入門能力拉回兩層:
- 硬實力:SQL + Python 要到真的能解實題、考慮效能、把結果講清楚的程度。
- 軟實力:端到端論述能力,能清楚呈現問題、方法、產出、取捨與影響。
履歷與作品呈現不能只寫「熱愛學習 / 善於溝通」;要用作品、紀錄、數字與輸出讓對方直接看見。這與 履歷寫作 / 作品集 / Actionability 形成職涯版同源命題:學習要變成可被判斷的 output。
轉職與入職落差:工具入場,脈絡補課
2026-05-09-商業資料分析師職涯挑戰成長心法 補上非本科轉資料分析師的「入職後」現實:轉職前可以靠 SQL / Python / 作品與履歷切角拿到門票,但真正開始工作後,最大落差通常不是工具,而是產品、產業、指標與公司脈絡。
Elvis 的經驗可拆成三個補課方向:
- 市場職缺反推技能:先研究職缺需要 SQL / Python / 商業分析,而不是漫無目的學所有工具。
- 用既有經驗切角:把行銷工作中的網站數據分析、A/B testing、專案分析與廣告成效轉成資料分析履歷證據;無關亮點即使很強,也要暫時刪掉。
- 入職後補脈絡:被 PM 挑戰數據解讀時,不是證明自己聰明,而是補 APP 指標、產業報告、A/B testing 原則與公司歷史經驗。
→ 這補強「長成自己形狀」的另一面:舊背景可以是轉職切角,但進入新場域後仍要快速補足 領域知識,否則工具能力無法直接變成可信洞察。
商業分析:資料分析往決策層長
本來源也把資料分析師往 商業分析 成長的路徑講清楚:職稱不應限制技能樹,資料分析與商業分析不是互斥角色,而是同一個資料工作者在不同層級的重心。
- 初階重心:SQL / Python / 視覺化 / 統計 / 實驗設計。
- 中階重心:MECE、以終為始、問題樹、指標是否支撐假設、分析結果是否能導向方案。
- 資深重心:產業知識、跨部門溝通、商業模式、財務結構與可推動業務判斷。
這讓「資料分析師走策略」不只是說故事,而是從問題定義開始就反推:我要解的是哪一個商業問題?這個指標能不能支撐假設?分析完之後誰要改變什麼行動?
「長成你自己形狀的資料科學家」元命題
韋恩:
不要期待「資料科學家應該長什麼樣子」的 SOP——資料科學需要很多種能力,很難全部學完——所以重點在於「長成你自己特色 / 強項的資料科學家」;不要跟臺大資工本科系拼專業——你的背景特色是競爭力來源。
對位:
「站在巨人肩膀上」哲學
- Jerry 老師:「Money is all you need / Transformer is all you need——training language model 需要很多錢,這是大公司的事情;從業者站在巨人肩膀上保護就好」
- 韋恩補充:「只會徒手自幹但沒辦法使用開源工具的工程師或分析師也是高風險工作者」——別人用 ChatGPT 一秒解掉時,堅持自幹反而尷尬
vault 中第一次明確標記「徒手自幹反而是反模式」的領域——對位 AI輔助開發 「加速 vs 取代」核心命題的職涯版本。
高風險技能(會被 AI 加速的)
來源整合:本期 + 2026-04-30-Indie-Creative-035-AI行銷企劃
| 技能 | 風險度 | 對位 |
|---|---|---|
| 純 BI 工具操作(不說故事) | 高 | Microsoft M365 Copilot 對話產圖 |
| 寫 SQL 翻譯(不懂 schema) | 中 | ChatGPT 自然語言 → SQL |
| 資料前處理(字串 / filter / 正規) | 中 | ChatGPT 直接生成處理 code |
| 寫 boilerplate(型別 / 樣板) | 中 | Copilot / ChatGPT 加速 |
| 寫簡報(圖表 / 排版) | 中 | Microsoft Designer / Google AI |
| 徒手實作 ML 演算法 | 中 | 預訓模型已成熟 / 套件齊全 |
不會被取代:領域知識 / 說故事能力 / 軟實力 / 個人成長累積 / 對問題的直覺判斷。
學習路徑(碩士 2 年版)
Jerry老師 的整合建議:
- 寫 paper(畢業條件)
- 打 Kaggle 比賽——直接接觸產業知識(題目都是知名公司提的)
- 基礎能力(學校課 + 學校沒開但你有興趣的課,比如 NLP / CV)
- 城市能力(一定要有;首科 / 手刻過某些算法可以加深理解)
- 選擇方向(先試走過 workflow 才選):
- 走分析師——著重策略、工具
- 走科學家——加深理論、打比賽
- 走工程師——預訓模型應用、城市能力
對「為什麼要學首科 / 手刻」的具體案例(Jerry 老師):iris 資料集做到 95% 準確率時 ChatGPT 寫不出來——有理論基礎才知道該怎麼調——「人家用 ChatGPT 寫出來的東西、跟你用 ChatGPT 寫出來的東西就有差異」。
與其他概念的關係
- MOC-資料科學 — 本頁是資料科學 cluster 的 umbrella;資料分析 補上 analysis workflow,MOC 補上 domain map。
- 三圈交集軸:
- 問題定義 / 指標軸:
- 對位 資料分析——資料科學中的分析工作流:問題、指標、資料取得、清理、分析、解釋與呈現。
- 對位 商業分析——資料分析往決策層長時,需要以終為始、MECE 與問題樹,把資料結果導向商業行動。
- 對位 資料團隊影響力——資料科學不只是個人技能組,而是資料能否被組織採納、信任並改變決策的問題
- 對位 Goal-Signal-Metric——兩者都要求先定義目標與訊號,再把問題落成可量測指標;差異是 G-S-M 偏產品指標框架,本頁偏資料科學專案的解題前置
- 對位 數據流——數據流不是「有資料」就好,而是能把產品 / 使用者狀態轉成可判讀的量化座標
- 對位 目標族群 / 顧客旅程地圖 / 行銷漏斗——三者可成為資料科學的比較基準:原定 TA vs 實際用戶、預期旅程 vs 實際路線、漏斗階段轉換率 vs 流失點
- 角色分工軸:
- AI 應用軸:
- 產業擴散軸:
- 領域知識 跨產業擴散:
- 食品 / 麵包(影像辨識辨蛋糕品質、結構化資料推薦) / 法規(NLP 整合判例)/ 汽車(電池資料 1000+ features)/ 生物品質(影像辨識長黴菌)等具體案例
相關來源
- 2026-05-09-IBM-Introduction-to-Data-Analytics筆記 — IBM 資料分析入門課筆記;補入 資料分析 的定義、四種分析類型、流程、資料生態系統、資料整理 / 清洗、統計 / 挖掘與視覺化溝通,並觸發 MOC-資料科學。
- 2026-05-01-AI時代資料科學技能樹 — 數據職涯加值計畫 14 / Jerry老師 + Coco + 韋恩座談;vault 中第一份資料科學職涯主題座談來源;確立三角色分工 + 「初階不必選定角色」+「長成你自己形狀」+「站在巨人肩膀上」+ 高風險技能標記
- 2026-05-06-程式猿吃香蕉-資料科學我想說的是上 — Sobi / 程式猿吃香蕉:補入資料科學的實務定義「以數據解決量化問題」;用推薦系統會議展示 ML / DE / DA 三方提問與量化問題三步驟
- 2026-05-06-程式猿吃香蕉-資料科學我想說的是中 — Sobi / 程式猿吃香蕉:補入資料科學實務中的「解讀問題背後焦慮」與比較大法;用「用戶為何不來」展示 TA / journey / funnel 如何把無資料問題重構為可分析問題
- 2026-05-08-資料團隊主管視角資料職涯路徑 — Karen / 楊錫資料團隊主管視角:補入 資料團隊影響力、資料專案 MVP、資料團隊成熟度、DA / DE / DS 角色流動與 SQL / Python + output evidence 的入門建議
- 2026-05-09-商業資料分析師職涯挑戰成長心法 — Elvis / 資料科學家的工作日常:補入非本科轉職、入職後脈絡補課、商業分析、MECE / 以終為始與 senior 資料工作者能力軸
備註
- 此頁是 vault 中第一個資料科學 umbrella 概念頁——既有大量 LLM / AI 概念但缺乏「資料科學職涯整體」視角;2026-05-09-IBM-Introduction-to-Data-Analytics筆記 之後,domain-level 地圖移到 MOC-資料科學,本頁保留資料科學定義、角色、職涯與 AI 衝擊。
- 未來累積方向:
- 不同模型世代下三角色的細部變化:本頁建立於 GPT-3.5 → GPT-4 過渡期,未來如累積 GPT-4o / Claude / Gemini 等不同世代下的職涯觀察,可在本頁累積「模型世代 × 角色衝擊」軸
- MLOps / Data Engineering 細部分支:本頁目前以三角色為主軸,未來如累積 MLOps / Data Eng / DataOps 等細部分支來源,可拆出子頁
- 資料團隊運作 / Analytics Engineering 軸:本期已補入 dbt / transform / 可重用資料層等線索,但仍以主管座談整理為主;待累積 DataOps、semantic layer、metrics layer、data governance 等主題來源後再評估拆頁
- 產業特化軸:金融 / 醫療 / 製造 / 電商 / 廣告 / 法律等不同產業的資料科學從業觀察可在本頁逐步累積
- 學歷路徑軸:本頁目前以「碩士 2 年」為主要路徑討論,未來如累積轉職 / 自學 / 線上課程 / 訓練營等不同路徑的來源可拆出資料科學學習路徑
- 這個概念頁與 MOC-LLM-應用設計 的關係:應用層三角色(AI輔助開發 / AI輔助創意 / 本頁)覆蓋「任務 / 創意 / 職涯」三個面向;本頁在 MOC-LLM-應用設計 應用層的位置是「從業者整體職涯觀察」軸——既有兩頁是任務 / 創意層的 AI 工具實測,本頁是 AI 衝擊下資料科學從業者的角色重整觀察。