AI 時代下,資料科學工作者技能樹該怎麼點?— 數據職涯加值計畫 14

後設資料

  • URL:https://youtu.be/ynX-qV-u4_4
  • 形式:YouTube 線上直播座談(YouTube live → 錄影留存);無分享投影片,全程 QA 對談
  • 主持人:韋恩資料科學家的工作日常 FB / IG 經營者;資料科學與網頁開發的創新工程師;數據職涯加值計畫主辦)
  • 講者:
    • Jerry老師——亞太智能機器 創辦人 / Google 機器學習開發專家(Google ML GDE)/ NVIDIA partner(GPT 模型訓練服務);2012 年起進入資料分析業約 10 年(保險 / 汽車製造 / 公部門 / 結構化 → 非結構化資料)
    • Coco——Microsoft AI MVP(微軟 AI 領域最有價值專家)/「大魔術熊貓工程師」FB 粉專;學生時代生統研究→較長期從事 web→約 5-6 年前回到 CV / NLP;2022 年底寫一系列 NLP 文章預判「NLP 大爆發」恰逢 ChatGPT 出世
  • 系列:數據職涯加值計畫 第 14 場——韋恩於約一年前開始,原為個人分享,後轉為邀請業界前輩座談的常設活動;自第 11 場起圍繞 AI 主題(ChatGPT / AI 應用 / 高風險職種等)
  • 發表日:2023-05-25 推測——直播間請觀眾打卡「+0525」+ 引用 ChatGPT / Claude-Code 之前世代的 OpenAI 模型敘事節點 + Microsoft M365 Copilot 為「最近公佈」(2023-03-16 公告,5 月 GA),交叉鎖定 2023 年 5 月時點
  • 入庫日:2026-05-01(vault 建立第 4 天)
  • vault 中的定位:
    • vault 第一份「資料科學職涯」主題座談來源——既有來源都偏 LLM 應用 / 行銷創意,本期是第一份從從業者視角討論「資料工作者怎麼跟 AI 共處 / 該點哪些技能 / 哪些角色高風險」的長篇對談
    • vault 第一份 YouTube 直播座談型來源——對位既有 YouTube 來源 Unblock(短篇教學影片透過 Notion 個人筆記中介整理)形式不同:本期直接以 ASR 逐字稿為主,無中介者
    • vault 第一個「Taiwan AI 社群人物 cluster」Jerry老師 / Coco / 資料科學家的工作日常(韋恩) 三個人物 entity 同時出現——前者偏教育產業(社群課程主理者)/ 中者偏微軟生態 / 後者偏內容主理人;構成 vault 中第一個明確的台灣本土 AI 教育生態人物圈
    • 與 035 期(傑哥推測 / 2026-04-30-Indie-Creative-035-AI行銷企劃)形成「應用 vs 從業」雙軸對位:035 是行銷端的 AI 應用實測;本期是資料科學從業者對 AI 衝擊的反思——兩者共同覆蓋「AI 進入工作流的第一波應用實證」這個 2022-12 ~ 2023-05 半年間的時點觀察
  • 來源原始性:YouTube live 自動字幕逐字稿——保留 ASR 錯字(「質押」=「技能」/「圖榜」=「刷榜」/「客戶」=「Coco」等),本頁原文段重新潤飾為可讀版本但不增刪內容

一句話濃縮

三位 AI / 資料科學從業者(韋恩 + Jerry老師 + Coco)以 ChatGPT 出世半年後的時點切入「AI 時代下資料科學技能樹該怎麼點」三軸——(A)技能養成:AI 不取代寫程式但加速寫程式(AI輔助開發 的「加速 vs 取代」核心命題),對資料工作者**領域知識最不可被取代** + 細心 / SQL / 統計學是基本功 + 知識焦慮的解法是「靠社群過濾」而非追逐每一篇論文;(B)數據職涯資料科學 三大角色重新分工——資料分析師走策略 / 說故事(純工具型分析師高風險,因 Microsoft Copilot 等可直接用對話產生 BI 圖表)+ 資料科學家走理論 / 研究(K paper / domain × ML)+ 資料工程師走應用 / 預訓模型(從 Pandas + Scikit 升級為 Pandas-GPT + pre-trained model 操控者);初階工作者不要死守單一角色,整個 workflow 走過一次再隨市場脈動轉;風險最高的技能是「只會用工具但說不出故事」+「只會徒手自幹但不用開源 / GPT 工具」;(C)產業觀察ChatGPT 教育了 NLP 市場(如同 AlphaGo 教育影像辨識),現在是 NLP 元年;資料分析需求只會更多(各產業 領域知識 + AI 工具門檻雙降);模型刷榜 圖榜模型多半不落地,真正落地是教育市場 + 持續訓練的模型ChatGPT 是真實力代表);非泡沫化(隔壁阿桑沒在叫人衝資料科學);對文組 / 領域專家轉職資料科學的建議是「找你的亮點」而非「長成標準化資料科學家」——背景特色 = 競爭力來源;元命題「Money / Transformer is all you need——讓大公司搞 training,從業者站在巨人肩膀上做應用**」+「AI 工具越普及 → 各產業需求只會擴大 → 進入產業的時機點是現在」。

提取要點

1. 主軸命題:AI 時代下資料科學工作者該怎麼點技能樹?

  1. 三軸切分:技能養成(前期)+ 數據職涯(中期)+ 產業觀察(長期)——韋恩的提綱結構。三軸共享一個元命題:「AI 不是來取代資料人,而是重構資料人的工作」(兩位講者的共同立場)
  2. 時點定位:2023-05 時點——ChatGPT 出世約半年(2022-11-30),AlphaGo 教育影像辨識 → ChatGPT 教育 NLP;vault 中對位 035 期(2022-12 推測)行銷端 AI 應用實測 + 本期 2023-05 資料端 AI 從業反思 = 「AI 進入工作流第一波應用實證」的兩個落點
  3. 講者背景的雙重不對稱:兩位講者都有「深度模型理論 + 多年城市能力 + 該領域 10+ 年資歷」的同類標籤,但分屬不同社群生態(Google ML GDE / Microsoft AI MVP),剛好構成 vault 中第一個「Taiwan AI 雙生態人物對位」——這個對位本身是「資料科學技能樹沒有單一最佳路徑」的活案例

2. 軸 A:技能養成

2.1 AI 不取代寫程式 / 加速寫程式

  1. 核心立場:永遠會有人跟電腦溝通的角色(從打孔卡 → 寫程式 → 自然語言);可不可以未來用 AI 寫程式?,但不代表現在不用學城市;現在的資料人絕對還是要會寫程式(Coco)
  2. Microsoft 觀點:「儘可能讓 ChatGPT 幫你寫程式,然後你再改成你要的」——但你必須看得懂、會改(Coco 引述微軟近期觀點)
  3. Jerry 老師加註:寫程式是工具,但要進入 AI 領域還要再加一個層次——理論基礎;網路上很多人寫到一半 ChatGPT 卡住,需要過去的理論 + 寫程式技巧融合才能走到完整 project;ChatGPT「加快寫程式的速度,而不是取代寫程式這個動作」——基本理論還是必須有
  4. vault 對位:本段 = AI輔助開發加速而非取代」核心命題的從業者第一手版本——既有 028 系列 / Claude Code 教程 / 035 期都從個別任務角度展開「驗證責任仍在人」原則;本期從多年從業者面對新人提問的視角再次確認;補入「徒手自幹反而是高風險工作」這個風險面(韋恩在後段對位)

2.2 該培養的特質與能力

  1. Jerry 老師(食品產業案例):跨產業學員(如做麵包的人)開始學資料分析→這些不同產業的人帶 領域知識 進來,發揮的價值更大;做麵包→影像辨識辨蛋糕品質 / 結構化資料做推薦 / 賣得好不好分析;領域知識 是不會被取代的,但工具會被加速
  2. Coco 的能力清單
    • 你的領域知識絕對必要——做麵包甚至殺豬都好)
    • 細心程度(最近發覺很重要——準確度做不高常常只是某幾個參數沒調好)
    • 城市能力(必備)
    • 統計學(取樣 95% 信賴區間等基本功)
    • SQL(萬用,Pandas 也有 SQL-like 寫法;學好 SQL 變種都能快速上手)
  3. vault 對位的整合:兩位講者共同強調「領域知識 是不被取代的最大護城河」——這對位 vault 既有 可遷移能力 / 切角 / STAR原則 等職涯工具的「用既有經驗橋接到目標職務」哲學;構成 vault 第一個明確以「資料科學職涯」場景應用既有職涯工具的對位

2.3 知識焦慮的解法

  1. 問題定位ChatGPT 出來後每週每月新模型 / 新 paper / 新工具——資料人面對知識焦慮的具體症狀(不想開社群媒體 / 上週 Meta 又出新 model / 上上週 Google / 上上上週 Facebook)
  2. Coco 的解法(圖榜 / 模型刷榜 警示):很多新模型只是**「圖榜」/「刷榜」——在特定 dataset 上效能比之前好,但泛用性不夠 / 落地少**(Coco 舉 YOLO 為例:「好像還蠻圖榜的,可是實際落地應用比較少看到」);真正落地的是 ChatGPT——開放給全世界玩的模型才是真實力
  3. Jerry 老師的解法(社群過濾):透過社群過濾——「社群過濾後的資訊」可以做比較完整消化;Google TensorFlow 一週就有 5-6 篇 reference 個案介紹,光 Google 就讀不完;社群過濾出這群人喜歡用什麼技術,幫使用者掌握「時代的脈動
  4. Jerry 老師加註:這一行真的很辛苦——你要追隨社群大大的話,走應用領域就好;但若要自己成為大大,就要一直追東西維持學習熱情
  5. 韋恩的整合:「新東西不是第一天更新」——過去十年每年都有新技術,AI 距離資料人比較近所以焦慮明顯;解法是看到好玩就學 / 沒跟上也沒關係(真正重要的東西會留下)
  6. vault 對位:本段補入 模型刷榜(新建概念)的具體案例脈絡;對位 12個問題法則 / Actionability(PKM 篩選原則)的「輸入端品質評估」(判讀力 軸)——本期是 vault 中第一個資料科學 / AI 領域版本的「篩什麼」問題

3. 軸 B:數據職涯

3.1 三大角色的重新分工

  1. 資料分析師(高風險)
    • Coco 觀點:分析師要說故事 / 視覺化 / 善用 Excel / Power BI;但 Microsoft M365 Copilot 已可用對話請 Excel 產生圖表 / 故事——所以有點危險
    • Jerry 老師觀點:分析師會比較偏重策略——國外很多分析師重點放在「透過數字 → 說故事 → 擬定公司成長策略」;只純粹做圖表分析會被取代
    • 韋恩的整合:高風險的是「只會使用 BI 工具但沒辦法說出好故事的分析師」——側重點轉移到說故事 / 溝通 / 商業 / 策略
  2. 資料科學家(高層職位)
    • 一直以來高層 / 高薪
    • 理論基礎要好(門檻高)+ 工具能力強
    • 做研究類領域 / K paper / 解析論文 → 落地工程
    • 適合工程師等級轉職最快的位置(會 SQL + application + pre-trained model 操控)
    • 走研究 → 應用:Google 資料科學家一年發 30-40 篇 paper 不誇張;台灣資料科學家偏「看 paper → 拿應用 → 加強企業 AI 能力」
  3. 資料工程師(傳統後端 + 大數據)
    • 偏 data 操作(儲存 / pipeline / 資料庫管理)
    • 傳統後端工程師 / 管資料庫工程師概念 + 大數據技術 / 資料可用性可靠性安全性
    • 適合喜歡操作資料、熟悉資料庫的人
  4. 韋恩的元觀點(初階不要死守角色

    對於初階的資料工作者而言,工作就是想辦法找到資料 / 想辦法分析 / 想辦法產生結果——不要在初階就設定自己一定要成為哪一種角色;儘可能整個 workflow 走過一次,在市場當中看什麼缺多 / 容易找得到,就往那個地方走

  5. vault 對位:本段 = vault 中第一個資料科學三角色的明確分工論述 → 觸發新建 資料科學 umbrella 概念頁;對位 切角 / STAR原則 / 履歷寫作 / 面試 的求職場景,補入「初階不必選定終身角色」這個職涯工具
  6. 延伸:跟錢看 vs 跟產業看(Coco)
    • 朝錢→科技產業(半導體 / 軟體 / 自駕車 / 電動車——薪資相對較多)
    • 朝產業升級→傳產(薪資不一定高但讓整個產業升級—對人類社會有貢獻

3.2 高風險技能(會被 AI 加速 / 取代的)

  1. Jerry 老師觀點(取代 vs 加速的區別):「取代」這個詞要謹慎——更精確是「加速」;以 SQL 為例,以前要寫 SQL,現在 ChatGPT 可以下 SQL;這不代表 SQL 不要學,是「加快使用效率」
  2. 不會被取代的軟實力領域知識 / 說故事能力 / 軟實力 / 個人成長累積
  3. 被加速的工具面:寫簡報(Microsoft Designer / Google 未來 / Pandas-GPT)、SQL 撰寫、程式 boilerplate、資料前處理(字串操作 / filter / 正規表示式)
  4. Coco 的整合:「簡單而重複的事情比較有機會被取代
  5. 韋恩的整合:以前養一個分析師才能分析——現在 AI 工具可以直接做分析,但分析師更需要說故事 / 溝通 / 商業 / 策略能力重複性高的東西容易被 AI 化
  6. vault 對位:本段對位 AI輔助開發加速 vs 取代」核心命題在資料科學職涯的具體展開——既有頁是任務層觀察,本期是職涯層觀察

3.3 需求變化與門檻

  1. 元命題(Coco / 唐詩比喻):「舊時王謝堂前燕,飛入尋常百姓家」——以前先進高端 AI 技術,現在越來越普及;各產業(不只科技 / 傳產)都可以用 AI——需求會更多,不會更少
  2. Jerry 老師的整合:「工具越簡單 → 進來的人越多 → 量變產生質變」;資料分析需求會越來越多——以麵包產業為例(拍照 / 錄影 / 影像辨識 / 細部分析);應用門檻(用機器學習)不會高;剛K完書出社會就拿應用、不用徒手寫演算法——進入解決問題層次
  3. 泡沫化判斷(Coco):「隔壁阿桑沒在叫人衝資料科學」——還沒到泡沫化;現在還是不錯的時機點
  4. vault 對位:本段對位 ChatGPT 既有「教育市場」現象——AlphaGo 教育影像辨識市場 → ChatGPT 教育 NLP 市場(現在是台灣 NLP 元年);補入「普及 = 需求擴張」的市場觀察軸

4. 軸 C:產業觀察與從業心態

4.1 為什麼選擇深耕資料科學?

  1. Jerry 老師(轉職動機):原本管資料庫 + 寫網站 → 想「怎麼讓企業產生更大價值」 → 資料背後的價值可以發揮 → 念碩博累積理論 → 機器學習 / 資料探勘可拿來做產業發展 → 做購物車太容易(缺差異化) → 資料價值能差異化
  2. Jerry 老師(最興奮):每個行業(公部門 / 汽車 / 保險 / 銀行金融)都有有趣的地方;汽車電池資料分析案例—老師傅看 2-3 個 features,資料分析挖到 1000-3000 個 features → 老師傅興奮;幫人解決問題很興奮
  3. Jerry 老師(挑戰)
    • 資料前處理 / 清理(誤以為在做 AI / 大數據,其實在做清洗)
    • 溝通(客戶看到「AI / 大數據」想做但不知道自己要做什麼 → 借題發揮 → 要花時間收斂題目)
  4. Coco(最興奮):透過溝通了解每個產業——有種「非洲賣鞋」的感覺(市場很大 vs 沒市場的兩種解讀)
  5. Coco(挑戰):溝通 + 資料清洗 + SI 系統整合(從監視攝影機硬體 → server → 判斷 → 呼叫機器)

4.2 給新進者的建議

  1. 碩士 2 年該怎麼準備(Jerry 老師):時間很短 / 你要學的東西很多 / 比別人花更多時間
    • 寫 paper(畢業條件)
    • 打 Kaggle 比賽(直接接觸產業知識——題目都是知名公司提的)
    • 基礎能力(學校課 + 學校沒開但你有興趣的課)
    • 城市能力(一定要有)
    • 選擇方向:分析師走策略 / 工具 / 科學家走理論 / 打比賽 / 工程師走預訓模型 / 城市
  2. 為何要學理論基礎 + 練習首科(手刻)(Jerry 老師):以 iris 資料集為例,要做到 95% 準確率 → ChatGPT 寫不出來 → 有理論基礎才知道該怎麼調參數寫得出 vs 寫不出 GPT-用法的差別就在「你的理論基礎 + 實際經驗」——讓你跟別人不一樣
  3. Coco 的補充:理論基礎一定要強;首科有時間就練(碰現實生活問題才容易解出來);真擠不出時間先找工作;歐萊禮系列(動物書)參考
  4. 韋恩的整合:首科取決於你的強項——做資料工程師 / 科學家首科是亮點 / 做金融分析師金融知識更重要;首科現在沒有以前那麼必備(前幾年只有少數理工線可做資料分析)
  5. 韋恩的核心元命題

    不要期待「資料科學家應該長什麼樣子」的 SOP——資料科學需要很多種能力(領域知識 / 數學 / 程式三圈),很難全部學完——所以重點在於「長成你自己特色 / 強項的資料科學家」;不要跟臺大資工本科系拼專業,而是用你的背景特色脫穎而出

  6. 文組 / 領域專家轉職建議(如生物品質法規):
    • Coco:法律方面 NLP 已有美國律師事務所導入 ChatGPT 整合法規 / 讀判例;品質法規可能跟影像辨識相關(生物有沒有長黴菌 / 形狀大小)
    • Jerry 老師:法規類在 NLP 領域現在很紅 / 至少維持 4-5 年沒問題

4.3 元命題

  1. Money / Transformer is all you need(Jerry 老師):訓練大語言模型需要很多錢——那是大公司的事情,從業者站在巨人肩膀上保護就好
  2. 韋恩的「站在巨人肩膀上」延伸:未來如果你跟人家比 Pandas 多強 / Python 多厲害——別人問「我用 ChatGPT 一秒解掉,你為什麼堅持自幹?」——所以只會徒手自幹但沒辦法使用開源工具的工程師 / 分析師也是高風險工作者
  3. 「教育市場 → 引爆點」觀點(Jerry 老師):影像辨識被教育(AlphaGo)+ 自然語言被教育(ChatGPT)+ 結構化資料 / 大數據被教育(前幾年)→ AI 領域三個族群都成熟 → 各產業可以發光發熱
  4. 產業時機點(Coco):「舊時王謝堂前燕,飛入尋常百姓家」+「機會更多 → 趕快加入練功 → 不至於泡沫化

5. 跨期觀察(給未來 lint / pipeline 用)

  1. 「AI 進入工作流第一波應用實證」雙軸對位
    • 行銷端2026-04-30-Indie-Creative-035-AI行銷企劃 / 2022-12 推測):傑哥推測作者以假想品牌跑完創意產出鏈——確立 AI輔助創意「散彈→收斂→變體」迭代範式 + 「人負責創意核心 / AI 負責內容延伸」分工
    • 資料端(本期 / 2023-05):Jerry老師 + Coco 反思資料科學技能樹該怎麼點——確立「領域知識 不被取代 / 工具被加速 / 三角色重新分工 / 站在巨人肩膀上」職涯觀
    • 共同元命題:「AI 不是來取代你,而是讓你能做更多」 + 「驗證責任仍在人 / 創意核心仍在人 / 領域專業仍在人
  2. 「2023-05 NLP 元年」標記:本期是 vault 中第一個明確標記「2023-05 是台灣 NLP 元年」的時點——對位 vault 既有 ChatGPT 跨世代提醒(GPT-3.5 era → GPT-4 / 4-Turbo / 4o 等迭代);本期時點為 GPT-4 已發表 / 預測 NLP 至少維持 4-5 年熱度;後續 ingest 任何 2024+ 的 LLM 主題來源時,可以對位「從 NLP 元年到?」的時序軸
  3. 「Taiwan AI 教育生態人物圈」首次形成Jerry老師亞太智能機器 / Google ML GDE / NVIDIA partner / 多年課程主理)+ Coco(Microsoft AI MVP / 大魔術熊貓工程師 IG/FB / 課程主理)+ 資料科學家的工作日常(韋恩 / 創新工程師 / 數據職涯加值計畫主辦)= vault 中第一個台灣本土 AI 教育生態三人物 cluster——對位 Karpathy / Tiago-Forte 等國際個人 entity;累積到 5+ 人物 entity 後可考慮建 MOC-台灣AI教育

提取概念

連結到此來源衍生 / 更新的 wiki 頁:

新建(3 概念 + 3 實體)

  • 資料科學 — 概念;vault 中第一個資料科學 umbrella 概念頁——三角色分工(分析師走策略 / 科學家走理論 / 工程師走應用) + 三圈交集(領域知識 × 數學 × 城市能力)+ 「初階不必選定終身角色」職涯觀 + 「站在巨人肩膀上」哲學 + 高風險技能標記(純 BI 工具型分析師 / 徒手自幹工程師);vault 既有大量 LLM / AI / Prompt 相關概念頁但從未有資料科學 umbrella——這是被本期觸發的明顯缺口
  • 領域知識 — 概念;資料科學三圈中「最不可被取代」的軸——產業專家經驗 + 業務 know-how + 對問題的直覺判斷;對位 可遷移能力 / 切角 / STAR原則 在資料科學職涯的具體應用——「用你的背景成為你獨特的資料科學家
  • 模型刷榜 — 概念;圖榜 / 刷榜現象(在特定 benchmark dataset 上刷分數但泛用性 / 落地性不足)+ 反例 ChatGPT(開放給全世界玩 → 真實力)+ Coco 舉 YOLO 為例(圖榜但落地少);對位 12個問題法則 / 判讀力 的「輸入端品質評估」(不被 hype 帶走)+ vault 第一個 LLM / ML 領域專屬的「篩什麼」工具
  • Jerry老師 — 實體;亞太智能機器 創辦人 / Google ML GDE / NVIDIA partner / 2012- 進入資料分析業 / 課程教育主理者;vault 中第一個 Google ML GDE / NVIDIA partner人物 entity;vault 第一個 Taiwan AI 教育產業人物
  • Coco — 實體;Microsoft AI MVP / 大魔術熊貓工程師 IG/FB 主理 / 生統研究 → web 工程 → CV / NLP → 2022 預判 NLP 大爆發;vault 中第一個 Microsoft AI MVP 人物 entity;vault 第二個 Taiwan AI 教育產業人物
  • 資料科學家的工作日常 — 實體;韋恩主理 / FB + IG + LINE 社群 + Discord 伺服器 / 數據職涯加值計畫 14+ 場 / 線上課程主理;vault 中第一個資料科學主題的 publication / community——對位既有 Indie-Creative-電子報 / 曼報 / BFA-簡報 / AAPD-As-A-Product-Designer / 你的Py教練Mike 等不同主題 publication

更新(既有頁)

  • ChatGPT — 補入「教育 NLP 市場 + 是 NLP 元年觸發器」段(對位 AlphaGo 教育影像辨識市場)+ 補入「對話式下 SQL / Pandas-GPT 等加速面」段(對位既有任務截斷 / 自信編造等行為現象);補入相關來源
  • AI輔助開發 — 補入「從業者視角的『加速 vs 取代』再次確認」段(補強既有 035 期 / 028 系列任務層觀察) + 補入「只會徒手自幹但不用開源 / GPT 工具是高風險」反模式段(韋恩在本期提出);補入相關來源
  • Prompt-Engineering — 補入「SQL / 資料前處理對話化作為 prompt-engineering 應用場景」(從 SQL 到 Pandas-GPT 是「自然語言 → 工具語言」翻譯型 prompt 的具體案例);補入相關來源
  • MOC-LLM-應用設計 — 來源累積補入;應用層三角從「開發 + 創意」擴展為「開發 + 創意 + 資料科學」——補入 資料科學 為應用層第三條軸線,覆蓋既有任務層、創意層之外的「從業者整體職涯觀察」軸
  • MOC-職涯 — 來源累積補入;補入「資料科學職涯的可遷移特性」段(領域知識 × 城市能力 × 數學 → 任何產業專家都可進入的職涯轉換路徑);對位既有四場景三角(求職 / 面試 / 接案 / 個人品牌)擴展為加上「領域轉資料科學」第五場景

提及但未建頁

  • Microsoft M365 Copilot:作為「分析師高風險」的具體驅動產品被提及——目前 vault 中沒有獨立 Microsoft 產品 entity(既有 ChatGPT / OpenAI / Anthropic 等都是 OpenAI 系 / Anthropic 系),如未來累積 Microsoft Copilot 系列獨立來源(Office Copilot / GitHub Copilot / Designer / Studio 等)可建 entity 集合
  • NVIDIA:作為 亞太智能機器 partner 提及——目前 vault 中沒有 NVIDIA 獨立 entity,累積 2+ 來源後可建
  • TensorFlow / Pandas / Pandas-GPT / Scikit-learn:作為工具 stack 被提及但本期不深入——對應的更新落在 資料科學 / AI輔助開發 既有頁
  • Kaggle:作為碩士 2 年的累積路徑被提及(打比賽 = 接觸產業知識)——目前 vault 中沒有 Kaggle 獨立 entity,累積 2+ 來源後可建
  • YOLO / Pandas / Iris dataset / 防撞手機殼:作為例證被提及,無獨立建頁價值
  • AlphaGo:作為「教育影像辨識市場」的歷史錨點被提及——目前 vault 中沒有 AlphaGo 獨立 entity,累積 2+ 深度討論的來源後可建(AlphaGo / DeepMind 軸)
  • 亞太智能機器Jerry老師 創辦——本期作為人物背景補述,未獨立成頁;累積 2+ 公司獨立來源後可建 entity
  • 歐萊禮(O’Reilly)動物書系列:作為理論基礎自學路徑提及——目前 vault 中沒有出版社 entity,累積到形成「自學路徑來源累積」之後可考慮
  • 數據職涯加值計畫資料科學家的工作日常 主辦的 14+ 場系列活動——本期作為 資料科學家的工作日常 內容生產線之一被提及,無獨立建頁價值(系列活動 ⊂ 主理人 publication)

原文(可選)

來源為 YouTube 直播自動字幕逐字稿(ASR);保留原始 ASR 錯字(「質押」=「技能」/「圖榜」=「刷榜」/「客戶」=「Coco」/「教育老師」=「Jerry老師」/「就要老師」=「Jerry老師」/「呃呃呃」等口頭語)作為原始性記錄。下面是經過分段、潤飾標點、修正最明顯 ASR 錯字的可讀版本——不增刪內容。原文很長(~16k 字),保留全文以利長期保存。

時點推測標記:直播間請觀眾打卡「+0525」+ Microsoft M365 Copilot 已公告(2023-03-16) + ChatGPT 教育市場約半年——交叉鎖定 2023-05-25 為直播當日(前後幾日)。

開場(韋恩 / 主持)

哈嘍歡迎大家加入今天的線上直播。我們是數據職涯加值計畫的第 14 場活動,今天是一場線上座談。今天想要跟大家聊的主題是——AI 時代下資料科學工作者技能樹該怎麼點

我自己是資料科學與網頁開發的創新工程師,持續在不同平台發表對資料科學、網頁開發以及軟體相關的分享。我有經營兩個社群媒體:FB 和 IG,名稱都是「資料科學家的工作日常」。我也成立了 LINE 社群和 Discord 伺服器,邀請制——歡迎掃描訂閱。

這個活動叫做「數據職涯加值計畫」,原本想說是限定場、分享一個月就結束,但後來發現大家有興趣,就找不同前輩以座談方式繼續。從第 11 場之後,因為 AI 大爆發,我們大概都環繞 ChatGPT、AI 應用、資料科學技能等等。AI 的出現對整個數據產業帶來了不少影響——大家應該都感到滿滿的興奮以及焦慮。

今天的兩位講者:Jerry 老師——亞太智能機器創辦人,Google 機器學習開發專家,NVIDIA partner;Coco——微軟 AI MVP,「大魔術熊貓工程師」FB 粉專。

自我介紹

Jerry 老師

謝謝韋恩辦了這麼棒的活動。我是 Jerry 老師,本身是 Google 機器學習開發專家,同時也是亞太智能機器執行長,目前是 NVIDIA partner,提供 GPT 模型訓練服務。

我大概 2012 年開始做這個,目前 10 年左右。中間參加的資料分析專案蠻多——保險、汽車製造業、公部門。我最早接觸的這些分析專案大部分都是結構化資料為主,後來開始接觸非結構化資料——包含文字類的、影像分析類的。

Coco

哈嘍大家好,請叫我 Coco——這是我的本名(護照上面就是這四個英文字母)。我從學生時代就一直都有在做生物統計、分析相關的工作,會做很多研究、把數據提取出來、用統計學方法找差異,然後說故事——這算是我最早的啟蒙。

不過後來有比較長一段時間都在做 web,直到大概 5-6 年前才開始因為工作關係又開始接觸 CV 跟 NLP。尤其是去年(2022)底,我大概寫了一系列關於 NLP 相關的文章——就覺得「哎,NLP 好像快要大爆發了」——結果去年底就出了 ChatGPT,果然真的開始大爆發了。

這個產業真的還蠻有趣的,一直都會有新的東西出來,也很多挑戰。

軸 A:技能養成

A.1 AI 不取代寫程式

韋恩

第一個從技能養成開始聊。AI 出現後大家在讚歎的同時,會有一點開始覺得毛毛的——就是 AI 寫程式好像寫得比我們還要厲害這種感覺。永唱(韋恩 ASR) / 永遠這件事就是透過 ChatGPT 或這些 AI 工具好像能夠寫出很好的程式。那這個利用好的永遠能不能取代寫程式的人或書學者?AI 之後,我想要學習資料科學,我還需要寫程式嗎?

Coco

永遠會有一個角色是要扮演人跟電腦溝通的——無論最古老用打孔卡,到後來寫程式,到現在自然語言跟電腦溝通——永遠都會需要有一個人來跟電腦溝通。所以「可不可以取代寫程式」這件事情,未來說不定會有基於自然語言的寫程式方式,但是大家不用擔心沒有工作。

現在的話呢——絕對還是要學習程式的,而且非常重要。因為很多時候我們寫的程式雖然可能不是那麼好,但我們也可以透過 ChatGPT 來幫忙修正。微軟最近其實有提出一個觀點——「儘可能讓 ChatGPT 幫你寫程式,然後你就用它寫的程式,改成你自己要的樣子」。這個觀點是最近接受到還蠻棒的。

但是 AI 幫你寫完程式,你一定要看得懂!你一定要會改!所以我覺得資料人絕對還是要會寫程式的——第一就是不用擔心會被取代,第二城市還是一定要學習的。

Jerry 老師

接著 Coco 分享。寫程式是一個工具——但你要進入 AI 領域的話,要再加另外一個層次:理論的東西。確實 ChatGPT 雖然可以幫我們大概寫好,但你可以看到網路上很多人分享,他寫到一個地方就會沒辦法再往下寫——這個時候你就需要過去的理論還有寫程式的技巧融合在一起,才可以完成一個完整的 project。

基於這樣一個邏輯——我們希望大家在學寫程式的時候不要覺得「有了 GPT 之後就不用寫程式了」——它幫你加快寫程式的速度,而不是取代你去寫程式這個動作。所以基本的理論顯示觀念這些還是必須要有。

韋恩整合

用嘴巴寫程式其實是大家的夢想跟期待,不過就算 GPT 出現,它能夠幫你加速但你終究還是需要看得懂程式。在求職市場,你的競爭對手如果大家都會寫程式都會用 AI,那寫程式這個技能還是你需要的——它沒辦法取代你,但能夠幫你加速、跟你協作。

A.2 該培養的特質與能力

Jerry 老師

我最近上了很多不同種類的課,印象最深刻的是——我們面對專門做食品的這群學生,原本是做麵包做蛋糕的,可是因緣際會開始學習資料分析。我發現他們這個產業跨到資料分析雖然要學寫程式學一些資料科學技能,但他們對這個東西是有興趣的

我認為各個產業都會需要資料科學的服務導入。為什麼做麵包做蛋糕需要?事實上他做麵包做蛋糕,你可以用影像辨識去辨識做蛋糕做麵包的品質;蛋糕賣得好不好,你可能要做一些結構化資料分析、做一些推薦——所以不同行業的人來碰資料科學是有價值的

因為你具備這個領域的專業知識(比如念食品的,你就知道蛋糕麵包什麼時候在發酵的時候會有問題)——這個專業領域知識結合資料科學的專業之後,就可以更快地在這個領域上幫助這個產業做很快的成長

Coco

我基本上非常同意 Jerry 老師。一定要有你這個領域的專門知識——無論你是做麵包也好、做蛋糕也好,甚至殺豬也好——專業知識真的是絕對一定要擁有的。

再來我覺得有一點可能很多人會忽略——細心的程度。很多時候我們真的是要很細心地去觀察那些數值——可能準確度做得很高,但你某些地方沒有調整好就導致看似沒有那麼高,其實只是參數的問題而已。

然後城市能力也是必備的;統計學可能也可以去學一下(取樣、信賴區間 95% 之類);再來就是 SQL——SQL 真的是非常的萬用,你學好 SQL,很多類似的變種其實都可以很快上手——像 Pandas 還有一些 SQL-like 的寫法。學好 SQL 真的是還蠻重要的。

韋恩整合

AI 變得越來越普及時,越來越多人需要這樣的能力——以前感覺好像是工程師啊或做研究的人會跳進去看模型,現在工具越成熟,討論的人面向跟廣度非常不一樣——更在意的是應用層面——怎麼把專業技術擴散出去,從商業市場轉換成可以落地的應用。

A.3 知識焦慮

韋恩

AI 越大爆發大家越焦慮——上週是 Meta 又出新 model,前一週是 Google,再前一週是 Facebook。就覺得「啊怎麼資訊那麼多」。蠻好奇兩位會不會也有這種知識焦慮?

Coco

圖榜」(刷榜)——新的模型出來說效能比之前都還要好,可是很多時候這種專門在刷榜、圖榜的模型,它的泛用性可能不太夠——也就是說它可能在商業應用的時候效果就沒有之前的模型那麼好。

像 YOLO 吧,YOLO 好像有幾個版本就是這樣子,好像還蠻圖榜的,可是實際上落地應用也都比較少看到。所以大家真的不用太擔心——很多都是沒有落地,第二就是久了就會麻木了。反而像 ChatGPT 這種開放給全世界玩、給全世界使用的,才是真實力的模型

Jerry 老師

透過社群——這群人會通過一些活動、有人分享、大家互相讀。社群過濾後的資訊,你可以做比較完整的消化。

如果你今天是一直吸收到新的新聞,你訂閱了一些線上新聞或文章,你會很焦慮——因為這太多了一直進來。像 Google TensorFlow,一週就有 5-6 篇 reference 個案介紹,光 Google 就 5-6 篇了,更不要說其他 Flutter、Google 其他 software 介紹的文章——讀不完。

透過社群的方式——他會過濾說「臺灣這群人喜歡用哪些技術,這些技術哪些特色」——他們就會在網路上做很多社群上的分享。所以鼓勵大家去參加像今天這樣的活動,或者是相關社群——不管 Google 活動或 Microsoft 活動——這都是幫助大家快速把時代脈動掌握住的方式。

第二要提醒大家——我們這一行真的很辛苦。你如果要進來這一行,要有一定的熱情。當然你今天如果走應用領域,那你就追隨社群的大大們去學習技術;但如果你自己本身是要想要成為大大的話,那你就要一直追這些東西去維持你的學習內容、用學習熱情去維持你學習的方式。

軸 B:數據職涯

B.1 資料分析師 / 科學家 / 工程師三角色重新分工

韋恩

對於過去可能會有資料分析師、資料科學家、資料工程師這三種比較簡單的分類,你們自己對於這種數據產業當中不同的角色,質押上會有什麼樣的選擇跟建議?

Coco

資料分析師來講,我會覺得是會稍微危險一點點——資料分析師可能就是需要去說故事、分析數據、產生視覺化圖表(善用 Excel、用開發爐之類的)。可是最近微軟公布的什麼 M365 Copilot——你都可以用對話的方式請 Excel 去產生圖表、用對話的方式請他產生故事——所以可能資料分析師這個角色會有一些危險。當然,AI 不能背黑鍋,所以可能還是需要有人。

資料科學家就是要懂得更多——統計、訓練模型、走 user 流程都好,跟許多角色溝通協調——尤其有些產業,你光是要去走 use case 都好,都有辦法取代那些產線的工作人員了——資料科學家要走的是非常多的。

資料工程師比較偏向 data 的操作——把 data 儲存起來、data pipeline、database 管理——比較偏向傳統後端工程師或傳統管資料庫的工程師概念,只不過有更多更新的東西——資料的派派、可用性可靠性安全性、大數據的技術、data warehouse 等等。

所以——如果你更擅長溝通一點、走 use case,可以往資料科學家走;如果你可能對於資料庫更熟悉、更擅長操作資料,可以往資料工程師走;至於分析,我真的是比較擔心的部分——微軟目前那個 Copilot 好像有點太強大了。

Jerry 老師

我的觀點稍微不太一樣——資料分析師會比較偏重在策略的部分。就是 Coco 講的,現在很多 Copilot 的技術很快生成圖表,會加速分析師的工作效率。我看到的現象是國外很多資料分析師工具很方便,所以現在比較重的,重點會放在策略上——透過這些技術分析的數字之後,會用所謂的說故事,然後分析內容,幫公司擬定策略。這件事情如果你可以做得很好,那分析師這個位置還是可以在;可是如果你只是純粹把資料拿來做圖表分析,那這個位置可能就不好存在了——因為一般人就可以做了。

所以我覺得資料分析這個角色會變成更容易進入的門檻——各個行業可以很容易進入,因為他的工具已經變得很簡單——他可以著重在如何擬定公司成長策略這個方向前進。

資料科學家一直以來都是高層職位——年薪都非常好,做研究類領域,看論文、分析論文、解析論文,然後再把東西落到工程上面去。第一,理論基礎要很好,所以有一定門檻;然後工具能夠懂得很多很專注。一直要很會 K 書,慢慢累積能量。

資料工程師就比較符合大眾——以這三個位置來看,工程師是工程師等級可以直接轉職最快的。所以你會 SQL、做一些 application、現在都流行的 pre-trained model(預訓的模型)——你會懂簡單基礎,又會操控預訓模型,那可以做資料工程師——它可以幫助你產生很多應用去幫助公司做很多成長。

韋恩

我大膽地說——只會使用分析工具或 BI 工具,但沒辦法說出一個好故事的資料分析師——這一種類型接下來的風險就很高,因為這一段就是 ChatGPT 或 AI 模型很容易做到的事情。反而更需要的是說故事、溝通、商業、策略的能力。

而且——如果你對於資料工作有興趣,不要在初級就去設定自己到底要成為哪一種角色或者是往哪一種角色的技能點。因為其實對於初階的資料工作者而言,你的工作就是想辦法找到資料、想辦法分析、想辦法產生結果——這些可能在某種等級之後可能會分成比較專精的,可是在初期其實你就不需要管。儘可能去把整個 workflow 都走過一次,然後在市場當中看什麼缺多、什麼容易找得到,你就往那個地方走。

B.2 高風險技能

Jerry 老師

這種——我不敢說是技能完全取代,是說它會加速。比如以剛剛 Coco 講的 SQL 為例——以前是寫程式下 SQL,現在 GVT 也可以下 SQL——用簡單的自然語言告訴它,它就轉一個 SQL 給你。這種方式取代了以前下 SQL 寫程式這個動作,但不代表你就要忘掉 SQL 怎麼下,而是它可以加速你完成這個事情

一般資料分析師有專業技能,剛剛講的 SQL 為例就是加快使用效率。第二是產業知識——這件事不好被取代,因為產業知識是你過去累積的 domain know-how。一般來說資料分析還有所謂的說故事能力——這都是軟實力,基本上也是個人能夠成長下去的東西,不太會被取代。但反而我覺得工具面的部分會加速你達到目的性——比如以後寫簡報,工具會快速幫你寫簡報。

韋恩

我最近也看到蠻多人會拿 ChatGPT 或其他工具去做資料分析。分析這件事情的解讀可能稍微還沒有那麼好,不過資料前處理這件事情,其實 AI 工具做得還蠻好——以前你可能需要做很多字串操作、filter、正規表示式這種有點煩的東西,這些在 AI 工具上其實都可以做得很好。所以重複性高的東西其實是蠻容易可以被 AI 化的

B.3 需求變化與門檻

Coco

我覺得 AI 的持續進步可以用一首唐詩簡單地來概括——「舊時王謝堂前燕,飛入尋常百姓家」。很多時候你只能帶比較先進、比較高端工具用的一些 AI 技術,現在越來越普及化、越來越容易使用了——所以一堆其他的產業,不屬於科技產業或是比較邊傳產的部分,也都可以開始來用 AI 技術了。

所以我會覺得需求絕對不會減少,會越來越多——因為越來越簡單、越來越好用的話,各個產業都會越來越多有需求的。

然後門檻進一步的提高——如果你要去求職,可能真正那些一線公司的話,確實我覺得有可能是會被提高的。可是如果你工作的內容是想要讓某個特定的領域導入 AI、導入資料科學、解決一些科技領域的問題的話,我是覺得是還好的——應該不會跟 Google 那種程度的競爭。

Jerry 老師

工具只會越來越簡單——只要工具越簡單,進來的人就越來越多,每個領域的人都可以很快地順手拈來。所以資料分析的需求會越來越多——因為工具只要越簡單,大家會操作它,那就會有量變,量變之後就會有質變。

過去做資料分析就是講資料本身——現在全世界有多少資料產生,每個產業都有資料產生。比如剛剛講的麵包這個產業——為了去研究一個麵包怎麼樣生產得更好——可能就為了這個事情去拍照、去錄影、去做影像辨識、去做細部分析。因為產生資料這個門檻又低,大家又可以繼續開始做資料分析的工作——所以就會讓這個事情能夠在各個產業更快的發酵。

至於門檻——以資料分析純粹用應用的角度來看,門檻不會高。還記得我們以前在學機器學習的課的時候,那同學都要寫演算法——徒手寫一個決策樹演算法寫出來——那現在沒有了,K 完之後出社會直接拿應用專案。企業只在乎你說「你今天用這個演算法可不可以解決我的什麼問題——所以已經進入到另外一個層次。

軸 C:產業觀察與從業心態

C.1 為什麼選擇深耕?

Jerry 老師

我非常多年前其實也是圍繞在管資料庫、做網站開發。那時候會想要轉到這個行業,重點是在於——「如果我一直寫程式下去,我可不可以讓這個企業產生出更大的價值?」那時候就想到——資料其實可以產生出價值的可能性是很高的——因為程式只是建構一個 application 讓別人去用,但是程式背後所帶來的這些資料,價值怎麼去發揮?

我就開始在念碩士、念博士的時候累積理論基礎——後來越發現越覺得「資料所謂機器學習、資料探勘這些技術其實是可靠的,可以拿來做產業發展用的」。所以我就一直一直分根下去,從汽車產業、資料分析顧問到現在自然語言、智能機器,一直一直往前走。

我們知道這世界上現在做網站很容易、做購物車也很容易——但是如果你今天沒有把這些應用背後產生的資料讓他發揮價值,那你這些應用就會有點可惜,而且會沒辦法跟別人差異化——所以資料價值就變得很重了。

我最興奮就是——之前有一段時間在做資料分析,每一個行業都有有趣的地方(公部門、汽車、保險、銀行金融)。比如汽車行業做最久——電池資料分析——電池損壞了其實有很多因子。過去這些老師傅看到的因子可能只有兩三個,可是資料分析可以做比如 1000 個 2000 個 3000 個 features 去分析——挖掘到的這些屬性就比這些老師傅還多——老師傅就很興奮:「以前我肉眼看只能看 3 個 features,可是你用資料分析可以看到 10 個 20 個 features!」

挑戰就是——資料前處理 / 清理。很多朋友都會說「我以為我在做 AI,其實我在做要清洗的工作」——資料清理會是花比較多時間的地方。第二是溝通——很多客戶在做資料分析的時候,看到「大數據、AI」就會說「Jerry / Coco,幫我做個 AI、做個大數據」——可是他其實不知道自己要做什麼事情,他只是順著名詞想要借題發揮。所以要花比較多時間去跟他們收斂題目——它是什麼產業,這個產業底下有什麼問題,這個問題底下可以用資料分析解決什麼樣具體的事項。

Coco

我去透過溝通去了解他們有什麼樣的內容,我會覺得這是一種——不過有時候我又會覺得這有種「非洲賣鞋」的感覺——這是經典的理論:你到非洲去賣鞋是大家都沒穿鞋子市場很大,還是大家根本不穿鞋子所以沒有市場?

挑戰的部分基本上都跟 Jerry 老師一樣——溝通、資料清洗。然後我覺得我還碰到一點是比較偏向 SI 的部分——系統整合——可能就是要去串硬體的部分。例如說呢從監視攝影機的硬體串進來,串到 server,然後去做一些判斷之後,再去呼叫什麼機器啊之類的——這種系統整合的部分也是有碰到過的挑戰。

C.2 給新進者的建議

Q:碩士 2 年該怎麼準備?

Jerry 老師

首先呢,這 2 年很短——你要學的東西很多——你要比別人花更多的時間在這個領域上。你剛剛講的寫 paper、打 Kaggle 比賽——這是必要的,畢業條件就是要寫 paper。

打 Kaggle 比賽——蠻推薦——可以讓你直接在各種比賽上領悟到產業知識,因為那些題目都是知名公司提出來的。

再來就是基礎能力——學校上的課,然後你學校如果沒上到的課,你自己有興趣的(比如你對 NLP 有興趣、對 CV 有興趣,可是你學校剛好沒開)——你要去補這些課程的理論。

然後城市能力是一定要有的。

你要選擇一件事——你未來要往哪個地方走:

  • 走資料分析師——著重策略、工具的使用
  • 走資料科學家——加深理論、打 Kaggle 比賽
  • 走應用的資料工程師——懂得各種不同模型的應用,理論基礎要有,城市能力要有

要看你這個質押生最後到底要走哪個位置來決定你的補充內容。

Q:API / 模型越來越容易使用,為什麼還需要加強理論基礎、練習首科(手刻)?

Jerry 老師

現在最大的優勢就是——學東西的時候有 ChatGPT 幫忙,再來就是社群快速分享。學理論基礎、學首科最大的是——對於這個知識的瞭解程度多寡。

我在很多課程上有分享一個簡單案例——你現在用 TensorFlow 或 PyTorch 寫一個類神經網絡很快(10 行 ChatGPT 也可以跑出來)。可是當你碰到實際問題——比如「請預測 iris 資料集的花的分類,做到準確率 95%」——你就會發現一件事——ChatGPT 幫不上忙了。因為你對理論不熟的時候,你只問 ChatGPT,它寫不出來——它會一直不斷告訴你「你應該修正資料前處理啊、調這個參數啊」這就是一堆廢話。

這個時候——如果你有理論基礎、有學過什麼叫類神經網絡、知道它怎麼運作、有首科過、知道它怎麼跑出來——那你最後下這些參數、做這些層的處理的時候,你就會知道該怎麼做。

所以——為什麼要學理論基礎跟首科呢?這個是這個原因——你學了之後,你有理論基礎,人家用 ChatGPT 寫出來的東西、跟你用 ChatGPT 寫出來的東西就有差異——因為你的理論基礎和實際經驗,可以讓自己跟別人不一樣。

Coco

我也是非常同意 Jerry 老師——理論基礎要夠,碰到現實生活的問題才更容易有辦法解出來。練習首科——有時間就可以練了。真的擠不出時間的話,先找工作,我覺得可能比較實在一點——有時候可能你工作都還沒找到,一直花太多時間在首科的話,好像有點本末倒置。

然後當然理論基礎有空就盡量加強。我蠻推歐萊禮系列的書——動物書,封面都是動物的,很多理論的書都可以去參考看看。

Q:文組背景(如生物品質法規)想跨入 AI / 資料科學?

Coco

如果只朝著錢這件事情來看的話,科技產業是不錯的方向;如果繼續做生物品質法規或轉移使用下去的話,我覺得 NLP 在法律方面確實是有開始有人在應用了——美國有一些律師事務所已經開始導入 ChatGPT 整合法規、讀更多判例、有專門針對法律的見解。如果你的事法規相關的話,或許可以往這方面來看。

然後你的品質法規——說不定也跟影像辨識有關(看生物上面有沒有長黴菌、形狀大小之類的)——也可以往影像辨識那一邊來走。

Jerry 老師

這個——法規類的題目現在在 NLP 領域算現在紅——因為 GPT 出來之後,大家對於文字上的處理能力越來越有信心。你如果是文組背景,又對文字有興趣的話,建議就是可以往這個地方走——NLP 這個領域事實上自然而然是未來蠻夯的議題——至少維持 4-5 年是沒有問題的。

C.3 元命題與時機點

Jerry 老師(Money is all you need)

現在這個流行一句話叫做「Money is all you need」(不知道有沒有聽過?對對對,Transformer is all you need 這是一篇論文)——意思是說現在 training language model 需要很多錢。不用擔心,但是這個是大公司的事情,我們不需要——我們站在巨人的肩膀上保護

數據產業的時機點,一定是最符合現在——其實幾年前像 AlphaGo 下棋的時候,大家那時候只看別人下棋——你沒有親身能夠感覺到 AI 的威力——但是 ChatGPT 出來之後,去年 10 月開始到現在大家每天都在感受 ChatGPT 的威力。所以它已經是一個爆炸點、引爆點。

其實今年(2023)算是自然語言元年——在臺灣發展的元年。因為以前自然語言大家以前都在討論影像辨識很多,從去年年底或今年年初開始,大家才對於自然語言開始有點興趣、知道是什麼東西——因為 ChatGPT 已經教育了這個市場。影像辨識被教育市場、自然語言被教育市場、結構化資料 / 大數據分析也被教育市場——AI 領域三個族群在三個都被教育的情況之下,可以到各個不同的行業上持續發展

工具又很快可以信手拈來,VS Code 一打開還會幫你寫程式——應用上仔細點是可以很精準的——只要你具有 domain know-how,你就來上比如 Jerry 老師、Coco 老師、韋恩老師的課,稍微上一下、參加社群——你就可以趕快進入這個領域,然後在你的產業上發光發熱。

Coco(不至於泡沫化)

像我剛剛說的——「飛入尋常百姓家」——越來越多產業會更好操作,當然機會也就更多。這絕對是一個很好進入的時機點——各個產業都需要,趁現在趕快加入、開始練功、累積自己的之之之牙之類的。

你說泡沫化——目前我會覺得還好。我一直都覺得泡沫化這件事情可能是要連你隔壁阿桑也在說「要買台積電」「要買比特幣」這種才叫泡沫化——可是隔壁家上也不會說「你要不要趕快去進入資料科學」——所以應該是還好,不至於到泡沫化的現象,而且各行各業都需要這個領域人才——真的是蓬勃發展。

韋恩(站在巨人肩膀上)

整個世界一定是持續在進步——但門檻提高 / 學的東西越多並不是說變得更難——原因是因為我們其實是一直持續地站在巨人的肩膀上往前面學習。

假設你跟人家說你的 Pandas 超級強或 Python 很厲害——別人問你說「我用 ChatGPT 一秒鐘就可以解掉,為什麼你堅持要自幹?」——那就會很尷尬。所以——只會徒手自幹但沒辦法使用開源工具的工程師或分析師也是高風險工作者

結尾 QA(節錄)

Q:請問資料分析師該如何轉資料科學家?並如何在眾多資料科學競爭者當中脫穎而出?

Jerry 老師

資料分析師著重在策略——一般工具看完,比如跑跑比賽分析資料之後開始要去提供策略給老闆或決策方。要轉到資料科學家,比較大的重點是對於基礎理論是不是熟悉——因為他要深度去探討各種不同技術怎麼解決實務上的問題。Google 資料科學家很會發 paper,產量都很高(一年可以發 30-40 天這樣誇張)。當然我們不是說一下就要跳到那種等級,但至少你必須要在資料科學的專家們之間。

你必須有很深厚的理論基礎在——能夠從論文裡面找到一些商業應用的點解決客戶問題。台灣的資料科學家偏向是「我看了很多 paper,這個 paper 如何應用在我的企業上加強企業的 AI 能力提升」——所以你必須要有一個產業基礎、再加上要分析過去的經驗、再加上理論基礎——整合在一起就變成獨特的資料科學家角色。

Coco

脫穎而出——一定要加強你的基本能力——模型、理論基礎都是一定要去加強的。如果真的有時間的話,首科實做過一遍——某些算法你就試著去首科看看也是可以的。

韋恩

這個問題其實這樣——我覺得問這個問題本身——你可能會期待有一個 SOP 或者是「資料科學家應該長什麼樣子」——這個前提其實就是不對的。為什麼?因為其實我們知道資料科學家有一個三個圈圈的圖——什麼 領域知識、什麼數學、要程式——但是那這代表什麼?

代表其實你要成為一個數學資料科學家,你需要很多種能力——那你需要很多種能力——代表的是每個人其實都很難把所有能力都具備、都把它學完——那就代表著其實重點其實並不是你要怎麼樣去成為跟大家脫穎而出的——「你要怎麼樣去成為一個資料科學家?」——重點其實在於你要怎麼樣變成一個有你自己特色或你自己強項的資料科學家

所以你仔細去看一下現在這些像 Jerry 老師他的背景,然後像 Coco 的背景——他們其實都有一些可能跟自己獨特或自己專有的,然後就長成自己形狀的資料科學家去挖掘你自己的背景的亮點,這個才是最重要的

你可能有經濟的背景,或者你可能有像剛剛你講的,假設你想要在麵包領域當中做好資料分析——你有麵包的熱愛或興趣的話,那你就會比別人多有一些特色或亮點。如果你真的想要跟這種本科系、台大資工去比,那你在專業技能上面其實會有一個很大的 gap——那你要想的就是「那如果你要跟他競爭,那你的強項或你的背景特色是什麼?」——我覺得這件事情反而是這個問題背後想要跟大家聊的。

結尾

韋恩:感謝兩位前輩的精彩分享——大家如果有興趣,記得我們下週或之後都有持續的活動,可以繼續訂閱關注我們相關的社群——感謝大家今天的參與。