IBM Introduction to Data Analytics 筆記 [IBM 數據分析課程]

後設資料

  • 作者:ML(Notion / 課程筆記)
  • 發表日 / 更新日:2021-09-29
  • Ingest 日:2026-05-09
  • 頁數:25
  • 語言:繁體中文 / 簡體中文混用,保留課程英文術語
  • 原始檔:/Users/meowlu/Downloads/39cf52ee-257a-4dd9-ac06-fc0899bd8e03_IBM_Introduction_to_Data_Analytics_筆記_IBM_數據分析課程.pdf
  • Vault 檔:10-來源/PDF/2026-05-09-IBM-Introduction-to-Data-Analytics筆記.pdf
  • SHA-256:7c42775bf7428c512b9f9e877ecfc826f849c9ee40c23e1b8238581b9f18172f

一句話濃縮

這份 IBM 資料分析入門課筆記把現代數據生態系統、資料角色分工、四種分析類型、資料分析流程、資料來源 / 格式 / 儲存庫、ETL / 資料整理 / 清洗、統計與資料挖掘,以及把結果視覺化並傳達給利害關係人的工作流串成一份資料分析基礎地圖。

結構摘要

  • 現代數據生態系統:資料來自結構化與非結構化來源,經過取得、組織、清理、優化與存取,最後服務業務利害關係人、分析師、程式與應用系統;可靠性、安全性、完整性、合規與主資料標準化是底層要求。
  • 關鍵角色:資料工程師負責抽取、整合、組織、儲存與管理資料;資料分析師負責清理、分析、找模式、解釋與呈現;資料科學家進一步建立預測模型;商業 / BI 分析師把洞察轉成業務行動。
  • 資料分析定義與四類型:資料分析是收集、清理、分析、挖掘、解釋與報告結果的過程;描述性分析回答「發生什麼」、診斷分析回答「為什麼」、預測分析回答「接下來可能如何」、規範分析回答「應該採取什麼行動」。
  • 資料分析流程:理解問題與預期結果、設定明確指標、蒐集資料、清理資料、提取與分析、解釋結果、介紹發現;溝通能力被放在流程末端但與分析本身同等重要。
  • 資料分析師能力組合:資料取得、查詢、清理、標準化、統計解讀、模式與相關性辨識、報告與圖表、流程文件;技能橫跨統計、分析、解題、資料視覺化、專案管理、溝通、Python / SQL / R / Tableau / Power BI。
  • 資料類型與來源:結構化、半結構化、非結構化資料;CSV / XLSX / XML / PDF / JSON 等格式;資料來源包含關聯資料庫、平面檔、API、網頁抓取、資料流與訂閱 feed。
  • 資料儲存與管線:關聯資料庫、NoSQL、資料倉庫、資料集市、資料湖、大數據儲存、ETL 與資料管線;資料湖保留原始資料,資料倉庫保留清理、整合與分類後資料。
  • 大數據與工具:大數據以速度、數量、種類、真實性與價值五軸描述;Hadoop / HDFS、Hive、Spark 分別承擔分散式儲存、查詢分析與即時 / 大量資料處理。
  • 識別與收集資料:先定義需要收集的資訊,再決定來源、收集計畫、資料量與方法;來源可分為主要、次要與第三方資料,並需同時考慮品質、安全、隱私、合規與可稽核性。
  • 資料整理與清洗:資料整理包含發現、轉換、驗證與發布;轉換可含結構化、正規化 / 反正規化、清理與資料豐富;清洗處理缺失值、重複、不相關資料、語法錯誤、資料型態與標準化。
  • 統計分析與資料挖掘:統計分析分描述性與推論性;資料挖掘使用聚類、關聯規則、親和分組、決策樹、回歸等技術找出模式、關係、變化與趨勢。
  • 溝通與視覺化:資料結果需依受眾調整資訊量與結構,用圖形、圖表、地圖、儀表板與敘事讓受眾信任、理解並採取行動;工具包含 Excel / Google Sheets、Jupyter、RStudio、Cognos、Tableau、Power BI。
  • 職涯機會:資料分析師可走專家路線、領域專家路線、支援分析的工作角色,或轉向資料工程師、大數據工程師、資料科學家、業務分析師與 BI 分析師。

重要段落 / 引用

「數據分析是收集、清理、分析和挖掘數據、解釋結果和報告結果的過程。」(p.4)

「對問題和預期結果有一個瞭解。」(p.5)

「以清晰和有影響的方式溝通和展示您的發現的能力與分析本身一樣是數據分析過程的重要組成部分。」(p.6)

「確保記錄該過程以供將來參考和重複使用。」(p.8)

「數據存儲庫是一个通用术语,用来指已经收集、组织、存储的数据。」(p.12)

「要使數據可視化有價值,您需要:想想你的聽眾的關鍵要點。」(p.23)

提取概念

Ingest 筆記

2026-05-09

  • 來源類型判斷:本來源是獨立 PDF,而非 bundle;依契約複製 PDF binary 到 10-來源/PDF/ 並建立同名 sidecar。
  • 重複檢查:以 rg 搜尋 IBM / Introduction to Data Analytics / Data Analytics / 數據分析 / 資料分析,未發現同一來源;既有資料科學 cluster 已有職涯、主管、商業分析與資料故事化來源,本來源是第一份偏「資料分析入門課程框架」的 PDF。
  • 文字抽取pdftotext -layout 可抽出 1102 行文字;有 font mismatch warnings,但主要文字、頁碼與章節可判讀。
  • 建頁判斷
    • 新建 資料分析:vault 既有 資料科學 偏資料科學職涯 / AI 衝擊 / 三角色分工,商業分析 偏決策與問題拆解;本來源完整提供資料分析定義、類型、流程、資料來源、清洗、統計、視覺化與溝通,因此需要一個獨立 umbrella 承接「analysis workflow」。
    • 新建 MOC-資料科學:資料科學 cluster 已累積 6+ 來源(資料科學技能樹、程式猿資料科學系列上下游、資料團隊主管視角、商業資料分析師訪談、資料故事化 PDF、IBM 資料分析課程),且概念面已超過 8 個;既有 MOC-職涯 只能承接職涯面,MOC-LLM-應用設計 只能承接 AI 衝擊面,因此補一個 data-domain MOC。
    • 不新建「資料工程 / ETL / 資料倉庫 / 資料湖 / 資料治理 / 資料整理 / 資料清洗 / 統計分析 / 資料挖掘」:本來源對這些子題多為入門列舉,尚未達獨立頁密度;先以 資料分析 內文與觀察清單拆頁候選承接。
    • 不新建「IBM」entity:本來源使用 IBM 課程作為內容來源,但筆記主題不是 IBM 公司、產品或策略;既有 IBM 提及多為案例或課程提供者,暫不升格。
  • 觀察清單同步:新增一條 資料分析 拆頁候選叢集,追蹤資料整理 / 清洗 / ETL / 資料倉庫 / 資料湖 / 資料管道 / 資料治理等子題;避免在單一入門課來源下開出多個薄頁。
  • 既有 graph 對位:本來源把 資料科學 的「以數據解決量化問題」補成一條可操作流水線:問題與指標 → 資料取得 / 儲存 / 清洗 → 統計與挖掘 → 視覺化與故事化 → 決策採納。這條線同時對位 商業分析 的問題定義、資料團隊影響力 的採納與治理、圖表類型選擇 / 資料故事化 的溝通層。

備註

  • PDF 本身保留原始筆記;sidecar 只做摘要、概念連結與 ingest 決策。