資料科學是什麼?
資料科學(Data Science)是一門結合統計學、程式設計和領域知識的跨領域學科。簡單來說,就是用數據來回答問題、發現規律、做出預測。
在 AI 時代,資料科學不再只是資料科學家的專屬技能——它是每個知識工作者都該具備的基礎素養。
學習路線圖
🟢 第一階段:Python 基礎(2-4 週)
不管你的背景是什麼,Python 是進入資料科學最友善的程式語言。
必學主題:
- 變數、資料型別、控制流程
- 函數與模組
- 列表推導式(List Comprehension)
- 字典與集合操作
- 檔案讀寫
# 列表推導式範例:篩選偶數並平方
numbers = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]
even_squares = [x**2 for x in numbers if x % 2 == 0]
# [4, 16, 36, 64, 100]
推薦資源:
- Python 官方教學(免費)
- Codecademy Python 課程
- 《Python Crash Course》
🟡 第二階段:資料處理(3-4 週)
學會用 Python 處理和分析資料,這是資料科學的核心技能。
必學套件:
NumPy —— 數值計算
import numpy as np
# 建立陣列並計算統計量
data = np.array([23, 45, 67, 89, 12, 34, 56, 78])
print(f"平均值:{data.mean():.1f}") # 50.5
print(f"標準差:{data.std():.1f}") # 25.2
print(f"中位數:{np.median(data):.1f}") # 50.5
Pandas —— 資料處理
import pandas as pd
# 讀取 CSV 並做基本分析
df = pd.read_csv("sales_data.csv")
print(df.describe())
# 分組統計
monthly_sales = df.groupby("month")["revenue"].agg(["sum", "mean", "count"])
print(monthly_sales)
Matplotlib & Seaborn —— 資料視覺化
import matplotlib.pyplot as plt
import seaborn as sns
# 繪製銷售趨勢圖
plt.figure(figsize=(10, 6))
sns.lineplot(data=df, x="month", y="revenue", hue="category")
plt.title("Monthly Revenue by Category")
plt.tight_layout()
plt.savefig("revenue_trend.png", dpi=150)
🟠 第三階段:統計學基礎(3-4 週)
統計學是資料科學的理論基石。你不需要成為統計學家,但需要理解核心概念。
必學主題:
- 描述統計:平均值、中位數、標準差、四分位數
- 機率分佈:常態分佈、二項分佈、泊松分佈
- 假設檢定:t-test、chi-square test、p-value
- 相關與回歸:皮爾森相關係數、簡單線性回歸
- 貝氏統計:條件機率、貝氏定理
🔴 第四階段:機器學習(6-8 週)
有了 Python 和統計基礎,你就可以開始學習機器學習了。
學習順序建議:
監督式學習
- 線性回歸 → 理解模型的基本概念
- 邏輯回歸 → 分類問題入門
- 決策樹 / 隨機森林 → 理解集成學習
- SVM → 了解超平面分類
- XGBoost → 競賽常用模型
非監督式學習
- K-Means 聚類 → 客戶分群
- PCA 降維 → 特徵工程
- 異常偵測 → 風控應用
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import classification_report
# 分割資料
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
# 訓練模型
model = RandomForestClassifier(n_estimators=100, random_state=42)
model.fit(X_train, y_train)
# 評估
predictions = model.predict(X_test)
print(classification_report(y_test, predictions))
🟣 第五階段:深度學習與 AI(持續學習)
- 神經網路基礎:感知器、反向傳播
- CNN:影像辨識
- RNN / Transformer:自然語言處理
- LLM 應用:RAG、Fine-tuning、Agent
實戰專案建議
理論學完一定要做專案,以下是按難度排列的推薦專案:
🌱 初級
- 鐵達尼號生存預測(Kaggle 經典)
- 房價預測
- 信用卡詐欺偵測
🌿 中級
- 電商推薦系統
- 文本情感分析
- 時間序列預測(股價、天氣)
🌳 進階
- 建立端到端 ML Pipeline
- 部署 ML 模型為 API
- 建立自動化 AB 測試平台
常見問題
Q:需要數學很好嗎?
不需要是數學系畢業,但需要理解基本的線性代數、微積分和統計概念。好消息是,大部分都可以邊做邊學。
Q:要不要考證照?
Google Data Analytics Certificate 和 IBM Data Science Professional Certificate 是不錯的起步,但專案作品集比證照更重要。
Q:多久能找到工作?
全職學習的話,大約 6-12 個月可以具備初階資料分析師的能力。但持續學習是這個領域的常態。
開始你的學習之旅
如果你想要有系統地入門資料科學,歡迎查看我的線上課程。從 Python 基礎到機器學習實戰,一步步帶你建立完整的資料科學技能樹。
本文持續更新中。最後更新:2025 年 1 月。