Machine learning fundamentals — supervised, unsupervised, RL
**Supervised learning** learns a function f: X → Y from labeled examples. Classification (discrete Y) uses cross-entropy loss; regression (continuous Y) uses MSE/MAE. Canonical models: logistic regression (linear decision boundary on log-odds), SVMs (maximum-margin separators with kernel trick for nonlinearity), random forests (bagged trees, feature sampling), gradient boosting (XGBoost, LightGBM, CatBoost — still SOTA on many tabular problems).
**Unsupervised learning** finds structure without labels. K-means (hard clustering, minimizes within-cluster variance), Gaussian mixture models (soft clustering via EM), PCA (linear dimensionality reduction preserving variance), t-SNE/UMAP (nonlinear manifold visualization), autoencoders (compress-reconstruct), contrastive self-supervised (SimCLR, MoCo, CLIP, DINO).
**Reinforcement learning** learns a policy π(a|s) maximizing expected return E[Σ γ^t r_t]. Classical: Q-learning, SARSA, policy gradient (REINFORCE). Deep RL: DQN (Atari), PPO (robotics, RLHF), A3C. Exploration-exploitation via ε-greedy, UCB, Thompson sampling.
**Bias-variance trade-off:** expected loss = irreducible noise + bias² + variance. High-capacity models overfit (low bias, high variance); regularization trades some bias for lower variance. Techniques: L1/L2, dropout, data augmentation, early stopping, ensembling.
**Generalization theory:** PAC learning, Rademacher complexity, VC dimension — classical but loose. Modern observation: large overparameterized networks generalize despite zero training loss (double descent, Belkin et al. 2019). Implicit regularization from SGD is an active research area.