Lectures
Every topic in the map, grouped by the step it belongs to. Lectures open in a new tab.
9 lectures over 119 topics
1.Foundations
The theory the other steps lean on. Skim it first; come back when a step needs it.
- Probability & BayesDistributions, conditional probability, Bayes' theorem.no lecture yet
- Maximum likelihoodFitting parameters by maximising the likelihood of the data.no lecture yet
- Odds & log-oddsOdds, log-odds, odds ratios.no lecture yet
- Information theoryEntropy, cross-entropy, KL divergence, mutual information.no lecture yet
- Bias & varianceWhy models under- and over-fit.no lecture yet
- Hypothesis testingp-values, confidence intervals, power.no lecture yet
- Linear algebraVectors, matrices, projections, eigendecomposition, SVD.no lecture yet
- Calculus & gradientsDerivatives, chain rule, gradients.no lecture yet
- OptimisationGradient descent, SGD, convexity, learning rates.no lecture yet
- Potential outcomesCounterfactuals and confounding.no lecture yet
- MDPs & BellmanStates, actions, rewards, value functions.no lecture yet
2.Frame
Decide what is being predicted or decided, for whom, and how success is measured.
- Frame the problemDo we need ML? Target, unit of prediction, horizon, metric, baseline, task type.no lecture yet
3.Data & labels
Get the rows, understand them, and make sure the labels mean what you think.
- Sourcing & signalWhere the data comes from; enough rows, enough positives, label quality.no lecture yet
- Exploring the dataDistributions, ranges, units, target balance, correlations and redundancies, statistical tests of feature → target relationships, missingness patterns.no lecture yet
- Hunting for leakageFeatures that encode the answer; anything computed after prediction time.no lecture yet
- Labeling & data collectionAnnotation and agreement, weak supervision, active learning, semi-supervised.no lecture yet
- Cleaning the dataMissing values: drop if rare, impute, model-based imputation, sentinel + missing flag, don't over-impute. Outliers: genuine extremes vs data-entry errors; cap, winsorise, log-transform. Consistency: types, units, timezones, encodings, deduplication.no lecture yet
4.Represent
Turn whatever you have into vectors a model can use.
- Encode & scaleOne-hot, ordinal, target encoding, hashing; when to scale.no lecture yet
- Create featuresRatios, interactions, date parts, rolling aggregates, lags.no lecture yet
- Modalities → vectorsText, images, audio, graphs into vectors via TF-IDF or pretrained encoders.no lecture yet
- Reduce & selectDrop redundant or leaky features; importance, mutual information, PCA.no lecture yet
- Embedding layersLearned dense vectors for high-cardinality categoricals.no lecture yet
- word2vec & GloVeEmbeddings as learned similarity.no lecture yet
- TokenizationBPE, vocabularies, what a token is.no lecture yet
5.Split
Hold out data the way production will hold out the future.
- Split the dataTrain/val/test; random, stratified, grouped.no lecture yet
- Temporal splits & backtestingRolling and expanding windows; never leak the future.no lecture yet
- Cross-validationK-fold and variants; nested CV.no lecture yet
6.Model
Start with the dumbest thing that could work, then climb only as far as the evaluation demands.
Baselines & linear models
- Dumb baselineMajority class, mean, last value, popularity, rules.no lecture yet
- Linear models & GLMsLinear regression; GLMs with link functions, deviance and saturated models; Poisson/gamma; quantile and Huber; GAMs.no lecture yet
- Regularised linearRidge, lasso, elastic net.no lecture yet
- Binary and softmax; one-vs-rest.
Neighbours, kernels & probabilistic
- Instance-based prediction.
- Plus LDA and QDA.
- Kernel methodsSVM, SVR, kernel ridge, Gaussian processes.no lecture yet
- Graphical modelsHMM, CRF, Bayesian networks, EM.no lecture yet
- Survival analysisKaplan-Meier, Cox, random survival forests, concordance.no lecture yet
Trees & ensembles
- Greedy splitting, impurity, pruning.
- Bagging & random forestsBootstrap aggregation, random forest, ExtraTrees.no lecture yet
- GBM, XGBoost/LightGBM/CatBoost.
- Networks on tabular dataMLP with embeddings, TabNet, FT-Transformer; when they beat boosting.no lecture yet
Unsupervised
- ClusteringK-means, DBSCAN/HDBSCAN, hierarchical, spectral.no lecture yet
- Gaussian mixtures & EMSoft clustering via EM.no lecture yet
- Dimensionality reductionPCA/SVD, NMF, t-SNE/UMAP, topic models.no lecture yet
- Anomaly detectionIsolation forest, LOF, one-class SVM, reconstruction error.no lecture yet
- Association rulesApriori, FP-Growth; market basket analysis.no lecture yet
Neural networks
- MLP & backpropThe multilayer perceptron and how gradients flow.no lecture yet
- AutoencodersCompression by reconstruction.no lecture yet
- Convolutional networksConvolution, pooling, ResNets, augmentation, transfer.no lecture yet
- Detection & segmentationYOLO, U-Net, Mask R-CNN.no lecture yet
- Vision transformers & CLIPPatches as tokens; vision-language embeddings.no lecture yet
- RNN / LSTM / GRURecurrent sequence models; TCNs.no lecture yet
- Attention & transformersAttention as soft lookup; the transformer.no lecture yet
- Transformer internalsAttention variants, positional encodings, KV cache.no lecture yet
- Seq2seqEncoder-decoder.no lecture yet
- Sequence labeling & NERBiLSTM-CRF, token classification with a fine-tuned encoder.no lecture yet
- Graph neural networksGCN, GraphSAGE; node classification and link prediction.no lecture yet
Sequences, time series & audio
- Classical time seriesARIMA/SARIMA, ETS, VAR, state-space, Prophet.no lecture yet
- Boosting on lag featuresOne global gradient-boosted model across many series.no lecture yet
- Deep forecastingDeepAR, TFT, N-BEATS, foundation models.no lecture yet
- Audio networksSpectrograms, MFCCs, 1D CNNs and RNNs.no lecture yet
- CTC & speech recognitionAlignment-free sequence loss.no lecture yet
- Pretrained audio encoderswav2vec, Whisper.no lecture yet
Recommenders, search & matching
- Collaborative filteringItem-item and user-user neighbourhoods.no lecture yet
- Matrix factorizationSVD, ALS, BPR.no lecture yet
- Factorization machinesPairwise interactions via factorized weights.no lecture yet
- TF-IDF + linearBag-of-words baseline.no lecture yet
- BM25 & lexical searchTerm weighting for retrieval.no lecture yet
- Learning to rankPointwise, pairwise, listwise; LambdaMART.no lecture yet
- Metric learningSiamese, triplet, contrastive losses; negative sampling.no lecture yet
- Two-tower retrieval & ANNDual encoders; HNSW, IVF-PQ, FAISS.no lecture yet
- Deep rankersWide & Deep, DeepFM, DLRM, DCN, MMoE.no lecture yet
- Bi- vs cross-encodersDense retrieval plus re-ranking.no lecture yet
- Sequential recommendersGRU4Rec, SASRec, BERT4Rec.no lecture yet
- Graph recommendersLightGCN, PinSage.no lecture yet
- The funnel & cold startCandidate generation → ranking → re-ranking; fallbacks.no lecture yet
- Entity resolutionBlocking, pairwise matching, transitive closure over the match graph.no lecture yet
Using pretrained language models
- The LLM ladderPrompting → RAG → fine-tuning → pretraining.no lecture yet
- Structured extraction with LLMsSchemas, function calling, validation, routing low confidence to humans.no lecture yet
Generative
- Variational autoencodersLatent-variable generation.no lecture yet
- GANsAdversarial training.no lecture yet
- Normalizing flowsInvertible maps.no lecture yet
- Diffusion modelsIterative denoising.no lecture yet
Decisions: bandits, RL, causal
- BanditsEpsilon-greedy, UCB, Thompson sampling, LinUCB.no lecture yet
- Online learningStreaming SGD, FTRL.no lecture yet
- Causal inferencePropensity, matching, IPW, difference-in-differences.no lecture yet
- Uplift modellingUplift trees, meta-learners, Qini curves.no lecture yet
- Attribution & marketing mix modelsMulti-touch attribution; aggregate regression with adstock and saturation.no lecture yet
- Value-based RLSARSA, Q-learning, DQN.no lecture yet
- Policy-based RLPolicy gradient, actor-critic, PPO.no lecture yet
- Offline & model-based RLLearning from logs; world models.no lecture yet
7.Train
Fit it, tune it, and stop it from memorising.
Fitting classical models
- Loss functionsCross-entropy, hinge; MSE, MAE, Huber, quantile; pairwise and listwise.no lecture yet
- Hyperparameter tuningGrid, random, Bayesian.no lecture yet
- Handle imbalanceClass weights, resampling, thresholds.no lecture yet
- Over- & underfittingRegularisation, early stopping, learning curves.no lecture yet
- EnsemblingVoting, bagging vs boosting, stacking.no lecture yet
- CalibrationPlatt, isotonic, reliability curves; recalibrating after downsampling.no lecture yet
Training neural networks
- Training craftInit, normalisation, dropout, schedules, clipping, debugging loss curves.no lecture yet
- Fine-tuning a pretrained modelFreezing, unfreezing, discriminative learning rates.no lecture yet
Pretraining & adaptation
- Next-token pretrainingTrain a nano-scale GPT.no lecture yet
- Masked & contrastive pretrainingBERT-style objectives.no lecture yet
- Fine-tuning & LoRAFull vs parameter-efficient.no lecture yet
- Distillation & domain adaptationSmall models from big ones.no lecture yet
- RLHF & DPOAlignment from preferences.no lecture yet
8.Evaluate offline
Measure it on held-out data, then find out where it is wrong.
Metrics by task
- Accuracy, precision/recall/F1, sensitivity and specificity, ROC-AUC, PR-AUC, log loss, confusion matrix.
- RMSE, MAE, MAPE, R².
- Forecasting metricsMAPE, sMAPE, MASE vs naive.no lecture yet
- NDCG, MAP, MRR, recall@k, coverage.
- Cosine vs dot, anisotropy, recall@k.
- Evaluating without labelsSilhouette, ARI, precision at alert budget.no lecture yet
- Evaluating generative outputPerplexity, benchmarks, LLM-as-judge, preference.no lecture yet
Understanding errors
- InterpretabilityGlobal: permutation importance, partial dependence. Local: SHAP, LIME, counterfactuals, reason codes.no lecture yet
- Error analysis & significanceSlices, fairness, robustness, significance of comparisons.no lecture yet
9.Evaluate online
Find out whether the offline number meant anything.
- Offline / online gapWhy offline metrics disagree with production.no lecture yet
- A/B testing & interleavingRandomisation, power, guardrails, novelty; interleaving for ranking.no lecture yet
- Off-policy evaluationIPS, doubly robust.no lecture yet
10.Ship & monitor
Serve it, watch it, and know when to retrain.
- Features at serving timeSame transform online; pipelines and feature stores.no lecture yet
- Serving & releaseBatch/realtime/edge; latency, throughput and cost budgets; experiment tracking (seeds, data versioning, MLflow/W&B); model registry, versioning, rollback; shadow mode, canary.no lecture yet
- Inference optimisationQuantisation, speculative decoding, batching, caching.no lecture yet
- Monitor & retrainLog predictions; data drift, concept drift, performance decay; retraining triggers; feedback-loop awareness.no lecture yet