Inside Transformers: Advanced Topics in LLM Interpretability

Instructor: Esra Dönmez (Co-lecturer)

Term: Summer 2026

Reading list

  1. Data Attribution — Infini-gram
  2. Mechanistic: Localization — Probing — Interpreting GPT: the Logit Lens
  3. Mechanistic: Localization — Causality — Locating and Editing Factual Associations in GPT
  4. Invited Lecture — Dr. Andreas Waldis presents Aligned Probing: Relating Toxic Behavior and Model Internals
  5. Mechanistic: Localization — Neurons — Neurons in Large Language Models: Dead, N-gram, Positional
  6. Mechanistic: Localization — Sparse Autoencoders / Transcoders — Sparse Autoencoders Find Highly Interpretable Features in Language Models
  7. Application / Evaluation: Unlearning — Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
  8. Application / Evaluation: Steering — Steering Llama 2 via Contrastive Activation Addition
  9. Application / Evaluation: Safety — Refusal in LLMs is an Affine Function
  10. Behavioral — Discovering Latent Knowledge in Language Models Without Supervision
  11. Invited Lecture