Inside Transformers: Advanced Topics in LLM Interpretability
Instructor: Esra Dönmez (Co-lecturer)
Term: Summer 2026
Reading list
- Data Attribution — Infini-gram
- Mechanistic: Localization — Probing — Interpreting GPT: the Logit Lens
- Mechanistic: Localization — Causality — Locating and Editing Factual Associations in GPT
- Invited Lecture — Dr. Andreas Waldis presents Aligned Probing: Relating Toxic Behavior and Model Internals
- Mechanistic: Localization — Neurons — Neurons in Large Language Models: Dead, N-gram, Positional
- Mechanistic: Localization — Sparse Autoencoders / Transcoders — Sparse Autoencoders Find Highly Interpretable Features in Language Models
- Application / Evaluation: Unlearning — Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
- Application / Evaluation: Steering — Steering Llama 2 via Contrastive Activation Addition
- Application / Evaluation: Safety — Refusal in LLMs is an Affine Function
- Behavioral — Discovering Latent Knowledge in Language Models Without Supervision
- Invited Lecture