Transformers and Attention
Implement and debug attention, multi-head layout, rotary positions, and transformer blocks using transparent NumPy experiments plus a complete optional PyTorch implementation. Includes causality tests, worked calculations, and an architecture capstone.
Intermediate20–28 hours including labsArtificial IntelligencePremium access