w/ James Cohan, @jacobeisenstein.bsky.social, and Kristina Toutanova
Paper link: arxiv.org/abs/2509.22445
arxiv.org
Bridging Kolmogorov Complexity and Deep Learning: Asymptotically Optimal Description Length Objectives for Transformers
The Minimum Description Length (MDL) principle offers a formal framework for applying Occam's razor in machine learning. However, its application to neural networks such as Transformers is challenging...