Dušan made something like TensorBoard for tokenization 📊 Token length, entropy, vocab overlap, JS divergence, alignment scores: sliced by language family, script, region, speakers, data availability.
🔗 Code: github.com/ufal/TokCollate
🔗 Demo: quest.ms.mff.cuni.cz/tokcollate