How to train a new language model from scratch using Transformers and Tokenizers

language-modelpretrainingtransformershuggingfacerobertabyte-pair-encoding

Abstraction: End-to-end tutorial training RoBERTa-like LM on Esperanto from scratch

Key points:

Connections: Hugging Face · Language Model Pretraining · Masked Language Modeling · Byte Pair Encoding · Transformers

Source: https://huggingface.co/blog/how-to-train