Pretokenizer and counters¶
Pretokenizer¶
ffbpe.pretokenizer.PreTokenizer
¶
PreTokenizer(special_tokens, eot_token=None, pat_str=None, unicode_bigrams=None, unicode_bigram_mixed_boundary='keep')
Source code in python/ffbpe/pretokenizer.py
with_unicode_bigrams
¶
Return a pretokenizer using a frozen Unicode bigram set.
Source code in python/ffbpe/pretokenizer.py
bigram_counter
¶
word_counter
¶
load_word_counter
¶
get_words
¶
select_unicode_bigrams_from_file
¶
select_unicode_bigrams_from_file(path, *, chunk_size=1024 * 1024, boundary='auto', top_k=100000, min_freq=16)
Select Unicode bigrams and retain their effective frequency boundary.