Packages

Fast Hugging Face tokenizer.json, OpenAI tiktoken, and SentencePiece model bindings for Elixir via the IREE tokenizer runtime

Current section

Files

Jump to
iree_tokenizers test fixtures unigram_sequence_normalizer_utf8.json
Raw

test/fixtures/unigram_sequence_normalizer_utf8.json

{
"version": "1.0",
"normalizer": {
"type": "Sequence",
"normalizers": [
{
"type": "Replace",
"pattern": { "Regex": "\\s{2,}|[\\n\\r\\t]" },
"content": " "
},
{ "type": "NFC" },
{ "type": "Strip", "strip_left": false, "strip_right": true }
]
},
"pre_tokenizer": {
"type": "Metaspace",
"replacement": "▁",
"prepend_scheme": "always",
"split": true
},
"model": {
"type": "Unigram",
"unk_id": 0,
"vocab": [
["<unk>", -10.0],
["▁", -1.0],
["日", -1.0],
["本", -1.0],
["語", -1.0],
["の", -1.0],
["テ", -1.0],
["ス", -1.0],
["ト", -1.0],
["。", -1.0]
]
},
"decoder": {
"type": "Metaspace",
"replacement": "▁",
"prepend_scheme": "always",
"split": true
}
}