add unk_token to gpt2

57e54ec0 · thomwolf · ac42049c · 57e54ec0
Commit 57e54ec0 authored Jul 26, 2019 by thomwolf
Hide whitespace changes
Inline Side-by-side

Showing with 2 additions and 4 deletions

pytorch_transformers/tokenization_gpt2.py pytorch_transformers/tokenization_gpt2.py +2 -4

No files found.
--- a/pytorch_transformers/tokenization_gpt2.py
+++ b/pytorch_transformers/tokenization_gpt2.py
@@ -102,7 +102,7 @@ class GPT2Tokenizer(PreTrainedTokenizer):
    pretrained_vocab_files_map = PRETRAINED_VOCAB_FILES_MAP
    max_model_input_sizes = PRETRAINED_POSITIONAL_EMBEDDINGS_SIZES
-    def __init__(self, vocab_file, merges_file, errors='replace',
+    def __init__(self, vocab_file, merges_file, errors='replace', unk_token="<|endoftext|>",
                 bos_token="<|endoftext|>", eos_token="<|endoftext|>", **kwargs):
        super(GPT2Tokenizer, self).__init__(bos_token=bos_token, eos_token=eos_token, **kwargs)
@@ -177,9 +177,7 @@ class GPT2Tokenizer(PreTrainedTokenizer):
    def _convert_token_to_id(self, token):
        """ Converts a token (str/unicode) in an id using the vocab. """
-        if token in self.encoder:
+        return self.encoder.get(token, self.encoder.get(self.unk_token))
-            return self.encoder.get(token)
-        return self.encoder.get(self.unk_token)
    def _convert_id_to_token(self, index):
        """Converts an index (integer) in a token (string/unicode) using the vocab."""