I have a large corpus, no labels. I trained this corpus to get my BERT tokenizer.
Then I want to build a BertModel to do a binary classification on a labeled dataset. However, this dataset is highly imbalanced, 1: 99. So my question is:
- Does BertModel would perform well on imbalanced dataset?
- Does BertModel would perform well on small dataset? (as small as less than 500 data points, I bet it's not..)