Here's my first dataframe df1
Id Text
1 Asoy Geboy Ngebut
2 Asoy kita Geboy
3 Bersatu kita Teguh
Here's my second dataframe df2
Id Text
1 Bersatu Kita
2 Asoy Geboy Jalanan
Similarity Matrix, columns is Id from df1, rows is Id from df2
1 2 3
1 0 0.33 1
2 0.66 0.66 0
Note:
0 value in (1,1) and (3,2) because no text similar
1 value in (3,1) is because of Bersatu and Kita' (Id 1ondf2is avalilable in Id3ondf1`
0.33 is counted because of 1 of 3 words similar
0.66 is counted because of 2 of 3 words similar