I looking for solution but can't find anything working.
So I have a txt file. It's looks like this:
geneName1, sampleName1, Allel, allel2, 055, 33, tumor
geneName2, sampleName1, Allel, allel2, 321, 1, ntn
geneName3, sampleName1, Allel, allel2, 32, 44, ddd
geneName4, sampleName1, Allel, allel2, 123, 2, aga2
geneName1, sampleName2, Allel, allel2, 01255, 23, tumorD
geneName2, sampleName2, Allel, allel2, 33, 1, ad2
geneName1, sampleName3, Allel, allel2, yyu
geneName2, sampleName3, Allel, allel2, hhf
geneName4, sampleName3, Allel, allel2, vgv
geneName5, sampleName3, Allel, allel2, aga5
And it's don't have a header. But for clear:
nameOfGene, sampleNumber, Allel1, Allel2, GS1, GS2, descr
Do as u can see some lines has not GS1, GS2 data, but all have a descr.
All what I need is [nameOfGene,sampleNumber,Allel1,Allel2,descr]
And that's the problem. I tried many solution from internet but can't solve it.
I tried to modify usecols=[] parameter in pd.read_csv to usecols=[0,1,2,3,4,:-1], but pandas don't understand something like that and I got olny syntax error.
I tried read whole df but then desc is readed as GS1 (if GS1 is not in line).
I tried concat, but result is the same like above, and when line don't have GS1 the desc is loaded as GS1, and next to cols are 0 or NaN.
Maybe I just ommit something and exist good solution to solve that problem?