Kmeans PySpark ndarray

Viewed 25

I'm trying to implement KMeans by PySpark feeding with a ndarray of dimensions: (289, 768). But when call KMEANS.fit, an error occurs:

text = np.array(df_low_conf.select("text").collect()).reshape(-1)
model = SentenceTransformer('neuralmind/bert-base-english-cased')
sentence_embeddings = model.encode(text)

kmeans = KMeans(k = num_clusters, initMode = 'k-means||', maxIter= 2000, initSteps = 10) 
model = kmeans.fit(sentence_embeddings)

'numpy.ndarray' object has no attribute '_jdf'

Is it possible in PySpark? Because I tried on pandas and it was fine. If you have any advice or tip, please send me a message.

0 Answers
Related