Use the following one-column dataframe,
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName('test').getOrCreate()
df = spark.createDataFrame([[1],[2],[3],[4],[5]])
df.show()
+---+
| _1|
+---+
| 1|
| 2|
| 3|
| 4|
| 5|
+---+
The compute a histogram using rdd's histogram function.
df.rdd.histogram(2)
Then I get an error: Can not generate buckets with non-number in RDD. I am confused because all values in my dataframe are numbers.
