I have the following data imported into PySpark dataframe:
from pyspark.sql import SparkSession
from pyspark.sql.functions import *
from pyspark.sql.types import *
spark = SparkSession.builder.master("local[4]").appName("pyspark").getOrCreate()
df = spark.read.csv("example.csv")
df.show()
#+--+------+
#|id|answer|
#+--+------+
#| 1|a |
#| 1|b |
#| 2|c |
#| 2|d |
#| 3|e |
#| 4|f |
#| 4|g |
#+--+------+
Some id might have duplicated, some might not. I would like to have the following output:
+--+------+------+
|id|first |second|
+--+------+------+
| 1|a |b |
| 2|c |d |
| 3|e |Null |
| 4|f |g |
+--+------+------+