A collection of Apache Spark programs and practical examples created for learning and practicing Spark concepts using Scala.
This repository focuses specifically on Apache Spark and its commonly used APIs and operations for data processing.
- SparkSession
- SparkContext
- RDD basics
- Spark architecture and execution concepts
- Creating DataFrames
- Selecting columns
- Filtering data
- Adding and modifying columns
- Renaming columns
- Dropping columns
- Removing duplicate records
- Sorting data
- Combining DataFrames
select()filter()where()withColumn()withColumnRenamed()drop()distinct()dropDuplicates()union()- Other commonly used DataFrame transformations
show()count()collect()first()take()- Other commonly used Spark actions
groupBy()agg()sum()min()max()avg()count()
- Inner Join
- Left Join
- Right Join
- Full Outer Join
- Left Semi Join
- Left Anti Join
- Cross Join
row_number()rank()dense_rank()lag()lead()- Window specifications and partitioning
when()/otherwise()- String functions
- Date and timestamp functions
- Null handling functions
- Mathematical functions
- Other commonly used Spark functions
- Creating temporary views
- Running SQL queries using Spark
- SQL-based DataFrame processing
This repository is created to:
- Practice Apache Spark programming
- Understand Spark DataFrame operations
- Learn transformations and actions
- Practice aggregations and joins
- Work with Spark window functions
- Strengthen practical Spark skills
- Prepare for Apache Spark and Big Data development roles
- Apache Spark
- Scala
Ajay Somarthy