Program Curriculum

🔹 Module 1: Introduction to Big Data & Analytics

  • What is Big Data? (5 Vs: Volume, Variety, Velocity, Veracity, Value)
  • Role of a Data Analyst vs Data Scientist vs Data Engineer
  • Big Data Analytics Lifecycle & Data-Driven Decision Making

🔹 Module 2: Data Handling with SQL

  • Writing SQL Queries: Filtering, Sorting, Aggregating Data
  • Advanced SQL: Joins, Subqueries, CTEs, Window Functions
  • Data Cleaning using SQL

🔹 Module 3: Python for Data Analysis

  • Python Basics & Libraries: Pandas, NumPy
  • Working with CSV, Excel, and JSON Data
  • Data Wrangling, Transformation, Aggregation and Grouping

🔹 Module 4: Data Visualization & Reporting

  • Principles of Visual Storytelling
  • Tableau: Dashboards, Charts, Filters, Parameters, Calculated Fields
  • Power BI (Intro level)

🔹 Module 5: Statistics for Data Analysis

  • Descriptive Statistics: Mean, Median, Mode, Variance
  • Data Distributions & Histograms
  • Hypothesis Testing and Confidence Intervals

🔹 Module 6: Business Analytics Applications

  • KPI Definition and Tracking
  • Customer Segmentation
  • Sales, Marketing, & Financial Data Analysis
  • Case Studies in Retail, Finance, Healthcare

🔹 Module 7: Big Data Tools & Ecosystem Overview

  • Introduction to Hadoop & HDFS (High-Level)
  • Basics of Apache Spark for Analysts
  • Using SparkSQL for querying Big Data

🔹 Module 8: Excel for Analysts (Optional/Bridge Module)

  • Advanced Functions (VLOOKUP, INDEX-MATCH)
  • Pivot Tables and Dashboards

🔹 Module 9: Capstone Project

  • A real-world analytics project to collect, clean, analyze, and visualize data, presenting findings in a business context.

🛠️ Tools & Technologies Covered

Languages:

SQL, Python

Libraries:

Pandas, NumPy, Matplotlib, Seaborn

Visualization:

Tableau, (Power BI – intro)

Databases:

MySQL / PostgreSQL

Big Data (Intro):

Hadoop, SparkSQL

Other:

Excel, Jupyter Notebook

```