Netflix Movies & TV Shows Analysis
Analyze the Netflix titles dataset to answer:
- Movies vs TV shows split
- Top countries producing content
- Content additions per year
- Popular genres/categories
Analysis pipeline
Section titled “Analysis pipeline”flowchart LR A["Raw titles
(CSV)"] --> B["Clean
(parse dates, split country/genre)"] B --> C["Explode
(one row per country/genre)"] C --> D["Visualize
(type split, top countries, yearly adds)"] D --> E["Conclude
(catalog trends)"]
Common columns (Netflix titles dataset)
Section titled “Common columns (Netflix titles dataset)”type(Movie/TV Show)title,director,castcountry,date_added,release_yearrating,duration,listed_in
Step 1: Load and parse dates
Section titled “Step 1: Load and parse dates”import pandas as pd
df = pd.read_csv("data/netflix_titles.csv")
if "date_added" in df.columns:
df["date_added"] = pd.to_datetime(df["date_added"], errors="coerce")
print(df.shape)
print(df.head())Step 2: Clean multi-valued country/genre
Section titled “Step 2: Clean multi-valued country/genre”The dataset often stores multiple values separated by commas.
# Countries
if "country" in df.columns:
countries = (
df.dropna(subset=["country"])
.assign(country=df["country"].str.split(","))
.explode("country")
)
countries["country"] = countries["country"].str.strip()
# Genres
if "listed_in" in df.columns:
genres = (
df.dropna(subset=["listed_in"])
.assign(genre=df["listed_in"].str.split(","))
.explode("genre")
)
genres["genre"] = genres["genre"].str.strip()Step 3: Movies vs TV shows
Section titled “Step 3: Movies vs TV shows”import seaborn as sns
import matplotlib.pyplot as plt
plt.figure(figsize=(6, 4))
sns.countplot(data=df, x="type")
plt.title("Movies vs TV Shows")
plt.tight_layout()
plt.show()Step 4: Top countries
Section titled “Step 4: Top countries”import seaborn as sns
import matplotlib.pyplot as plt
if "country" in df.columns:
top_c = countries["country"].value_counts().head(10).reset_index()
top_c.columns = ["country", "count"]
plt.figure(figsize=(10, 4))
sns.barplot(data=top_c, x="count", y="country")
plt.title("Top 10 countries by number of titles")
plt.tight_layout()
plt.show()Step 5: Additions over time
Section titled “Step 5: Additions over time”import matplotlib.pyplot as plt
if "date_added" in df.columns:
yearly = df.dropna(subset=["date_added"]).groupby(df["date_added"].dt.year).size()
plt.figure(figsize=(8, 4))
plt.plot(yearly.index, yearly.values, marker="o")
plt.title("Titles added by year")
plt.xlabel("Year")
plt.ylabel("Count")
plt.tight_layout()
plt.show()Visualize it
Section titled “Visualize it”Deliverable
Section titled “Deliverable”Summarize 5–10 insights:
- Which type dominates?
- Which countries dominate?
- Any clear growth periods?
- Which genres show up most?
🧪 Try It Yourself
Section titled “🧪 Try It Yourself”Exercise 1 – Split a multi-value column
Section titled “Exercise 1 – Split a multi-value column”Exercise 2 – Explode into one row per value
Section titled “Exercise 2 – Explode into one row per value”Exercise 3 – Titles added per year
Section titled “Exercise 3 – Titles added per year”pch.coffeeTagline
pch.coffeeCtapch.feedbackHeading
pch.feedbackSubheading