Courseiva
Data Analysis →easyMultiple Choice

DA0-002 Data Analysis Practice Question

A data analyst is cleaning a dataset and finds missing values in a categorical variable representing customer region. Which imputation method is most appropriate?

⚠ Common exam trap

A common mix-up: candidates confuse imputation methods across data types, incorrectly applying mean or median imputation to categorical variables because they focus on central tendency without considering data type appropriateness.

Answer choices

Why each option matters

Answer the question above first, then reveal the full breakdown to understand why each option is right or wrong.

Correct answer & explanation

✓

Mode imputation

Mode imputation is the most appropriate method for a categorical variable because it replaces missing values with the most frequently occurring category, preserving the distribution of the data. Unlike mean or median imputation, which are designed for numerical data, mode imputation maintains the categorical nature of the variable and avoids introducing invalid values. This approach is simple and effective when missing data is random and the category is well-represented.

Answer analysis

Option-by-option breakdown

For each option: why learners choose it and why it is or isn't the right answer here.

  • ✗

    Drop rows with missing values

    Why it's wrong here

    Dropping rows discards entire records, reducing sample size and potentially biasing results when missingness is non-random across regions. It tempts because listwise deletion is valid when missing values are few and occur completely at random, making it a defensible quick cleanup.

  • ✓

    Mode imputation

    Why this is correct

    Mode imputation fills missing categorical entries with the variable's most frequent region, preserving the existing distribution and requiring no numeric assumptions. It suits categorical data, where mean or median imputation is meaningless, satisfying the requirement to handle missing region values sensibly.

  • ✗

    Mean imputation

    Why it's wrong here

    Mean imputation averages numeric values, which is undefined for nominal region categories; you cannot sum or divide labels like 'North' and 'South'. It tempts analysts because mean imputation is a common, quick default for missing continuous data such as age or revenue.

  • ✗

    Median imputation

    Why it's wrong here

    Median imputation requires ordered numeric values, so it cannot compute a median for nominal region labels; the stem's variable is categorical. It is tempting because median imputation is a robust standard technique for missing numerical data, such as imputing median income when values are skewed by outliers.

About these practice questions

This DA0-002 question is part of Courseiva's 1,004-question bank — original exam-style content with full explanations and wrong-answer analysis, never real exam questions or exam dumps. Learn why practice questions differ from exam dumps →

How Courseiva writes practice questions · Editorial policy

JA

Written by Johnson Ajibi, MSc IT Security

Senior Network & Security Engineer · founder of Courseiva

This DA0-002 practice question is part of Courseiva's free CompTIA certification practice question bank. Courseiva provides original exam-style practice questions with explanations, topic-based practice, mock exams, readiness tracking, and study analytics to help learners prepare for the DA0-002 exam.