Skip to content
L
LearnCoachAssist
Topics
AI
AI Agents (500 Questions)
AI Math (500 Questions)
AI Math Beginner
AI Search Results
Claude Code Prompts
Art & Design
Art History
Color Theory
Graphic Design Principles
Knitting And Crochet
Photography Exposure Triangle And Composition
Business
Accounting Basics
Customer Research
Economics
Excel Formulas For Financial Analysts
Go To Market Strategy
Browse all topics →
Packs
Featured Packs
Python Programming Essentials
Prompt Engineering
Prompting Claude Code
AI Agents and Autonomous Systems
SQL and Database Fundamentals
JavaScript Fundamentals
Algorithms and Data Structures
Git and Version Control
Browse all packs →
Learn
Learning Paths
AI Deck Generator
How it works
Quiz
Blog
Cheat Sheets
Pricing
Resources
Pricing
Compare
FAQ
About
Contact
Effective Studying Guide
Free Anki Decks
Log in
Start Free
Topics
AI
AI Agents (500 Questions)
AI Math (500 Questions)
AI Math Beginner
AI Search Results
Claude Code Prompts
Art & Design
Art History
Color Theory
Graphic Design Principles
Knitting And Crochet
Photography Exposure Triangle And Composition
Business
Accounting Basics
Customer Research
Economics
Excel Formulas For Financial Analysts
Go To Market Strategy
Browse all topics →
Packs
Python Programming Essentials
Prompt Engineering
Prompting Claude Code
AI Agents and Autonomous Systems
SQL and Database Fundamentals
JavaScript Fundamentals
Algorithms and Data Structures
Git and Version Control
Browse all packs →
Learn
Learning Paths
AI Deck Generator
How it works
Quiz
Blog
Cheat Sheets
Pricing
Resources
Pricing
Compare
FAQ
About
Contact
Effective Studying Guide
Free Anki Decks
Start Free
Log in
← Quit
Data Science Essentials Practice Exam
Question
1
of
50
60:00
Question 1
Data Science Essentials
What is naive Bayes?
A probabilistic classifier assuming feature independence.
An interactive plotting library.
Crafting narratives around data to influence decisions.
Data Build Tool — transforms data in warehouses with SQL and Jinja.
Question 2
Data Science Essentials
What is Goodhart's Law in ML?
A distributed computing engine for large-scale data processing.
A hybrid combining lake and warehouse paradigms (Delta, Iceberg).
Converts logits to a probability distribution.
"When a measure becomes a target, it ceases to be a good measure."
Question 3
Data Science Essentials
What is a data lakehouse?
Natural Language Processing — analyzing and generating text.
A heuristic to choose the number of clusters by plotting cost vs k.
Uniform Manifold Approximation and Projection — fast, scalable dimensionality reduction.
A hybrid combining lake and warehouse paradigms (Delta, Iceberg).
Question 4
Data Science Essentials
What is mean absolute error (MAE)?
Comparing two versions of a treatment to measure causal impact.
Using prior beliefs updated with data via Bayes' theorem.
Combining L1 and L2 regularization.
Average of absolute differences between predicted and actual values.
Question 5
Data Science Essentials
What is tokenization?
A plot of precision vs. recall at various thresholds, useful for imbalanced data.
Splitting text into smaller units (words, subwords, characters).
Changes in the distribution of input data over time.
A function applied to a neuron's output, e.g., ReLU, sigmoid, tanh.
Question 6
Data Science Essentials
What is Power BI?
Microsoft's business intelligence platform.
Boosting that fits new models to residuals using gradient descent.
Combining rows from multiple tables based on related columns.
Online Transaction Processing — high-volume, short transactions.
Question 7
Data Science Essentials
What is Apache Airflow?
A workflow orchestration platform.
A Python plotting library.
Generating new training examples by transforming existing ones.
A measurable property or characteristic used as input to a model.
Question 8
Data Science Essentials
What is LSTM?
Balancing error from oversimplification (bias) and overcomplexity (variance).
Long Short-Term Memory — an RNN handling long dependencies.
A library for creating ML model demos as web apps.
Choosing the most relevant features for a model.
Question 9
Data Science Essentials
What is the data science process?
An open-source data validation framework.
Error from sensitivity to small fluctuations in training data.
A hybrid combining lake and warehouse paradigms (Delta, Iceberg).
Problem definition → data collection → cleaning → exploration → modeling → evaluation → deployment.
Question 10
Data Science Essentials
What is equalized odds?
Adding squared coefficients to the loss; shrinks all coefficients.
A fairness criterion: equal true positive and false positive rates across groups.
Querying and manipulating relational databases.
Creating new features from raw data to improve model performance.
Question 11
Data Science Essentials
What is cross-entropy loss?
A loss function for classification measuring distance between probability distributions.
Methods for tracking changes in dimension data over time.
A storage system for raw, unstructured, and structured data at scale.
Reducing words to their root form (e.g., "running" → "run").
Question 12
Data Science Essentials
What is a window function?
A measure of impurity or randomness in a dataset.
Online Transaction Processing — high-volume, short transactions.
SQL function performing calculations across related rows.
Natural Language Processing — analyzing and generating text.
Question 13
Data Science Essentials
What is data science?
Learning by taking actions and receiving rewards/penalties.
A normalized variant of star schema.
An interdisciplinary field using statistics, programming, and domain knowledge to extract insights from data.
An open-source platform for ML lifecycle management.
Question 14
Data Science Essentials
What is recall?
Combining tables for query performance, accepting redundancy.
Methods for tracking changes in dimension data over time.
True positives / (true positives + false negatives).
A Python plotting library.
Question 15
Data Science Essentials
What is TF-IDF?
The fraction of predictions that are correct.
Term Frequency-Inverse Document Frequency — weights words by importance.
Locating and classifying objects within images.
A plot of precision vs. recall at various thresholds, useful for imbalanced data.
Question 16
Data Science Essentials
What is concept drift?
Splitting data into folds and rotating test sets to estimate model performance.
Changes in the relationship between inputs and outputs.
Methods for tracking changes in dimension data over time.
A fairness criterion: similar outcome rates across groups.
Question 17
Data Science Essentials
What is Bayesian optimization?
A table storing measurable events in a data warehouse.
True positives / (true positives + false positives).
Normalizing inputs to a layer to stabilize and accelerate training.
Using probabilistic models to choose hyperparameters efficiently.
Question 18
Data Science Essentials
What is a perceptron?
A single-layer neural network unit performing linear classification.
Extreme Gradient Boosting — a highly efficient implementation.
The output a model tries to predict.
Bidirectional Encoder Representations from Transformers — language model.
Question 19
Data Science Essentials
What is normalization (database)?
Difficulties (sparsity, distance loss) when working in high-dimensional space.
Organizing tables to reduce redundancy.
Training models on decentralized data without centralizing it.
The harmonic mean of precision and recall.
Question 20
Data Science Essentials
What is ReLU?
A model serving system optimized for TensorFlow models.
Boosting that fits new models to residuals using gradient descent.
Synthetic Minority Over-sampling Technique — generates synthetic minority examples.
Rectified Linear Unit — max(0, x); a common activation function.
Question 21
Data Science Essentials
What is stratified k-fold?
Detecting and correcting errors in data: missing values, duplicates, outliers.
Microsoft's business intelligence platform.
A document defining data fields and their meanings.
K-fold preserving class proportions in each fold.
Question 22
Data Science Essentials
What is a Type 2 SCD?
Probability of observing data at least as extreme assuming null hypothesis is true.
A metadata inventory of data assets in an organization.
Balancing error from oversimplification (bias) and overcomplexity (variance).
Maintaining history by adding new rows for changes.
Question 23
Data Science Essentials
What is Apache Kafka?
Reducing the number of features while preserving information.
A distributed streaming platform for real-time data.
Extract, Load, Transform — modern variant doing transformation in the warehouse.
Converts logits to a probability distribution.
Question 24
Data Science Essentials
What is image segmentation?
Partitioning images into meaningful regions.
Statistical procedure to evaluate a claim about a population.
Assigning labels to images.
Cross-validation with k folds.
Question 25
Data Science Essentials
What is NLP?
Natural Language Processing — analyzing and generating text.
A function measuring how wrong a model's predictions are.
A model too simple to capture data patterns.
An open-source platform for ML lifecycle management.
Question 26
Data Science Essentials
What is boosting?
Adding squared coefficients to the loss; shrinks all coefficients.
An interactive plotting library.
An algorithm producing word embeddings from co-occurrence.
Sequentially training models, each correcting errors of the previous.
Question 27
Data Science Essentials
What is MLOps?
A non-parametric algorithm classifying based on closest training examples.
Operationalizing machine learning: deployment, monitoring, retraining.
A measure of impurity or randomness in a dataset.
An optimization algorithm that iteratively minimizes a loss function.
Question 28
Data Science Essentials
What is data quality monitoring?
Values absent from a dataset, often coded as NaN or NULL.
Training models on decentralized data without centralizing it.
Continuously checking data for anomalies and issues.
Common words filtered out (e.g., "the", "is").
Question 29
Data Science Essentials
What is grid search?
An ensemble of decision trees with bagging.
Error from sensitivity to small fluctuations in training data.
Systematic skew in data leading to unfair models.
Exhaustively trying combinations of hyperparameters.
Question 30
Data Science Essentials
What is gradient descent?
Rectified Linear Unit — max(0, x); a common activation function.
An optimization algorithm that iteratively minimizes a loss function.
A statistical measure of linear association between variables.
A normalized variant of star schema.
Question 31
Data Science Essentials
What is target encoding?
Replacing a category with the target mean for that category.
A hybrid combining lake and warehouse paradigms (Delta, Iceberg).
Generating predictions on bulk data at scheduled intervals.
Learning by taking actions and receiving rewards/penalties.
Question 32
Data Science Essentials
What is storytelling with data?
Deploying a model to make predictions available.
Crafting narratives around data to influence decisions.
A fast gradient boosting framework by Microsoft.
A trend that reverses when groups are aggregated.
Question 33
Data Science Essentials
What is R's role in data science?
A statistical programming language popular in academia and finance.
Online Analytical Processing — multi-dimensional analytical queries.
Bootstrap Aggregating — training models on bootstrap samples and averaging.
Generating predictions on bulk data at scheduled intervals.
Question 34
Data Science Essentials
What is an outlier?
A data point significantly different from others.
Reducing words to dictionary form considering context.
A metric for cluster quality measuring cohesion and separation.
An interdisciplinary field using statistics, programming, and domain knowledge to extract insights from data.
Question 35
Data Science Essentials
What is Databricks?
A unified analytics platform built on Spark.
Sequentially training models, each correcting errors of the previous.
A Python library for quickly building data apps.
Recommendations based on item attributes.
Question 36
Data Science Essentials
What is data quality?
The fitness of data for its intended use.
Predicting a categorical output.
Crafting narratives around data to influence decisions.
Error from sensitivity to small fluctuations in training data.
Question 37
Data Science Essentials
What is a word embedding?
The ability to understand a system's internal state from external outputs.
A dense vector representation of a word capturing semantics.
Combining L1 and L2 regularization.
Predicting a continuous numeric output.
Question 38
Data Science Essentials
What is TensorFlow Serving?
A single-layer neural network unit performing linear classification.
SHapley Additive exPlanations — explains model predictions via game theory.
A measure of impurity or randomness in a dataset.
A model serving system optimized for TensorFlow models.
Question 39
Data Science Essentials
What is early stopping?
Generative Pretrained Transformer — autoregressive language model.
Halting training when validation performance stops improving.
Scientists analyze and model; engineers build pipelines and infrastructure.
Systematic skew in data leading to unfair models.
Question 40
Data Science Essentials
What is exploratory data analysis (EDA)?
Tracking the origin and transformations of data.
Initial investigation of data to discover patterns, anomalies, hypotheses.
Predicting a categorical output.
A distributed computing engine for large-scale data processing.
Question 41
Data Science Essentials
What is silhouette score?
Changes in the distribution of input data over time.
A plot of precision vs. recall at various thresholds, useful for imbalanced data.
A metric for cluster quality measuring cohesion and separation.
The fitness of data for its intended use.
Question 42
Data Science Essentials
What is ETL?
Extract, Transform, Load — moving and shaping data.
A single-layer neural network unit performing linear classification.
Cross-validation with k folds.
A trend that reverses when groups are aggregated.
Question 43
Data Science Essentials
What is Gini impurity?
Partitioning images into meaningful regions.
Splitting data into folds and rotating test sets to estimate model performance.
When information from outside the training data influences model training, inflating performance.
A measure of impurity used in CART decision trees.
Question 44
Data Science Essentials
What is the sigmoid function?
The structure of a database or dataset, including columns and types.
Insights only matter if stakeholders understand and can act on them.
Detecting and correcting errors in data: missing values, duplicates, outliers.
1 / (1 + e^-x); squashes output to (0, 1).
Question 45
Data Science Essentials
What is MLflow?
Boosting that fits new models to residuals using gradient descent.
An open-source platform for ML lifecycle management.
A table storing measurable events in a data warehouse.
Initial investigation of data to discover patterns, anomalies, hypotheses.
Question 46
Data Science Essentials
What is CatBoost?
Scaling features to a common range, e.g., [0, 1].
A gradient boosting library handling categorical features natively.
Ensuring models don't systematically disadvantage protected groups.
A distributed computing engine for large-scale data processing.
Question 47
Data Science Essentials
What is confounding?
A variable affecting both predictor and outcome, biasing the relationship.
The output a model tries to predict.
Local Interpretable Model-agnostic Explanations — explains individual predictions.
A unique identifier for each row in a table.
Question 48
Data Science Essentials
What is hierarchical clustering?
Building nested clusters via agglomerative or divisive approaches.
The degree to which a human can understand a model's decisions.
A non-parametric algorithm classifying based on closest training examples.
Partitioning data into k clusters by minimizing within-cluster variance.
Question 49
Data Science Essentials
How to detect outliers?
Z-scores, IQR, boxplots, isolation forests.
Tracking changes to datasets like code versioning.
When one class has many more examples than others.
Resampling with replacement to estimate sampling distributions.
Question 50
Data Science Essentials
What is model drift?
Combining L1 and L2 regularization.
Bidirectional Encoder Representations from Transformers — language model.
Degradation of model performance over time due to data changes.
The dominant language with libraries like NumPy, pandas, scikit-learn, TensorFlow.
Question navigator
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
← Previous
Next →
✅ Submit Exam