Basic Usage of missingly¶
This notebook provides a basic walkthrough of the main features of the missingly package.
1. Creating a sample dataset¶
[1]:
import pandas as pd
import numpy as np
import missingly as mi
data = {
'A': [1, 2, np.nan, 4, 5, np.nan],
'B': [10.0, np.nan, 30.0, 40.0, 50.0, 60.0],
'C': [np.nan, np.nan, np.nan, np.nan, 100, 110]
}
df = pd.DataFrame(data)
df
[1]:
| A | B | C | |
|---|---|---|---|
| 0 | 1.0 | 10.0 | NaN |
| 1 | 2.0 | NaN | NaN |
| 2 | NaN | 30.0 | NaN |
| 3 | 4.0 | 40.0 | NaN |
| 4 | 5.0 | 50.0 | 100.0 |
| 5 | NaN | 60.0 | 110.0 |
2. Summary Functions¶
[2]:
mi.miss_var_summary(df)
[2]:
| variable | n_miss | pct_miss | |
|---|---|---|---|
| 0 | A | 2 | 33.333333 |
| 1 | B | 1 | 16.666667 |
| 2 | C | 4 | 66.666667 |
3. Visualizations¶
[3]:
mi.matrix(df)
[3]:
<Axes: >
[4]:
mi.dendrogram(df)
[4]:
<Axes: title={'center': 'Dendrogram of Variables by Missing Data Patterns'}>