Я хотел бы заменить значения na в моем столбце df наиболее распространенным значением по группе.
#Ex:
df <- data.frame(Home_Abbr = c('PHI', 'PHI', 'DAL', 'PHI'),
Home_City = c('Philadelphia', 'Philadelphia', 'Dallas', NULL))
#Desired Result
Home_Abbr Home_City
PHI Philadelphia
PHI Philadelphia
DAL Dallas
PHI Philadelphia
Вот что я пробовал до сих пор:
df <- df %>%
group_by(Home_Abbr) %>%
mutate(Home_City = names(which.max(table(Home_City))))
Но когда я запускаю это, я получаю сообщение об ошибке «Невозможно объединить результаты NULL и не NULL».
Мы можем использовать функцию Mode
Mode <- function(x) {
ux <- unique(x)
ux[which.max(tabulate(match(x, ux)))]
}
а потом replace
library(dplyr)
df %>%
group_by(Home_Abbr) %>%
mutate(Home_City = replace(Home_City, is.na(Home_City),
Mode(Home_City))) %>%
ungroup
-выход
# A tibble: 4 × 2
Home_Abbr Home_City
<chr> <chr>
1 PHI Philadelphia
2 PHI Philadelphia
3 DAL Dallas
4 PHI Philadelphia
df <- structure(list(Home_Abbr = c("PHI", "PHI", "DAL", "PHI"), Home_City = c("Philadelphia",
"Philadelphia", "Dallas", NA)), class = "data.frame", row.names = c(NA,
-4L))
NA
отсутствует значение, а неNULL