R model.matrix 在所有列中使用相同的因子集

标签 r dummy-data model.matrix

我有一组包含五列的篮球阵容数据,每列共享相同的因子,如下所示:

head(dat)
              V1             V2            V3            V4              V5
1   MILES,KEATON KINGSLEY,MOSES  BELL,ANTHLON HANNAHS,DUSTY   DURHAM,JABRIL
2   MILES,KEATON KINGSLEY,MOSES  BELL,ANTHLON HANNAHS,DUSTY   DURHAM,JABRIL
3 KINGSLEY,MOSES   BELL,ANTHLON HANNAHS,DUSTY DURHAM,JABRIL   THOMPSON,TREY
4 KINGSLEY,MOSES   BELL,ANTHLON HANNAHS,DUSTY THOMPSON,TREY     BEARD,ANTON
5  THOMPSON,TREY    BEARD,ANTON KOUASSI,WILLY   WHITT,JIMMY WATKINS,MANUALE
6  THOMPSON,TREY    BEARD,ANTON KOUASSI,WILLY   WHITT,JIMMY WATKINS,MANUALE

我想要做的是让每一行成为该行上显示的当前因素的虚拟编码,如下所示:

MILES,KEATON  KINGSLEY,MOSES  BELL,ANTHLON  HANNAHS,DUSTY  DURHAM,JABRIL THOMPSON,TREY  BEARD,ANTON  KOUASSI,WILLY  WHITT,JIMMY  WATKINS,MANUALE
           1               1             1              1              1             0            0               0             0               0
           1               1             1              1              1             0            0               0             0               0
           0               1             1              1              1             1            0               0             0               0

但是,model.matrix 似乎只有一列的范围;它不允许我跨多个列共享整个因子集。根据[此线程][1]中的一些建议,我尝试了:

df <- as.data.frame(lapply(dat,as.factor))
fList <- lapply(names(df),reformulate,intercept=FALSE)
mList <- lapply(fList,sparse.model.matrix,data=df)
br <- do.call(cBind,mList)
head(br)
6 x 31 sparse Matrix of class "dgCMatrix"
   [[ suppressing 31 column names ‘V1BEARD,ANTON’, ‘V1BELL,ANTHLON’, ‘V1KINGSLEY,MOSES’ ... ]]

1 . . . 1 . . . . 1 . . 1 . . . . . . 1 . . . . . . 1 . . . . .
2 . . . 1 . . . . 1 . . 1 . . . . . . 1 . . . . . . 1 . . . . .
3 . . 1 . . . 1 . . . . . . 1 . . . 1 . . . . . . . . . . . 1 .
4 . . 1 . . . 1 . . . . . . 1 . . . . . . . 1 . . 1 . . . . . .
5 . . . . 1 1 . . . . . . . . 1 . . . . . . . . 1 . . . . . . 1
6 . . . . 1 1 . . . . . . . . 1 . . . . . . . . 1 . . . . . . 1

它结合了列名称和因子名称。我该怎么办?

最佳答案

我们可以尝试使用 qdapTools 中的 mtabulate

library(qdapTools)
mtabulate(as.data.frame(t(df1)))
# BELL,ANTHLON DURHAM,JABRIL HANNAHS,DUSTY KINGSLEY,MOSES MILES,KEATON THOMPSON,TREY BEARD,ANTON KOUASSI,WILLY
#1            1             1             1              1            1             0           0             0
#2            1             1             1              1            1             0           0             0
#3            1             1             1              1            0             1           0             0
#4            1             0             1              1            0             1           1             0
#5            0             0             0              0            0             1           1             1
#6            0             0             0              0            0             1           1             1
#  WATKINS,MANUALE WHITT,JIMMY
#1               0           0
#2               0           0
#3               0           0
#4               0           0
#5               1           1
#6               1           1

或者使用基础R

 table(rep(1:nrow(df1), ncol(df1)), unlist(df1))

关于R model.matrix 在所有列中使用相同的因子集,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/38413194/

相关文章:

r - 在 ROC 曲线上添加 pch 并标记 AUC 值

r - 我如何知道我在 ggplot 中使用的颜色代码以添加具有相同颜色的垂直线?

c# - 创建一个 "dummy record"来强制数据库服从业务逻辑,是好主意还是愚蠢的主意?

sonarqube - 为 SonarQube 生成虚拟数据

r - 尝试在测试数据集上使用 model.matrix 函数

r - 警告消息-虚拟包中的假人

r - 多个图例的标题与 ggplot2 中的位置 ="bottom"不对齐

Rmarkdown保留.tex文件

sql - 用虚拟数据填充 SQL 表的最快方法

r - model.matrix 如何为交互项选择级别