根据另一个数据集获取数据集的子集 [英] take subset of dataset based on another dataset

查看：152 发布时间：2017/4/2 12:45:43 r dataset

本文介绍了根据另一个数据集获取数据集的子集的处理方法，对大家解决问题具有一定的参考价值，需要的朋友们下面随着小编来一起学习吧！

问题描述

假设我有一个数据集，它是dat1

  ID块图SPID TotHeight 
 1 1 1 4 44.5 
 2 1 1 4 51 
 3 1 1 4 28.7 
 4 1 1 4 24.5 
 5 1 1 4 27.3 
 6 1 1 4 20 
 17 1 10 1 44.5 
 19 1 10 1 51 
 1 1 11 21 28.7 
 2 1 11 21 24.5 
 3 1 11 21 27.3 
 4 1 11 21 20 
 5 1 11 21 12.88666667 
 6 1 11 21 7.235238095 
 7 1 11 21 1.583809524

然后我有另一个大数据集，它是dat2：

  ID块图SPID种类TotHeight 
 1 1 1 4 BENI 72 
 2 1 1 4 BENI 55 
 3 1 1 4 BENI 51 
 4 1 1 4 BENI 47 
 5 1 1 4 BENI 49 
 6 1 1 4 BENI 34 
 7 1 1 4 BENI。 
 8 1 1 4 BENI 51 
 9 1 1 4 BENI 66 
 10 1 1 4 BENI 40 
 11 1 1 4 BENI 24 
 12 1 1 4 BENI 62 
 13 1 1 4 BENI 34 
 14 1 1 4 BENI 49 
 15 1 1 4 BENI 57 
 16 1 1 4 BENI 22 
 17 1 1 4 BENI 76 
 18 1 1 4 BENI 56 
 19 1 1 4 BENI 55 
 20 1 1 4 BENI 29 
 21 1 1 4 BENI 24 
 22 1 1 4 BENI 18 
 23 1 1 4 BENI 65 
 24 1 1 4 BENI 55 
 25 1 1 4 BENI 63 
 26 1 1 4 BENI 57 
 27 1 1 4 BENI 57 
 28 1 1 4 BENI 57 
 29 1 1 4 BENI 45 
 30 1 1 4 BENI 83 
 31 1 1 4 BENI 37 
 32 1 1 4 BENI 56 
 33 1 1 4 BENI 65 
 34 1 1 4 BENI 75 
 35 1 1 4 BENI 51 
 36 1 1 4 BENI。 
 1 1 2 16 PRSE 141 
 2 1 2 16 PRSE 192 
 3 1 2 16 PRSE。 
 4 1 2 16 PRSE 197 
 5 1 2 16 PRSE 172 
 6 1 2 16 PRSE 143 
 7 1 2 16 PRSE 141 
 8 1 2 16 PRSE 155 
 9 1 2 16 PRSE 167 
 10 1 2 16 PRSE 155 
 11 1 2 16 PRSE 175 
 12 1 2 16 PRSE 190 
 13 1 2 16 PRSE 148 
 14 1 2 16 PRSE 180 
 15 1 2 16 PRSE。

我的问题是如何从dat2中获取数据的一个子集，其中ID，块和图匹配那些在dat1？如何从dat2获取数据的一个子集，其中ID，块和图与dat1不一致？

解决方案

这听起来像你想要在列ID，块和图上的合并。

假设你的数据被读取在 dat1 和 dat2 中，这应该是你想要的：

 >合并（dat1，dat2，by = c（ID，block，plot））
 ID块图SPID.x TotHeight.x SPID.y种类TotHeight.y 
 1 1 1 1 4 44.5 4 BENI 72 
 2 2 1 1 4 51.0 4 BENI 55 
 3 3 1 1 4 28.7 4 BENI 51 
 4 4 1 1 4 24.5 4 BENI 47 
 5 5 1 1 4 27.3 4 BENI 49 
 6 6 1 1 4 20.0 4 BENI 34

这实际上是对三个关注的列中的SQL术语执行内部连接。阅读帮助页面合并左，右和外连接的可能性，如果这也是感兴趣的。

完全可重复的要点这里

要获取未从 dat2合并的行，这个黑客的作品。这可能是一个更有效的方法，但是在这里。首先，添加参数 all.y = TRUE 。这指定一个正确的连接，它将从未合并的 dat2 返回行。然后，我们可以将子集，知道没有合并的行将返回 NA 的：

<$ p $子集（dat1，dat2，by = c（ID，block，plot），all.y = TRUE），is.na（SPID.x）== TRUE）

suppose I have one dataset, which is dat1

ID  block   plot    SPID    TotHeight
1   1   1   4   44.5
2   1   1   4   51
3   1   1   4   28.7
4   1   1   4   24.5
5   1   1   4   27.3
6   1   1   4   20
17  1   10  1   44.5
19  1   10  1   51
1   1   11  21  28.7
2   1   11  21  24.5
3   1   11  21  27.3
4   1   11  21  20
5   1   11  21  12.88666667
6   1   11  21  7.235238095
7   1   11  21  1.583809524

Then I have another big dataset, which is dat2:

ID  block   plot    SPID    Species TotHeight
1   1   1   4   BENI    72
2   1   1   4   BENI    55
3   1   1   4   BENI    51
4   1   1   4   BENI    47
5   1   1   4   BENI    49
6   1   1   4   BENI    34
7   1   1   4   BENI    .
8   1   1   4   BENI    51
9   1   1   4   BENI    66
10  1   1   4   BENI    40
11  1   1   4   BENI    24
12  1   1   4   BENI    62
13  1   1   4   BENI    34
14  1   1   4   BENI    49
15  1   1   4   BENI    57
16  1   1   4   BENI    22
17  1   1   4   BENI    76
18  1   1   4   BENI    56
19  1   1   4   BENI    55
20  1   1   4   BENI    29
21  1   1   4   BENI    24
22  1   1   4   BENI    18
23  1   1   4   BENI    65
24  1   1   4   BENI    55
25  1   1   4   BENI    63
26  1   1   4   BENI    57
27  1   1   4   BENI    57
28  1   1   4   BENI    57
29  1   1   4   BENI    45
30  1   1   4   BENI    83
31  1   1   4   BENI    37
32  1   1   4   BENI    56
33  1   1   4   BENI    65
34  1   1   4   BENI    75
35  1   1   4   BENI    51
36  1   1   4   BENI    .
1   1   2   16  PRSE    141
2   1   2   16  PRSE    192
3   1   2   16  PRSE    .
4   1   2   16  PRSE    197
5   1   2   16  PRSE    172
6   1   2   16  PRSE    143
7   1   2   16  PRSE    141
8   1   2   16  PRSE    155
9   1   2   16  PRSE    167
10  1   2   16  PRSE    155
11  1   2   16  PRSE    175
12  1   2   16  PRSE    190
13  1   2   16  PRSE    148
14  1   2   16  PRSE    180
15  1   2   16  PRSE    .

My question is how can I take a subset of data from dat2 in which ID, block and plot match those in dat1? And how can I get a subset of data from dat2 in which ID, block and plot do not match those in dat1?

解决方案

It sounds like you want a merge on the columns ID, block, and plot.

Assuming your data are read in named dat1 and dat2, this should be what you want:

> merge(dat1, dat2, by = c("ID", "block", "plot"))
  ID block plot SPID.x TotHeight.x SPID.y Species TotHeight.y
1  1     1    1      4        44.5      4    BENI          72
2  2     1    1      4        51.0      4    BENI          55
3  3     1    1      4        28.7      4    BENI          51
4  4     1    1      4        24.5      4    BENI          47
5  5     1    1      4        27.3      4    BENI          49
6  6     1    1      4        20.0      4    BENI          34

This essentially performs an inner join in SQL terms on the three columns of interest. Read the help page for merge for left, right, and outer join possibilities if that is also of interest.

Fully reproducible gist here

To get the rows that didn't merge from dat2, this hack works. There is probably a more efficient way to do this, but here it is. First, add the parameter all.y = TRUE. This specifies a right join which will return rows from dat2 which did not merge. Then we can subset on that knowing that the rows that didn't merge will return NA's:

subset(merge(dat1, dat2, by = c("ID", "block", "plot"), all.y = TRUE), is.na(SPID.x) == TRUE)

这篇关于根据另一个数据集获取数据集的子集的文章就介绍到这了，希望我们推荐的答案对大家有所帮助，也希望大家多多支持IT屋！

查看全文

根据另一个数据集获取数据集的子集 [英] take subset of dataset based on another dataset

问题描述

相关文章

其他数据库最新文章

热门教程

热门工具

登录关闭

根据另一个数据集获取数据集的子集 [英] take subset of dataset based on another dataset

问题描述

相关文章

其他数据库最新文章

热门教程

热门工具

登录 关闭

登录关闭