【问题标题】:R to Python subsetting via vector通过向量 R 到 Python 子集
【发布时间】:2015-02-16 17:49:27
【问题描述】:

我是 python 新手,但有一些 R 经验。在 R 中,如果我想对 data.frame 进行子集化,我可以使用变量来执行以下操作:

# Columns

# Assign column names to variable
colsToUse <- c('col1','col2','col3')

# Use variable to subset
df2 <- df1[,colsToUse]

# Rows

# Assign column names to variable
rowsToUse <- sample(1:nrows(df1), 500)

# Use variable to subset
df3 <- df1[rowsToUse,]

我将如何在 python 中做到这一点?

【问题讨论】:

  • 你打算在 Python 中使用什么样的数据结构?列表?数组?您想按索引还是按值进行子集化?
  • @CactusWoman:Pandas/Numpy - 最终目标是 scikit-learn。我正在尝试创建测试/训练子集。

标签: python r pandas subset


【解决方案1】:

基于您对pandas的声明使用

colsToUse = ['col1', 'col2', 'col3']
rowsToUse = np.random.choice(range(len(df1)), 500)

df2 = df1.ix[:, colsToUse]
df3 = df1.ix[rowsToUse, :]

还有其他一些用于索引的DataFrame 辅助函数:df1.locdf1.ilocdf1.xs

查看NumPy for MATLAB Users 指南也很有帮助,它也经常回答 R 用户的问题,至少在处理 numpy.ndarray 时是这样)。

【讨论】:

    猜你喜欢
    • 2020-02-16
    • 1970-01-01
    • 1970-01-01
    • 2016-12-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多