【问题标题】:Complement of Pandas Dataframe SamplePandas 数据框示例的补充
【发布时间】:2017-10-10 17:36:04
【问题描述】:
import pandas as pd

df = pd.read_csv("train.csv")

sample = df.sample(10)

sample.to_csv("train_subset.csv")

我想从给定的 csv 文件 (train.csv) 中抽取 10 个随机行并将其存储为新的 csv 文件 train_subset.csv。 上面的代码实现了这一点。现在我还想将所有未采样的行存储到文件 train_remaining.csv 中。

我该如何实现呢?如何找到采样的行?

【问题讨论】:

标签: python csv pandas dataframe


【解决方案1】:

我建议使用 sklearns train_test_split。

http://scikit-learn.org/stable/modules/generated/sklearn.model_selection.train_test_split.html

这将允许您获取随机选择的行的百分比。

【讨论】:

  • 您能否更明确地告诉我如何使用它?我对文档感到困惑。 @格雷格
  • 'import pandas as pd from sklearn.model_selection import train_test_split df = pd.read_csv("train.csv") X = df['features_used_to_predict'] y = df['thing_being_predicted'] X_train, X_test , y_train, y_test = train_test_split(X, y, test_size=0.33, random_state=42)' 如果需要,您可以连接测试信息以获取数据子集。
猜你喜欢
  • 1970-01-01
  • 2022-06-13
  • 1970-01-01
  • 1970-01-01
  • 2015-04-09
  • 2013-06-10
  • 2023-04-08
  • 2018-05-21
  • 2015-09-04
相关资源
最近更新 更多