【发布时间】:2016-08-22 07:01:57
【问题描述】:
我正在使用 pandas 导入一些 .dta 文件并使用 numpy/sklearn 对场景进行一些统计。我将数据称为sample 我执行以下操作:
# import neccessary packages
import pandas as pd
import numpy as np
import sklearn as skl
# import data and give a little overview (col = var1-var5, 20 rows)
sample = pd.read_stata('sample_data.dta')
print('variables in dataset')
print(sample.dtypes)
print('first 5 rows and all cols')
print(sample[0:5])
# generate a new var
var6 = sample.var1/sample.var3
如果我直接按变量名称寻址变量(var1 与 sample.var1),则会收到错误消息。我觉得总是包含sample. 有点乏味。有什么好方法可以直接通过变量名调用变量吗?
【问题讨论】:
-
var1 = sample.var1? -
我当然可以这样做..但他们不是更好的方法吗?在数据集中我有 >500 var :(
-
请注意,创建的变量一开始不会是副本,但一些修改会破坏该系列和 DataFrame 之间的关系。这是有风险的。
标签: python variables pandas error-handling