【发布时间】:2020-01-05 02:19:18
【问题描述】:
我像这样将 CSV 读入数据帧并运行 info():
dlqcsv = pd.read_csv(a1, sep=',', encoding ="ISO-8859-1", low_memory=False, index_col=False)
dd = dlqcsv.info(verbose=True)
dd.describe()
它产生:
<class 'pandas.core.frame.DataFrame'>
RangeIndex: 504334 entries, 0 to 504333
Data columns (total 288 columns):
Unnamed: 0 int64
rowno__loan float64
..... the rest of the 288 features
然后我运行以下内容来计算唯一性(从该网站窃取某人的代码)
col_uni_val={}
for i in dlqcsv.columns:
col_uni_val[i] = len(dlqcsv[i].unique())
import pprint
col_uni_val
得到了这个,太棒了
{'Unnamed: 0': 504334,
'rowno_loan': 55851,
.. the rest of the 288 pairs..
我想将详细的info 输出与unique count 输出结合起来。显然,这是一个简单的一对一唯一内连接,匹配键中没有重复。
如何调出两个表中的特征名称列?似乎都没有列名?
另外,可以直接将计数写入数据帧而不是字典吗? 谢谢你。
【问题讨论】:
标签: python pandas dataframe dictionary unique