【发布时间】:2019-03-01 16:41:22
【问题描述】:
我有一个 .txt 文件,其中包含文本数据和数字数据。文件的前两行有文本数据形式的基本信息,而第一列(我将第零列称为第一列)也有文本形式的基本数据。在文件中的所有其他位置,数据都是数字形式。我希望使用 python 中的库来分析文件中存在的数值数据,最好是 numpy 或 pandas,或两者的组合(回归、相关性、scikit-learn 等分析)。我重申文件中的所有数据对于我的分析都是必不可少的。以下快照(取自 Excel)显示了我的数据所在格式的截断版本:
此快照中显示的数据可以找到here.
特别是,我想要的是能够使用python(numpy或pandas)从这个文件中导入所有的数值数据,并且能够使用前两行中的文本数据来引用这个数据中的特定行(类型、标签)和第一列(对象编号)。在我的实际数据文件中,我有数十万行(对象类型)和数十个列。
我已经尝试使用numpy.loadtxt(...) 和pandas.read_csv(...) 打开这个文件,但是我遇到了错误,或者加载了笨拙格式的数据。我将非常感谢您对如何以某种方式在 python 中导入文件有一些指导,以便拥有我想要的功能。
【问题讨论】:
标签: python python-2.7 pandas numpy