【发布时间】:2018-11-16 00:50:41
【问题描述】:
我在 DataFrame 中有两列(serverTs、FTs),它们是 Unix 时间格式的时间戳。 在我的代码中,我需要从另一个中减去一个。当我这样做时,我收到一个错误,说我不能减去字符串。所以我将 serverTs 和 FTs 的类型添加为整数。
file = r'S:\Работа с клиентами\Клиенты\BigTV Rating\fts_check.csv'
col_names = ["Day", "vcId", "FTs", "serverTs", "locHost", "tnsTmsec", "Hits", "Uniqs"]
df_empty = pd.DataFrame()
with open(file) as fl:
chunk_iter = pd.read_csv(fl, sep='\t', names=col_names, dtype={'serverTs': np.int32, 'FTs': np.int32}, chunksize = 100000)
for chunk in chunk_iter:
chunk['diff'] = np.array(chunk['serverTs'])-np.array(chunk['FTs'])
chunk = chunk[chunk['diff'] > 180]
df_empty = pd.concat([df_empty,chunk])
但是程序给了我一个错误:
TypeError Traceback(最近调用 最后)pandas/_libs/parsers.pyx 在 pandas._libs.parsers.TextReader._convert_tokens()
TypeError:无法将数组从 dtype('O') 转换为 dtype('int32') 根据规则“安全”
在处理上述异常的过程中,又发生了一个异常:
ValueError Traceback(最近调用 最后)在() 6 #dtype={'serverTs':np.int32,'FTs':np.int32}, 7 #chunk_iter = chunk_iter.astype({'serverTs': np.int32, 'FTs': np.int32}) ----> 8 用于 chunk_iter 中的块: 9 #print(chunk[chunk['FTs'] == 'NaN']) 10 #chunk[['serverTs','FTs']] = chunk[['serverTs','FTs']].astype('int32')
C:\ProgramData\Anaconda3\lib\site-packages\pandas\io\parsers.py 在 下一个(自我)1040 def 下一个(自我):1041 尝试: -> 1042 return self.get_chunk() 1043 除了 StopIteration: 1044 self.close()
C:\ProgramData\Anaconda3\lib\site-packages\pandas\io\parsers.py 在 get_chunk(self, size) 1104 提高 StopIteration
第1105章 -> 1106 返回 self.read(nrows=size) 1107 1108C:\ProgramData\Anaconda3\lib\site-packages\pandas\io\parsers.py 在 读取(自我,nrows)1067引发ValueError('skipfooter 不支持迭代')1068 -> 1069 ret = self._engine.read(nrows) 1070 1071 if self.options.get('as_recarray'):
C:\ProgramData\Anaconda3\lib\site-packages\pandas\io\parsers.py 在 读取(自我,nrows)1837 def 读取(自我,nrows=None):1838
尝试: -> 1839 data = self._reader.read(nrows) 1840 除了 StopIteration: 1841 if self._first_chunk:pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader.read()
pandas/_libs/parsers.pyx 在 pandas._libs.parsers.TextReader._read_low_memory()
pandas/_libs/parsers.pyx 在 pandas._libs.parsers.TextReader._read_rows()
pandas/_libs/parsers.pyx 在 pandas._libs.parsers.TextReader._convert_column_data()
pandas/_libs/parsers.pyx 在 pandas._libs.parsers.TextReader._convert_tokens()
ValueError: int() 以 10 为底的无效文字:'FTs'
我使用 SQL 查询从 Hadoop 获取数据,因此我检查了任何带有字母的符号,但只有数字。此外,如果 FT 有任何不是数字的字符,它就不会出现在数据库中。 可能是什么问题?
【问题讨论】:
-
您的 CSV 是否有标题?如果是这样,则不要传递
names并让read_csv读取列名。看起来您正试图从文件中读取字符串'FTs'作为数字。 -
@jdehesa,是的,这就是问题所在。感谢您的评论!
标签: python python-3.x pandas dataframe