【问题标题】:I am trying to convert the text file into CSV in Python我正在尝试在 Python 中将文本文件转换为 CSV
【发布时间】:2019-09-09 03:57:24
【问题描述】:

我正在尝试在 Python 中将文本文件转换为 CSV 输入文本文件如下:

Employee Name: Dr.john doe
Designation: Professor
Email: johndoe@google.com
"ContactNo: 1234567, 9999999"
"Qualification: M.Tech., Ph.D."
Area of Interest / Specialisation: network security
Employee Name: Dr. john doe2 
Designation: Professor2
Email: johndoe2@google.com
ContactNo: 222222222
"Qualification: B.Tech., Ph.D."
Area of Interest / Specialisation: network security2
Employee Name: Dr. john doe3 
Designation: Associate Professor3
Email: johndoe3@google.com
"ContactNo: 333333,4444444"
Qualification: Ph.D.
Area of Interest / Specialisation: network security3
Designation: Associate Professor4
Email: johndoe4@google.com
"ContactNo: 44444444 ,Intercom No.44444"
Qualification: : M.Sc. 
Designation: Programmer
Email: johndoe5@google.com
"ContactNo: 5555555555 ,Intercom No.5555"
Qualification: Ph.D |Computer Science
Designation: Computer Operator
Email: johndoe6@google.com
ContactNo: 666666666
"Qualification: D.C.Sc. & E.,"
Designation: Computer Operator
Email: johndoe7@google.com
"ContactNo: 777777777 ,Intercom No.77777<"
"Qualification: D.E & TC.,"
Designation: Instructor4
Email: johndoe8@google.com
"ContactNo: 8888888888 ,Intercom No.8888"
"Qualification: D.C.Sc. & E.,"`

我需要以下格式的 CSV(如您所见,一个字段只能取多个值中的一个,并且有一些没有员工姓名的数据需要在输出 CSV 文件中排除):

name,designation,email,contact,Qualification,Specialisation 

Dr. john doe,Professor,johndoe@google.com,1234567,B.E.,network security

Dr. john doe2,Professor,johndoe2@google.com,222222222,M.S.,network security2

Dr. john doe3,Associate,Professor3,johndoe3@gmail.com,333333,M.Tech.,network security3

**我尝试了各种方法,但我无法做到(我对编程很陌生):

使用其他人的例子我已经尝试过了,但我认为我的问题需要不同的方法:

records = """Employee Name: Dr. john doe
Designation: Professor
Email: johndoe@google.com
ContactNo: 1234567, 9999999
Qualification: M.Tech., Ph.D.
Area of Interest / Specialisation: network security"""

for record in records.split('Employee Name'):
    fields = record.split('\n')
    Employee_Name = "NA"
    Designation = "NA"
    ContactNo = "NA"
    Qualification = "NA"
    Specialization = "NA"
    for field in fields:
        field_name, field_value = field.split(':')
        if field_name == "": # This is employee name, since we split on it
            Employee_Name = field_value
        if field_name == "Designation":
            Designation = field_value
        if field_name == "ContactNo":
            ContactNo = field_value
        if field_name == "Qualification":
            Qualification = field_value
        if field_name == "Specialization":
            Specialization = field_value

这是我在这里的第一个问题,所以请忽略问题中的任何格式错误(如果有问题,请不要保留问题,我会立即更新)

【问题讨论】:

  • 您好,欢迎您发布您的代码,以便我们检查您的代码的哪些部分不起作用。 (顺便说一句:您的预期输出不是常规 CSV,因为没有 comma-separated-values)
  • 很高兴您给了我们预期的结果;但是,您能否提及您得到的实际结果?
  • @Quelklef 感谢您指出这一点。我会在一分钟内更新它

标签: python python-3.x export-to-csv


【解决方案1】:

如果您在代码的不同位置添加打印语句,您会发现有时record='' 有时field=''

添加几行:

for record in records.split('Employee Name'):
    if record == '':
        continue
    fields = record.split('\n')

for field in fields:
    if field == '':
        continue
    field_name, field_value = field.split(':')

现在应该可以成功运行了。

【讨论】:

  • 如何将输出保存在 CSV 文件中?
【解决方案2】:

数据

Employee Name: Dr.john doe
Designation: Professor
Email: johndoe@google.com
"ContactNo: 1234567, 9999999"
"Qualification: M.Tech., Ph.D."
Area of Interest / Specialisation: network security
Employee Name: Dr. john doe2 
Designation: Professor2
Email: johndoe2@google.com
ContactNo: 222222222
"Qualification: B.Tech., Ph.D."
Area of Interest / Specialisation: network security2
Employee Name: Dr. john doe3 
Designation: Associate Professor3
Email: johndoe3@google.com
"ContactNo: 333333,4444444"
Qualification: Ph.D.
Area of Interest / Specialisation: network security3

这里是简单的方法,如果有很多列也适用(无需为每个字段编写代码)

解决方案:

import pandas as pd
tdf = pd.read_csv("D:/emp.txt",sep='\n',doublequote=False, header= None)

tdf = tdf[0].str.split(':', expand=True)

dd = tdf.groupby(0)[1].apply(lambda g: g.values.tolist()).to_dict()

df = pd.DataFrame.from_dict(dd)

# If you want to re-arrange the columns (Optional)
df = df[['Employee Name','Designation','Email','ContactNo','Qualification','Area of Interest / Specialisation']]

df.to_csv('D:/EMP.csv',index=False) #Save results in CSV format

df

     Employee Name            Designation                 Email          ContactNo    Qualification Area of Interest / Specialisation
0      Dr.john doe              Professor    johndoe@google.com   1234567, 9999999   M.Tech., Ph.D.                  network security
1   Dr. john doe2              Professor2   johndoe2@google.com          222222222   B.Tech., Ph.D.                 network security2
2   Dr. john doe3    Associate Professor3   johndoe3@google.com     333333,4444444            Ph.D.                 network security3

【讨论】:

    猜你喜欢
    • 2016-10-04
    • 2021-10-04
    • 2019-04-28
    • 2021-03-11
    • 1970-01-01
    • 1970-01-01
    • 2020-07-30
    • 2021-01-31
    • 2020-11-03
    相关资源
    最近更新 更多