【发布时间】:2016-11-22 12:20:42
【问题描述】:
我有一些关于subtractByKey 的问题。
我有 2 个文件: 第一个是这样的:(客户 ID + 客户邮件)
client_id emails
4A85FD8E-197D-2AE3-B939-A527AFF16A04 imperdiet.non.vestibulum@mon***tur.com
D48D530C-CF68-DAF1-18F0-E0A0A03F3E06 rutrum.urna@estm***ncus.net:facilisis@i****m.ca
40815230-25DC-9EA0-01D1-2706B4B56958 iaculis.nec.eleifend@gr****nc.net
...
第二个:(仅限邮件)
pharetra@P****s.com
ut.aliquam@o****m.org
erat@a****e.edu
....
第一个文件中的某些行可以包含 2 封(或更多)这种格式的邮件:
mail:mail
我做了什么:
*test1=sc.textFile("file1")
*test2=sc.textFile("file2")
*test3=test1.subtractByKey(test2)
结果是……:
[(u'A', u'B'), (u'A', u'D'), (u'A', u'1'), (u'A', u'D'), (u'A', u'D'), (u'A', u'B'), (u'A', u'F'), (u'A', u'E'), (u'A', u'9'), (u'A', u'5'), (u'A', u'9'), (u'A', u'6'), (u'c', u'l'), (u'E', u'8'), (u'E', u'4'), (u'E', u'6'), (u'E', u'6'), (u'E', u'7'), (u'E', u'5'), (u'E', u'5'), (u'E', u'5'), (u'E', u'2'), (u'E', u'8'), (u'C', u'2'), (u'C', u'5'), (u'C', u'6'), (u'C', u'C'), (u'C', u'E'), (u'C', u'3'), (u'C', u'F'), (u'C', u'4'), (u'C', u'B'), (u'C', u'F'), (u'C', u'F'), (u'C', u'8'), (u'C', u'0'), (u'1', u'D'), (u'1', u'2'), (u'1', u'3'), (u'1', u'8'), (u'1', u'0'), (u'1', u'F'), ... ]
我想删除第一个文件中的客户,他们的邮件在第二个文件中,但它不起作用。
【问题讨论】:
-
你最好用
code格式编辑你的问题,因为我看到的很混乱 -
里面没有代码...除了3行,是代码格式。
-
这是第一个可以包含多封电子邮件的文件,对吧?
-
是的,对不起。正在编辑!
标签: pyspark