【发布时间】:2018-05-20 02:44:52
【问题描述】:
我正在研究语言模型,想计算两个后续单词的对数。
我在scala 和slicing 函数上找到了此类问题的示例。虽然我没能在pyspark中找到类比
data.splicing(2).map(lambda (x,y): ((x,y),1).redcueByKey(lambda x,y: x+y)
我想应该是这样的。 变通解决方案可能是在数组中查找下一个单词的创建函数,但我想应该有一个内置解决方案。
【问题讨论】:
-
问题是什么?你能举一个数据的例子吗?到目前为止,您尝试了什么?
标签: python apache-spark pyspark