【发布时间】:2021-06-21 05:39:10
【问题描述】:
我有一个新闻文章抓取工具,可以根据某些内容提取文章。有时,爬虫会拉回与他们应该做的无关的文章。
我想删除不包含相关关键字的文档。我在 pandas 中运行了以下代码,并成功删除了不需要的文档:
relevant_words = ['Bitcoin', 'bitcoin', 'Ethereum', 'ethereum', 'Tether', 'tether', 'Cardano', 'cardano', 'XRP', 'xrp']
articles['content'] = articles['content'][articles['content'].str.contains('|'.join(relevant_words))].str.lower()
articles.dropna(subset=['content'], inplace=True)
我的数据库结构如下:
_id:
title:
url:
description:
author:
publishedAt:
content:
source_id:
urlToImage:
summarization:
content 字段可以包含从一个句子到多个段落的任何内容。我正在考虑一个 Python 脚本,它遍历 content 字段,查找没有相关单词的文档并删除它们。
【问题讨论】:
标签: pandas mongodb aggregation-framework mongodb-atlas