【发布时间】:2018-07-26 16:39:40
【问题描述】:
我正在收集推文。并希望根据图像、视频和文章将它们隔离开来。基本上是根据他们的媒体内容进行推文隔离
有什么方法或逻辑可以让我识别出推文中的 url 引用了一些图片、视频或文章?
【问题讨论】:
标签: twitter nlp data-analysis
我正在收集推文。并希望根据图像、视频和文章将它们隔离开来。基本上是根据他们的媒体内容进行推文隔离
有什么方法或逻辑可以让我识别出推文中的 url 引用了一些图片、视频或文章?
【问题讨论】:
标签: twitter nlp data-analysis
对于媒体,您可以查看Extended Entities Object。在对象中,有一个名为 "type" 的键 - 如果您正在分析的推文包含一些媒体,则该值可以是 "photo"、"video"、"animated_gif" 之一。
对于文章,您可以在检查扩展实体对象时检查纯 Entities Object 如果推文不包含任何媒体(因为 twitter 中的媒体也是 URL - 这意味着如果推文不包含任何媒体,那么推文中包含的 URL 必须是链接)。
您可以在 Entities Object API 中获取链接的 HTML 标题和描述,但遗憾的是 Twitter API 不提供 Twitter Cards - 如果您需要 Twitter Card 信息,您应该解析 HTML <head> 元素并自己获取信息.详情见Twitter Cards documentation。
【讨论】: