【发布时间】:2022-01-14 14:40:39
【问题描述】:
我正在为支持 RDFa、Json LD 和 Microdata 的学生制作一个抓取工具来读取问题/答案数据,但 Quora 让我感到困惑。 我需要了解它的阅读方式,以便我可以在我的 HTML 问题/答案抓取工具中阅读它以应对此类情况。
在谷歌搜索中,我看到了一个 QA 块,但如果我转到 URL https://www.quora.com/What-happens-when-sodium-chloride-and-water-is-heated-to-dry,我看不到任何 JSON LD、RDFa 或微数据的证据。 google是如何读取quora的问答信息的?
我能想到的可能原因:
- 他们只向搜索引擎用户代理显示这些数据。所以也许我应该在请求页面时将用户代理更改为刮板。
- Google 自己解决了这个问题。这意味着我需要创建一些 NLP 解决方案来获取信息。
- 将页面标识为问题/答案的关键字。
- Google 为 quora 等大型问答网站做了一些特别的事情(但堆栈溢出有 schema.org,所以我认为这不是真的)。
PS:甚至 google 也不支持其他格式:https://developers.google.com/search/docs/advanced/structured-data/qapage
【问题讨论】:
-
这不是编程问题,因此也不是这里的主题。
-
@StephenOstermiller 我正在尝试识别 HTML 中的问题/答案信息,并确定我需要做什么才能从 Quora 或类似情况中找到 QA 信息。 AKA 我需要更改
user-agent吗?我是否必须做一个聪明的阅读器,等等。我可能没有成功地传达这一点,但这是一个编程问题。我已经更新了问题以反映这一点。 -
要使这成为一个主题编程问题,您需要发布您编写的代码并询问它的问题。
-
Google 将此页面的结构化数据读取为丰富的结果 - search.google.com/test/rich-results/result/…
-
Schema 为我显示了不同网站的大多数测试结果。我不认为问题出在工具上。它也是一个前谷歌结构化数据测试工具,旨在测试用户的网站。这个工具不久前被转移到了 Schema 中,他们在那里几乎无法破坏。
标签: google-search schema.org microdata json-ld googlebot