【问题标题】:Implement an “add to basket” button classifier实现“添加到购物篮”按钮分类器
【发布时间】:2020-04-14 22:22:16
【问题描述】:

我有一个问题,我对攻击它感到困惑。 这是任务:

我们希望您在提供的数据集上实现“添加到购物篮”按钮分类器。具体来说,我们希望分类器识别正确的“添加到购物篮”按钮的 id 属性。

已向我提供了 1000 个网站的数据集 每个网站都有两个文件: 1)HTML 文件 - 每一个都是电子商务产品页面的 DOM 表示 2)JSON 文件 - 每个 HTML 文件的元数据。 “button_id”键通过 HTML 标记属性“id”指示每个关联的 HTML 文件上正确的“添加到购物篮”按钮的位置。

产品页面的 HTLM 文件在此任务中没有提供任何帮助。 这是一个标准的产品页面,其中包含许多其他不相关的信息,例如地点的联系方式和地址、语言等

JSON 文件如下所示


actions
     0  "click"
augmented_tags  []

button_ids
     0    "0±±ui-id-1883"

context null

extended_url    "https://www.neimanmarcus.com/en-gb/p/loro-piana-andre-denim-sport-shirt-prod200810299?ecid=NMAF__ShopStyle++Collective&CS_003=5630585&utm_medium=affiliate&utm_source=NMAF__ShopStyle++Collective"

features    {}

html_filename   "ex8560step01.large.html"
placeholders    

     0      null

skip_augmentation   true

step    1  

我需要区分哪个是添加购物篮按钮的好习惯,哪些不是。

我的想法是让算法打开网页,然后将页面本身可视化,然后与我可以使用标签的最佳实践页面进行比较 如果我想更复杂,它将是 CNN 分类或 ResNet 我不认为是 NLP 问题。

我错了吗? 有任何想法吗? 如果是这种情况,我如何让 CNN 关注 Add basked 按钮的位置。

我被要求用神经网络来做这件事

谢谢

【问题讨论】:

  • 记住,做代码块的时候不是'not'
  • 谢谢。我现在有一个意大利键盘但没有它但是我没有正确使用它的错

标签: python html json deep-learning classification


【解决方案1】:

如果您有很多好按钮和坏按钮的示例,您可能会为此使用 CNN。

我会使用 selenium 加载页面、定位元素、获取元素的尺寸、截取页面的屏幕截图,然后根据图像位置和尺寸裁剪屏幕截图。

将其输入您的分类器

How to capture the screenshot of a specific element rather than entire page using Selenium Webdriver?

但是我怀疑您要查找的内容与底层代码和按钮的视觉表示一样多,此时我不确定图像分类是否有意义。

【讨论】:

  • 我的错。我没有正确表达我需要说什么是“正确的”添加篮子按钮。正确的那个。我需要 CNN 专注于添加篮子按钮,因为它处于正确的位置或最佳实践位置,从网页到网页略有不同。我想将数据集之外的网页标记为好的做法,然后将其与数据集中的网页进行比较
猜你喜欢
  • 2012-03-02
  • 2019-11-09
  • 2021-11-25
  • 2011-11-30
  • 2012-06-30
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-09-28
相关资源
最近更新 更多