【发布时间】:2020-04-14 22:22:16
【问题描述】:
我有一个问题,我对攻击它感到困惑。 这是任务:
我们希望您在提供的数据集上实现“添加到购物篮”按钮分类器。具体来说,我们希望分类器识别正确的“添加到购物篮”按钮的 id 属性。
已向我提供了 1000 个网站的数据集 每个网站都有两个文件: 1)HTML 文件 - 每一个都是电子商务产品页面的 DOM 表示 2)JSON 文件 - 每个 HTML 文件的元数据。 “button_id”键通过 HTML 标记属性“id”指示每个关联的 HTML 文件上正确的“添加到购物篮”按钮的位置。
产品页面的 HTLM 文件在此任务中没有提供任何帮助。 这是一个标准的产品页面,其中包含许多其他不相关的信息,例如地点的联系方式和地址、语言等
JSON 文件如下所示
actions
0 "click"
augmented_tags []
button_ids
0 "0±±ui-id-1883"
context null
extended_url "https://www.neimanmarcus.com/en-gb/p/loro-piana-andre-denim-sport-shirt-prod200810299?ecid=NMAF__ShopStyle++Collective&CS_003=5630585&utm_medium=affiliate&utm_source=NMAF__ShopStyle++Collective"
features {}
html_filename "ex8560step01.large.html"
placeholders
0 null
skip_augmentation true
step 1
我需要区分哪个是添加购物篮按钮的好习惯,哪些不是。
我的想法是让算法打开网页,然后将页面本身可视化,然后与我可以使用标签的最佳实践页面进行比较 如果我想更复杂,它将是 CNN 分类或 ResNet 我不认为是 NLP 问题。
我错了吗? 有任何想法吗? 如果是这种情况,我如何让 CNN 关注 Add basked 按钮的位置。
我被要求用神经网络来做这件事
谢谢
【问题讨论】:
-
记住,做代码块的时候不是'not'
-
谢谢。我现在有一个意大利键盘但没有它但是我没有正确使用它的错
标签: python html json deep-learning classification