【发布时间】:2020-03-03 03:49:08
【问题描述】:
我正在尝试从 IMDB 网站上抓取一些数据。我要提取的数据是一些电影的片名(电影名)、上映年份和剧情概要。我已将要提取的所有页面批量下载到硬盘驱动器,当我在 Google Chrome 上检查要提取的页面元素时,其完整的 XPath 选择器类似于电影名称:
/html/body/div[3]/div/div[2]/div[5]/div[1]/div/div/div[1]/div[2]/div/div[2]/div[2]/h1/text()
我花了时间找到问题的代码,但没有答案(据我所知)。我正在阅读一些代码,例如
$html = Get-Content -Path "E:\POWERSHELL\IMDB pages\tt0062940.html" -Raw
$htmlFile = New-Object -ComObject "HTMLFile"
$htmlFile.IHTMLDocument2_write($html)
但我现在不知道该怎么办。有人可以告诉我是否可以使用 XPath 在 Powershell 中选择 HTML 元素来解析和提取本地文件中的信息。 谢谢。
【问题讨论】:
标签: html powershell xpath