【发布时间】:2014-01-13 14:54:34
【问题描述】:
到目前为止,我正在使用curl 以及w3m 和sed 来提取网页的部分内容,例如<body>....内容....</body>。我想忽略所有其他标题(例如<a></a>、<div></div>)。除了我现在这样做的方式真的很慢。
curl -L "http://www.somewebpage.com" | sed -n -e '\:<article class=:,\:<div id="below">: p' > file.html
w3m -dump file.html > file2.txt
上面这两行确实很慢,因为curl 是先将整个网页保存到一个文件中并对其进行短语化,然后w3m 对其进行短语化并将其保存到另一个文件中。我只想简单地编写这段代码。我想知道lynx 或hmtl2text 是否有办法让您提取具有指定标题的网页内容。所以就像我想从网页(www.badexample.com
<title>blah......blah...</title>
<body>
Some text I need to extract
</body>
more stuffs
是否有一个程序可以指定提取内容的参数?所以我会指定someprogram <body></body> www.badexample.com,它只会提取那些标题中的内容?
【问题讨论】: