【发布时间】:2014-05-24 21:23:51
【问题描述】:
awk/sed 新手在这里。我有一个 HTML 文件,我想从该文件中检索一个文本词。
<font face=arial size=-1><li><a href=/value_for_clients/Tokyo/abc_process.txt>abc</a> NDK Version: 4.0 </li>
<font face=arial size=-1><li><a href=/value_for_clients/Tokyo/abc01_process.txt>abc01</a> NDK Version: 4.0 </li>
<font face=arial size=-1><li><a href=/value_for_clients/Tokyo/abc045_process.txt>abc045</a> NDK Version: 4.0 </li>
<font face=arial size=-1><li><a href=/value_for_clients/Tokyo/cdf_process.txt>cdf</a> NDK Version: 4.0 </li>
<font face=arial size=-1><li><a href=/value_for_clients/Tokyo/Manhattan_process.txt>Manhattan</a> NDK Version: 4.0 </li>
例如。从第一行我想检索 abc 放置在: .txt>abc/a>
之间我使用了以下命令,但您可以看到单词中的字母数量不断变化 abc、abc01、abc045、cdf、Manhattan。
awk -F\/ '{print substr($4,0,3)}' list.html
因此,此命令仅获取 3 个字母单词的输出。但是,我想从 HTML 代码中的所有行中提取相同的信息(abc01、abc045、cdf、Manhattan)。请帮忙。
【问题讨论】: