【发布时间】:2011-10-18 16:45:16
【问题描述】:
我想尝试弄清楚如何从网页中获取标题和所有元标记
<title>A common title</title> <meta name="keywords" content="Keywords blabla" /> <meta name="description" content="This is the description" />
这个问题似乎在 stackoverflow 上被问和回答了好几次,但没有答案关心网页的语言/字符集。例如这里Getting title and meta tags from external website shamittomar 的脚本只适用于utf-8 格式的网页。该脚本无法运行,例如,它将为这些站点返回奇怪的结果:
(注意:以上网站不是我的,只是例子)
有没有办法以正确的方式做到这一点,有没有可用的类来做到这一点?因为 Facebook Linter 可以在上述网站上正常工作,所以我认为 PHP 脚本中有可用的解决方案。
谢谢。
【问题讨论】:
-
http://www.tudou.com/是一个不太好的网站示例,它的标题中没有设置字符集。从一开始就手动解析字符集,不过你会没事的。我对http://svmpbt.com/有没有问题吗?iconv可能是你的朋友。 -
你能说得更具体点吗?我应该在 shamittomar 的脚本中进行哪些更改?
标签: php character-encoding html-parsing meta-tags