【发布时间】:2019-05-29 09:43:37
【问题描述】:
我需要从 web url (http://www.africau.edu/images/default/sample.pdf) 中提取文本数据
我用了两个node_module。
1) 爬虫请求
it('Read Pdf Data using crawler',function(){
const crawler = require('crawler-request');
function response_text_size(response){
response["size"] = response.text.length;
return response;
}
crawler("http://www.africau.edu/images/default/sample.pdf",response_text_size).then(function(response){
// handle response
console.log("Reponse =" + response.size);
});
});
会发生什么,它不会在控制台上打印任何内容。
2) pfd2json/pdfparser
it('Read Data from url',function(){
var request = require('request');
var pdf = require('pfd2json/pdfparser');
var fs = require('fs');
var pdfUrl = "http://www.africau.edu/images/default/sample.pdf";
let databuffer = fs.readFileSync(pdfUrl);
pdf(databuffer).then(function(data){
var arr:Array<String> = data.text;
var n = arr.includes('Thursday 02 May');
console.log("Print Array " + n);
});
});
- 失败:ENOENT:没有这样的文件或目录,打开'http://www.africau.edu/images/default/sample.pdf'
我可以从本地路径访问数据,但无法从 url 中提取数据。
【问题讨论】:
标签: javascript selenium protractor