参考:
http://www.codeproject.com/useritems/Office_To_Text.asp
http://channel9.msdn.com/wiki/default.aspx/Channel9.DesktopSearchIFilters
http://www.seekafile.org/plug-in-system.html
一个源码学习:
该源码使用了注册系统自带的DLL来处把其不同格式的文件流转换在文本格式,而不需要安装办公软件.详情请看微软官方说明第二个网址.
下面给出一段使用的代码:
String txt=Seekafile.Server.IFilter.DefaultParser. Extract(filepath);
只要把文件的路径传递给它就可以反加该文件里的文本数据,如果是不支持格式的文件也不会引起异常,只是返回了空字符.调用下面静态方法就要以知道是否支持该文件的转换了.
Bool isParseable= Seekafile.Server.IFilter.DefaultParser. IsParseable(filepath)
出现的问题:当PDF格式的文件大于1M时,其返回值是空字符,如果是小于1M就没问题,可以返回文件中的文本字符,如果各位能发现问题所在的话请回复哦.
请教: 不知道那位用过Interop.Word.dll来调用接口来,提取WORD文档中的字符信息.
源码: