【发布时间】:2016-03-04 11:20:28
【问题描述】:
我正在通过 tika 获取 pdf 文档的内容并将其发送到 solr 以通过 Coldfusion 9 中的 xml 请求对其进行索引这是我的代码。
<cfset gatt = new getallthetexts.textextractor()>
<cfset result= gatt.read(pdfpath)>
<cfset content = xmlFormat(result.text)>
<!---escape unicode characters--->
<cfset p= createObject("java","java.util.regex.Pattern").compile("[^\\u0009\\u000A\\u000D\u0020-\\uD7FF\\uE000-\\uFFFD\\u10000-\\u10FFF]+")>
<cfset p.matcher(content).replaceAll("")>
<cfxml variable="xml">
<add>
<field name="content">#content#</field>
</add>
</cfxml>
现在我面临以下错误:
十进制表示必须紧跟在“”之后 字符参考。
我在以下链接中使用了示例来获取 pdf 的内容: https://github.com/cfjedimaster/getallthetexts/blob/master/test1.cfm
谁能帮我解决这个问题。
【问题讨论】:
-
您是否验证了您从 tika 获得的数据实际上是有效的 PDF?您如何序列化 PDF 二进制文件以插入 XML?基本上:向我们展示一些代码。 sscce.org
-
#Adam,我刚刚用代码更新了我的问题。
标签: xml unicode solr coldfusion coldfusion-9