【问题标题】:XSLT: Obtaining or matching hashes for base64 encoded dataXSLT:获取或匹配 base64 编码数据的哈希值
【发布时间】:2010-12-13 16:28:39
【问题描述】:

我需要找到一种方法来找到 XML 节点 //note/resource/data 中 base64 编码数据的哈希值,或者以其他方式将其与哈希值匹配在节点 //note/content/en-note//en-media@hash

完整的 XML 文件见下文

请提出一种{obtain|match} 使用 XSLT

的方法
4aaafc3e14314027bb1d89cf7d59a06c

{来自|与}

R0lGODlhEAAQAPMAMcDAwP/crv/erbigfVdLOyslHQAAAAECAwECAwECAwECAwECAwECAwECAwEC
AwECAyH/C01TT0ZGSUNFOS4wGAAAAAxtc09QTVNPRkZJQ0U5LjAHgfNAGQAh/wtNU09GRklDRTku
MBUAAAAJcEhZcwAACxMAAAsTAQCanBgAIf8LTVNPRkZJQ0U5LjATAAAAB3RJTUUH1AkWBTYSQXe8
fQAh+QQBAAAAACwAAAAAEAAQAAADSQhgpv7OlDGYstCIMqsZAXYJJEdRQRWRrHk2I9t28CLfX63d
ZEXovJ7htwr6dIQB7/hgJGXMzFApOBYgl6n1il0Mv5xuhBEGJAAAOw==

为了简洁起见,这个示例 XML 文件显然已经过删减。实际每个音符可能包含 > 1 个图像,因此需要获取/匹配哈希。

XML 文件:

<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE en-export SYSTEM "http://xml.evernote.com/pub/evernote-export.dtd">
<en-export export-date="20091029T063411Z" application="Evernote/Windows" version="3.0">

<note>
    <title>A title here</title>
    <content><![CDATA[
        <?xml version="1.0" encoding="UTF-8"?>
        <!DOCTYPE en-note SYSTEM "http://xml.evernote.com/pub/enml.dtd">
        <en-note bgcolor="#FFFFFF">
            <p>Some text here (followed by the picture)
            <p><en-media hash="4aaafc3e14314027bb1d89cf7d59a06c" type="image/gif" border="0" width="16" height="16" alt="A picture"/></p>
            <p>Some more text here (preceded by the picture)
        </en-note>
    ]]></content>
    <created>20090925T063154Z</created>
    <note-attributes>
        <author/>
    </note-attributes>
    <resource>
        <data encoding="base64">
R0lGODlhEAAQAPMAMcDAwP/crv/erbigfVdLOyslHQAAAAECAwECAwECAwECAwECAwECAwECAwEC
AwECAyH/C01TT0ZGSUNFOS4wGAAAAAxtc09QTVNPRkZJQ0U5LjAHgfNAGQAh/wtNU09GRklDRTku
MBUAAAAJcEhZcwAACxMAAAsTAQCanBgAIf8LTVNPRkZJQ0U5LjATAAAAB3RJTUUH1AkWBTYSQXe8
fQAh+QQBAAAAACwAAAAAEAAQAAADSQhgpv7OlDGYstCIMqsZAXYJJEdRQRWRrHk2I9t28CLfX63d
ZEXovJ7htwr6dIQB7/hgJGXMzFApOBYgl6n1il0Mv5xuhBEGJAAAOw==
        </data>
        <mime>image/gif</mime>
        <resource-attributes>
            <file-name>clip_image001.gif</file-name>
        </resource-attributes>
    </resource>
</note>

</en-export>

实施的解决方案

使用Jackem 建议的解决方案概念。主要区别在于我避免创建自己的 Java 类(并创建额外的依赖项)。我在 XSLT 中进行处理,因为它非常简单,只引用基本 Java 库附带的外部依赖项。
Jackem 的解决方案更正确,因为它不会丢失某些散列中的前导零,但是我发现在其他地方使用 li'l basic hackery 来解决这个问题要容易得多。

<xsl:stylesheet version="2.0" 
    xmlns:xsl="http://www.w3.org/1999/XSL/Transform"
    ...
    xmlns:md5="java.security.MessageDigest"
    xmlns:bigint="java.math.BigInteger"
    exclude-result-prefixes="md5 bigint">
...
<xsl:for-each select="resource">
    <xsl:variable name="md5inst" select="md5:getInstance('MD5')" />
    <xsl:value-of select="md5:update($md5inst, $b64bin)" />
    <xsl:variable name="imgmd5bytes" select="md5:digest($md5inst)" />
    <xsl:variable name="imgmd5bigint" select="bigint:new(1, $imgmd5bytes)" />
    <xsl:variable name="imgmd5str" select="bigint:toString($imgmd5bigint, 16)" />
    <!-- NOTE: $imgmd5str loses the leading zero from imgmd5bytes (if there is one) -->
</xsl:for-each>
...

附:请参阅sibling question 了解我对base64--&gt;image file 转换的实现


这个问题是another question I have asked previously 的子问题。

【问题讨论】:

    标签: xslt hash image-manipulation md5 evernote


    【解决方案1】:

    关于在 XSLT 中进行 base64 解码的相关问题,您有 accepted an answer,它使用了 Saxon 和 Java 扩展。所以我假设你可以使用这些。

    在这种情况下,您可以在 Java 中创建一个扩展来计算 MD5 和:

    package com.stackoverflow.q1684963;
    
    import java.math.BigInteger;
    import java.security.MessageDigest;
    import java.security.NoSuchAlgorithmException;
    
    public class MD5Sum {
        public static String calc(byte[] data) throws NoSuchAlgorithmException {
            MessageDigest md5 = MessageDigest.getInstance("MD5");
            byte[] digest = md5.digest(data);
            BigInteger digestValue = new BigInteger(1, digest);
            return String.format("%032x", digestValue);
        } 
    }
    

    从您使用 Saxon 运行的 XSLT 2.0 样式表中,您可以调用该扩展。假设您已经在变量 data 中拥有 base64 解码数据(例如来自链接答案中的扩展函数 saxon:base64Binary-to-octets):

    <xsl:value-of xmlns:md5sum="com.stackoverflow.q1684963.MD5Sum"
                  select="md5sum:calc($data)"/>
    

    【讨论】:

    • 谢谢!我已经设法使用相同的概念使其工作,除了我自己不创建类,而只是从 XSLT 中调用这些方法。我会发布我的 impl。很快就解决了...
    • 信用到期:Java代码改编自问题stackoverflow.com/questions/332079/…的各种答案
    【解决方案2】:
    • 下载一些免费的 Base64 解码器,如 this one 或使用网络上的一些源代码
    • 输出文件为 some_file.gif,268 字节,一个文件夹图标
    • 使用md5sum 或来自网络的一些源代码生成该文件的 MD5 校验和

    为我输出:

    4aaafc3e14314027bb1d89cf7d59a06c
    

    这就是你想要的,不是吗? 在 XSLT 中完成所有这些工作会很棘手(如果不是不可能,而且如果你问我,绝对不值得努力),但至少你现在已经得到了这个哈希是在 GIF 文件上使用 MD5 创建的信息。

    【讨论】:

    • 我承认使用 Otu XSLT 会更容易,但我想使用 XSLT 做其他事情,所以这个问题。我已经能够找到如何在 XSLT 中解码 base64,但现在需要找到一种方法来获得 th md5sum,当然使用 XSLT。
    • 我发现的唯一内容是 2004 年 exslt 邮件列表中的一条消息,其中有人试图开发一个可以生成 MD5 和其他校验和的加密命名空间,但似乎这是一条死胡同 -看这里:osdir.com/ml/text.xml.xslt.extensions/2004-05/msg00002.html
    【解决方案3】:

    4aaaf... 是您解码 base64 编码数据时获得的二进制数据的 MD5。我认为您别无选择,只能解码 &lt;data&gt; 元素的内容并通过 MD5 实现运行它,这显然超出了 XSL 转换的范围。想必XSLT的结果会被其他一些代码处理,可以提取和验证图像。

    【讨论】:

      【解决方案4】:

      这个怎么样(添加commons-codec到你的类路径):

      <xsl:stylesheet xmlns:xsl="http://www.w3.org/1999/XSL/Transform"
        xmlns:digest="org.apache.commons.codec.digest.DigestUtils">
        [...]
        <xsl:value-of select="digest:md5Hex('hello, world!')"/>
      </xsl:stylesheet>
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2020-02-14
        • 1970-01-01
        相关资源
        最近更新 更多