【问题标题】:Why is my bitmap sort not infintely faster than my mergesort?为什么我的位图排序没有无限快于我的合并排序?
【发布时间】:2014-06-10 07:16:40
【问题描述】:

我正在研究 Programming Peals,第一篇文章涉及对已知范围内的数字进行排序。作为一个聪明的解决方案,他们提供实现位图,将输入文件中的所有数字设置为位图中的一个,然后简单地对其进行迭代以打印结果。假设这应该比更传统的排序算法(如快速排序或合并排序)快得多。

为了测试这一点,我自己用 Java 编写了位图排序。当我发现使用归并排序的 Unix 排序命令仍然快得多时,我并没有太惊讶。我将此归因于它是用 C 编写的,并且可能由一些非常聪明的人进行了高度优化。

所以,然后我编写了自己的归并排序,也是用 Java 编写的。令我惊讶的是,我的 BitmapSort 更快,但只有一点点。对于非常大的输入文件(+-800000 个整数),位图排序仅快 30% 左右。

这是我的位图排序和位图实现:

import java.util.Scanner;
import java.io.FileReader;
import java.io.File;

class BitmapSort {
    Scanner sc;

    BitmapSort() throws Exception {
        sc = new Scanner(new File("numbers.txt"));
    }

    void start() {
        BitMap map = new BitMap(3000000);
        while (sc.hasNextInt()) {
            map.set(sc.nextInt());
        }
        for (int i = 0; i < 3000000; i++) {
            if (map.isSet(i)) {
                System.out.println(i);
            }
        }
    }

    public static void main(String[] args) throws Exception {
        new BitmapSort().start();
    }
}


class BitMap {

    byte[] bits;
    int size;


    BitMap(int n) {
        size = n;
        bits = new byte[(int) Math.ceil((double) n / (double) Byte.SIZE)];
        for (Byte b : bits) {
            b = 0;
        }
    }

    private String toBinary(byte b) {
        return String.format(Integer.toBinaryString(b & 0xFF)).replace(' ', '0');
    }

    void set(int i) {
        int index = i / Byte.SIZE;
        bits[index] = (byte) ((bits[index] | (byte) (1 << (Byte.SIZE - 1 - (i % Byte.SIZE)))));
    }

    void unset(int i) {
        int index = i / Byte.SIZE;
        bits[index] = (byte) ((bits[index] ^ (byte) (1 << (Byte.SIZE - 1 - (i % Byte.SIZE)))));
    }

    boolean isSet(int i) {
        int index = i / Byte.SIZE;
        byte mask = (byte) ((bits[index] & (byte) (1 << (Byte.SIZE - 1 - (i % Byte.SIZE)))));
        return (bits[index] & mask) != 0;
    }

}

这是我的归并排序:

import java.util.Scanner;
import java.io.FileReader;
import java.io.File;

class MergeSort {
    Scanner sc;
    static int times;

    MergeSort() throws Exception {
        sc = new Scanner(new File("numbers.txt"));
        times = 0;
    }


    int[] mergeSort(int[] input) {
        if (input.length <= 1) {
            return input;
        }

        int middle = input.length / 2;

        int[] left = new int[middle];
        int[] right;
        if (input.length % 2 == 0) {
            right = new int[middle];
        } else {
            right = new int[middle + 1];
        }

        for (int i = 0; i < middle; i++) {
            left[i] = input[i];
        }
        for (int i = middle; i < input.length; i++) {
            right[i - middle] = input[i];
        }
        left = mergeSort(left);
        right = mergeSort(right);
        return merge(left, right);
    }

    int[] merge(int[] left, int[] right) {
        times++;
        int[] result = new int[left.length + right.length];
        int left_size = 0;
        int right_size = 0;
        int result_size = 0;
        while (left_size < left.length || right_size < right.length) {
            if (left_size < left.length && right_size < right.length) {
                if (left[left_size] <= right[right_size]) {
                    result[result_size] = left[left_size];
                    left_size++;
                    result_size++;
                } else {
                    result[result_size] = right[right_size];
                    right_size++;
                    result_size++;
                }
            } else if (left_size < left.length) {
                result[result_size] = left[left_size];
                left_size++;
                result_size++;
            } else if (right_size < right.length) {
                result[result_size] = right[right_size];
                right_size++;
                result_size++;
            }
        }
        return result;
    }

    void start() {
        int[] input = new int[838662];
        int i = 0;
        while (sc.hasNextInt()) {
            input[i] = sc.nextInt();
            i++;
        }


        int[] result = mergeSort(input);
        for (int j : result) {
            System.out.printf("%d\n", j);
        }
    }


    public static void main(String[] args) throws Exception {
        new MergeSort().start();
    }
}

输入文件包含03000000 之间的整数,并包含838661 数字。 请原谅丑陋的编码风格,这只是为了快速比较。

提前致谢! 问候, 莱纳斯

【问题讨论】:

  • 我怀疑您的位集排序是 IO 绑定的。如果将所有数字读入内存,然后根据内存中的数据对性能进行计时,它的性能如何?
  • 另外,我可以在您的实现中看到一些错误。 for(Byte b : bits){b = 0;} 没有做你认为的事情。它实际上对bits 完全没有影响。
  • unset 正在执行切换而不是取消设置操作。
  • 谢谢!我没有在我的程序中使用 unset 操作,所以这不是一个真正的问题。构造函数中的 for 循环很不幸,但也不应该成为问题,因为 Java 会自动将字节初始化为 0(对吗?)。通过首先读取然后对位图排序进行基准测试,位图排序的速度提高了大约 54%,这是令人鼓舞的。不过,我希望它会更快......
  • 我确实看到它得到了回答。但是有一些问题。当我们为此目的在 java 中使用 BitSet 时,为什么要创建 BitMap。以及在构造函数中设置 0 的目的是什么。默认为零?当你说它快 30% 时——你是如何测量的?涉及哪些方法?在合并排序中没有文件读取(IO),但在位图排序中你有 IO 操作。最后,您不需要检查每个位是否已设置。检查 BitSet 中的 nextSetBit 方法比你的效率高。

标签: java algorithm bitmap big-o mergesort


【解决方案1】:

一方面,Programming Pearls 文章是在内存层次结构的影响变得像今天这样严重之前写的。 800K 字节的映射会增加大量随机存取内存流量,很可能会导致缓存未命中。合并排序往往具有良好的本地内存性能。

【讨论】:

  • 啊,太好了!我没有想到这一点。谢谢!
  • @Gene - 我无法理解。无论如何,这两种方法都会创建 80k 的数组 []。一个与另一个有何不同? .在这两种方法中,他们都使用索引来访问数组。 - 为我的无知道歉
  • @Mani 位图方法从文件中读取随机整数,并在相应位置设置一个位。由于输入是随机的,内存中的位置也是随机的。
  • @Linus。在数组中设置随机数发生在本地内存 (RAM) 中是否会导致性能下降? (同意从文件部分读取。在这种情况下不应考虑这一点,因为我们正在比较排序算法而不是读取部分)。我认为这发生在 O(1) 时间内。谢谢。
  • @Mani 随机访问大块内存确实会导致程序运行比顺序访问和/或本地访问慢得多。阅读“内存层次结构”。当访问是本地和/或顺序时,现代内存的运行速度要快几个数量级。
猜你喜欢
  • 2015-06-25
  • 2021-06-19
  • 2021-12-09
  • 1970-01-01
  • 2016-02-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多