java - 在内存中存储大量 IP 地址

标签 java data-structures out-of-memory sparse-matrix bitset

问题有点长,请耐心等待。

我正在编写 Java 代码以将全天网络跟踪中的流量聚合到每个子网的 84 秒分箱中。目前,我最多有 256 个子网,每个子网有 1024 个 bin。我用它来获取流量特征统计信息,例如每个子网的每个窗口中的连接数、输入/输出字节数、外部 ip 地址数。虽然连接、输入/输出字节很简单,但获取唯一数量的外部 IP 地址会导致 OutOfMemory 错误。

为了确定外部 ip 地址的唯一数量,我需要将 IP 地址存储在一些数据结构中,例如哈希表,并且在跟踪结束时我可以得到这个哈希表的大小。这意味着我将拥有 1024*256 个哈希表,每个哈希表存储大量 12-15 字节的 IP 地址字符串(数十到数千)。这很快就会崩溃,系统内存不足(我试图将 Java 堆大小设置为最多 2GB 但无济于事)。谁能建议一种有效存储如此大量对象的方法?

我尝试使用 bitset(将 ip 转换为 int),但是考虑到 ip 地址非常稀疏,它对内存情况没有帮助。作为最后的手段,我可​​能会使用 colt 库稀疏矩阵,每个 double 存储最多 64 个 ip 地址,但我想征求意见,以防我遗漏一些明显的东西,并且可以节省编写/调试此类包装器的时间。

旁注:为了了解规模,我看到我解析和聚合的每个跟踪都有数亿个流。在大多数情况下,我使用 256 个子网中的 10 到 20 个,但我希望该解决方案能够扩展到所有 256 个子网。

最佳答案

更新: 如果您将整个 40 亿个 IPv4 地址存储为一个数组,那么您可以将时间表示为一个单独的短片。

short[] ipv4 = new short[Integer.MAX_VALUE * 2]; // technically not possible blah blah

那将是 8GB,时间分辨率为 65K。只需考虑一下,因为它在内存上设置了上限,因为任何其他方案都必须在该上限之下。如果您使用一个字节,它将是 256 时间分辨率,每个 bin 337.5 秒,和 4 GB。

现在,您只能说您在该桶中至少看到了一个数据包。如果你需要一个再次炸毁内存的计数,但有一个短路,你可以使用 1024 个桶和一个潜在的 6 位分辨率来计数:最大 64 个数据包。

现在有 1 亿个唯一 IP,内存减少了 10 倍,因此理论上您可以从 8GB 增加到 800MB。虽然不分配您认为可以节省内存的整个空间,但您仍然必须为每个 IP 存储 4 个字节:400MB 仅用于 IP + 400MB 用于某种排序结构来保存它们(100M 指针 * 4 字节),2 个字节用于时间:最少 1GB。通过分配完整空间,您可以跳过再次存储 IP,因为您的哈希值就是您的 IP。如果您减少数组,您将不再拥有 IP,因为它已被散列掉了。现在你无法存储 IP 并仍然回答给定 IP 的问题,但你不能反省它。

如果您存储了一系列子网掩码,然后汇总其下的所有 IP,并将您的统计信息保存在该子网掩码上,会怎样?例如,您有 256 个子网,每个子网都有自己的子网掩码。您的程序将采用掩码的下限。也就是说,如果您掩码为 209.134.0.0/16 并使用下限 8。那么它将为该子网创建 256 个 bin,它们与 209.134.0.0-209.134.255.255 分开。您将为您拥有的所有 256 个子网重复相同的过程。 8 位的下限意味着每个子网的较低 256 个地址将被汇总。您可以将任何 IP 地址散列到 bin 中并将统计信息保存在内存中。但是,您不能对单个 IP 地址说任何话。但是,如果您需要更高的分辨率,您可以将较低的子网掩码设为 4,现在有更多的分箱。

只有在其中有 1 个 IP 时,您才创建一个 bin,因此,如果您没有 IP 显示在那里,您可以节省一些空间,因此它在足够低的下降分辨率和足够高以跳过创建 bin 之间保持平衡你不需要的东西。

然后您可以写出每个 bin 的日志并跟踪磁盘上每个 bin 中发生的事情。如果您想回答有关单个 IP 的问题,您可以找出它属于哪个 bin,然后打开文件并在其中搜索以找到答案。该方案意味着您可以根据数据的大小以及通过提高和降低界限来扩大或缩小规模。您可以通过更改每个 bin 写出的文件结构来提高性能。

我知道很抱歉的长度! :-)

关于java - 在内存中存储大量 IP 地址,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/9203798/

相关文章:

java - Android: Out of Memory Exception/decodeResource如何添加到VM Budget中?

java - 如何刷新 JSF h :panelGroup?

java - 将 JavaRDD<Tuple2<Object, long[]>> 转换为 Java 中的 Spark Dataset<Row>

java - 从 Java 应用程序在 hadoop 2.2 (Yarn) 上启动 mapreduce 作业

c - 我想将数据插入二叉树,但在 3 个输入后显示段错误

c++ - 存储一组 IPv6 地址的最佳方式是什么?

android - 每次都创建新的 picasso 实例可以吗

java - 设置回收器项目点击监听器时出现空指针异常

c++ - 将一种结构复制到另一种结构以及改变一种结构对另一种结构的影响

java - 如何在android中使用imageloader释放位图内存?