hash 碰撞的2种解决办法
hash碰撞:hash长度是有限的,比如MD5 但是可以生成哈希的原文远比hash多的多,当两个不同原文算出一样的hashCode的时候,就发现了哈希碰撞
hash碰撞的解决办法总的来说有两种。
1 开放链表法(Java的hashMap 的解决方案)
哈希值取模数组长度,得到应该存放的数组下标的位置,如果重复,那就放在这个数组下标的链表里面,查找的时候如果对应下标里面链表有多个值,依次和原文比对是否相等。相当于hash冲突以后竖着放。java8以后一定长度以后会使用红黑树代替链表。
2 开放地址法探测法(ThreadLocalMap用的这方案)
同样是数组,同样是哈希取取模,如果下标已经有位置,那么久依次放到后面一个格子里面去,如果还是有,继续找下一个,直到找到空的位置放。相当于hash冲突以后横着放(注意算出来的位置存的不一定是hash相当的数据,可能是附近hash值顶过来的)。
查询的时候,算出hash值,对比原文相等就返回,不等就找下一个,如果下一个是空,就表示找不到,如果下一个不是空就继续下一个,直到找到为止。这种做法数据得到的hash只是一个大概位置,真实的数据正常就在这个位置,或者就在这个位置后面不远处。
开放地址法hash冲突以后,找下一个存放位置有多个变种,他们都是堆下下一个的步长做了优化。
基本的线探测:步长是1,逐步增加。
平方探测法:步长按照平方增加。
二次哈希:步长是由另外一个hash函数取模数组长度决定。
放的时候怎么放的,查询的时候找到hash 对应下标,比对是否相等,如果不等,就按照步长算法,查询下一个位置在做比对。
优缺点:
开放链表法:占用空间小,性能只有在链表里面有大量数据才开始慢慢线性衰减。
开发地址探测法:数组空间不到一半的时候效率高,数组空间接近满的时候遍历速度急剧下降,甚至查找一个对象遍历整个数组。并且最多只能装数组长度个对象。但是数据结构只用了一个一维数组,非常简单。
很明显开发链表法个各便都有优势。具体python里面的hash结构用的开放地址探测法的缘由不得而知,不用Python,所以没有去验证具体用的什么算法。
ThreadLocalMap 里面用的 开发地址探测法源码示意图
posted on 2022-04-27 22:51 zhangyukun 阅读(2278) 评论(0) 编辑 收藏 举报