高级数据结构及应用之使用bitmap进行字符串去重的方法实例

2025-05-29 0 23

bitmap 即为由单个元素为 boolean(0/1, 0 表示未出现,1 表示已经出现过)的数组。

如果c/c++ 没有原生的 boolean 类型,可以用 int 或 char 来作为 bitmap 使用,如果我们要判断某字符(char)是否出现过

使用 int 作为 bitmap 的底层数据结构,bitmap 即为 int 数组,一个 int 长度为 32 个 bit 位,

  • c / 32 ⇒ bitmap 中的第几个 int
  • c % 32 ⇒ bitmap 中的某 int 中的第几个 bit 位;

使用 char 作为 bitmap 的底层数据结构,bitmap 即为 char 数组,一个 char 长度为 8 个 bit 位;

  • c / 8 ⇒ bitmap 中的第几个 char
  • c % 8 ⇒ bitmap 中某 char 中的第几个 bit 位;

ascii

  • a-z:65-90
  • a-z:97-122

如果使用 char 作为 bitmap 的替代底层数据结构,为了实现字符串去重需要 char 的长度为多少呢?122/8+1 ⇒ 16。如果使用 int 作为 bitmap 的底层实现,则需要 int 数组的长度为 122/32 + 1 ⇒ 4

1. int 作为底层数据结构

?

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19
void dedup(const char* src, char* dst)

{

unsigned int exists[4] = { 0 };

int i = 0, j = 0;

unsigned int mask;

char c;

while (src[i])

{

c = src[i];

mask = 1 << (c % 32);

if ((exists[c / 32] & mask) == 0)

{

dst[j++] = c;

exists[c / 32] |= mask;

}

i++;

}

dst[j] = '\\0';

}

2. 使用 char 作为底层数据结构

?

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19
void dedup(const char* src, char* dst)

{

unsigned char exists[16] = { 0 };

int i = 0, j = 0;

unsigned int mask;

char c;

while (src[i])

{

c = src[i];

mask = 1 << (c % 8);

if ((exists[c / 8] & mask) == 0)

{

dst[j++] = c;

exists[c / 8] |= mask;

}

i++;

}

dst[j] = '\\0';

}

总结

以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,谢谢大家对快网idc的支持。如果你想了解更多相关内容请查看下面相关链接

原文链接:https://blog.csdn.net/lanchunhui/article/details/80554725

收藏 (0) 打赏

感谢您的支持,我会继续努力的!

打开微信/支付宝扫一扫,即可进行扫码打赏哦,分享从这里开始,精彩与您同在
点赞 (0)

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

快网idc优惠网 建站教程 高级数据结构及应用之使用bitmap进行字符串去重的方法实例 https://www.kuaiidc.com/109866.html

相关文章

发表评论
暂无评论