• 【C++】vector的模拟实现 | 使用memcpy拷贝时的问题 | 实现深拷贝


    目录

    基本框架及接口

    构造函数

    无参构造

    迭代器区间构造

    初始化构造

    析构函数

    size() | capacity()

    扩容的reserve()

    使用memcpy拷贝的问题

    改变大小的resize()

    operator[]

    迭代器的实现

    vector的增删

    尾插push_back()

    尾删pop_back()

    借insert和erase谈迭代器失效的问题

    insert()

    erase()

    深拷贝的实现

    拷贝构造函数

    赋值operator=


    上一篇我们说到了vector,它是一个类模板,能够容纳各种类型的对象作为其元素,并且可以动态地调整大小。可以理解为动态数组。

    这篇我们就亲自实现一下 简易版的vector,这能大大加深我们对vector的理解!

    而因为vector的实现和string有很多相似之处,所以实现过程中的一些细节便不再详述。

    基本框架及接口

    📁vector.h:

    1. #pragma once
    2. namespace jzy   //为了和STL库里的vector区分,我们就把它放进自定的命名空间里
    3. {
    4. template<typename T>
    5. class vector
    6. {
    7. public:
    8. typedef T* iterator;  
    9. private:
    10. iterator _start;
    11. iterator _finish;     //finish表示最后一个位置的后一个位置
    12. iterator _end_of_storage;
    13. };
    14. }

    这里的三个成员变量,是参照了《STL源码剖析》,按照STL 3.0版本实现的。

    这样的话,想要知道 _size或者 _capacity,就用成员变量相减的方式。

    构造函数

    无参构造

    1. vector()
    2. :_start(nullptr)
    3. ,_finish(nullptr)
    4. , _end_of_storage(nullptr)
    5. {}
     
    

    迭代器区间构造

    通过传迭代器的起、始区间(左闭右开)来构造。

    1. vector(InputIterator first, InputIterator last)
    2. {
    3. InputIterator it = first;
    4. int num = 0;       //统计个数
    5. while (it != last)
    6. {
    7. it++;
    8. num++;
    9. }
    10. _start = new T[num];
    11. for (int i = 0; i < num; i++)
    12. {
    13. _start[i] = *first++;
    14. }
    15. _finish = _start + num;
    16. _end_of_storage = _start + num;
    17. }

    初始化构造

    构造的同时能将对象初始化,使之含n个val值。

    1. vector(int n, const T& val = T())   //注意:这里不能给size_t!
    2. {
    3. _start = new T[n];
    4. for (int i = 0; i < n; i++)
    5. {
    6. _start[i] = val;
    7. }
    8. _finish = _start + n;
    9. _end_of_storage = _start + n;
    10. }

    为什么n的类型不能是size_t?

    如果是size_t,当传的两个参数都是int类型时,测试出的结果为:

    1. void test7()
    2. {
    3. vector<int> v1(5,1);  
    4. for (auto& e : v1)
    5. {
    6. cout << e << " ";
    7. }
    8. }

    原因:

    我们知道,v1在匹配构造函数时,是根据参数的类型来匹配的。

    size_t与int并不能很好地匹配,而InputIerator却可以匹配上int类型,因为InputIerator本身就是个模板,int无需转化就能匹配上。

    所以v1调用的构造函数是 vector(InputIterator first, InputIterator last); ,

    在这个函数里,要对int进行解引用,所以报错:非法的间接寻址。

    析构函数

    1. ~vector()
    2. {
    3. delete[] _start;
    4. _start = _finish = _end_of_storage = nullptr;
    5. }

    size() | capacity()

    目前的三个成员变量不能直观地表示出 容量和大小,因此,我们需要亲自实现出来。

    1. size_t size()
    2. {
    3. return _finish - _start;  
    4. }
    5. size_t capacity()
    6. {
    7. return _end_of_storage - _start;
    8. }

    扩容的reserve()

    扩容的思路是:

    先开新空间,再把数据都拷到新空间里去,然后释放旧空间,让指针指向新空间。

    未经修正版的reserve:

    1. void reserve(size_t n)
    2. {
    3. if (n > capacity())
    4. {
    5. size_t sz = size();
    6. T* tmp = new T[n];
    7. int a = size();
    8. if (_start)
    9. {
    10. memcpy(tmp, _start, sz* sizeof(T));
    11. delete[] _start;
    12. }
    13. _start = tmp;
    14. _finish = _start + sz;
    15. _end_of_storage = _start + n;
    16. }
    17. }

    来测试下:

    1. void test10()
    2. {
    3. vector<int> v;
    4. v.push_back(1);
    5. v.push_back(2);
    6. v.push_back(3);
    7. v.push_back(4);
    8. v.push_back(5);
    9. for (auto& e : v)
    10. {
    11. cout << e << " ";
    12. }
    13. cout << endl;
    14. }

    看起来搞定了。但真的OK吗?

    如果我们用自定义类型,如vector来测试:

    1. void test9()
    2. {
    3. vector v;
    4. v.push_back("happy");
    5. v.push_back("happy");
    6. v.push_back("happy");
    7. v.push_back("happy");
    8. v.push_back("happy");
    9. for (auto& e : v)
    10. {
    11. cout << e << " ";
    12. }
    13. cout << endl;
    14. }

    程序居然崩溃了!

    其实,这都是memcpy惹的祸。

    使用memcpy拷贝的问题

    ⭐memcpy只能进行浅拷贝,所以,如果是拷内置类型,那很乐于用memcpy。

    如果是自定义类型 且 涉及资源管理的,就不能用memcpy了,不然可能会引起内存泄漏甚至程序崩溃。

    现在来解释vector用例崩溃的原因:

    在调用push_back时,空间不够的话,push_back内部会调用reserve开空间,问题就出在这个reserve。来看看reserve是咋实现的:

    1. void reserve(size_t n)
    2. {
    3. if (n > capacity())
    4. {
    5. size_t sz = size();
    6. T* tmp = new T[n];
    7. int a = size();
    8. if (_start)
    9. {
    10. memcpy(tmp, _start, sz* sizeof(T));   //拷数据时用memcpy
    11. delete[] _start;
    12. }
    13. _start = tmp;
    14. _finish = _start + sz;
    15. _end_of_storage = _start + n;
    16. }
    17. }

    可以看到,reserve是调memcpy拷数据的,拷完就释放了_start。

    memcpy拷贝的原理就是浅拷贝,直接把值给复制过去。如果vector里的元素是int、char这种,那直接复制没问题。但此时vector里的是string,我们知道,要想找到字符串,得知道首元素地址。所以vector容器里存着的是一个个首元素地址,此时浅拷贝,就会是这种场景:

    tmp 的内容是由memcpy值拷贝来的,和_start指向同一块空间。当_start被delete,那tmp的空间同样也被释放了。

    所以说,如果对象中涉及到资源管理时,千万不能使用memcpy进行对象之间的拷贝,还是得自己老老实实地拷贝。

    ➡️修改后的reserve:

    1. void reserve(size_t n)
    2. {
    3. if (n > capacity())
    4. {
    5. //开空间
    6. T* tmp = new T[n];
    7. //拷数据
    8. iterator begin = _start;
    9. int i = 0;
    10. while (begin != _finish)
    11. {
    12. tmp[i++] = *begin++;
    13. }
    14. //释放、赋值
    15. delete[] _start;
    16. _start = tmp;
    17. _finish = tmp + i;
    18. _end_of_storage = tmp + n;
    19. }
    20. }

    此时再测试:

    改变大小的resize()

    1. void resize(size_t n , T val = T())
    2. {
    3. if (n < size())
    4. {
    5. _finish = _end_of_storage = _start + n;
    6. }
    7. else
    8. {
    9. reserve(n);
    10. for (int i = size(); i < n; i++)
    11. {
    12. _start[i] = val;
    13. }
    14. _finish = _start + n;
    15. }
    16. }

    operator[]

    1. T& operator[] (size_t pos)
    2. {
    3. assert(pos < size());
    4. return *(_start + pos);
    5. }

    迭代器的实现

    普通迭代器的begin() | end():

    1. typedef T* iterator;
    2. iterator begin()
    3. {
    4. return _start;
    5. }
    6. iterator end()
    7. {
    8. return _finish;
    9. }

    const迭代器的begin() | end():

    被const修饰以后,只能读,不能写。

    1. typedef const T* const_iterator;
    2. const_iterator begin() const
    3. {
    4. return _start;
    5. }
    6. const_iterator end() const
    7. {
    8. return _finish;
    9. }

    关于范围for:

    只要实现了迭代器,那范围for不用特意去实现,就已经能用了:

    1. void test1()
    2. {
    3. vector<int> v;
    4. v.push_back(1);
    5. v.push_back(2);
    6. v.push_back(3);
    7. v.push_back(4);
    8. for (auto e : v)   //用范围for遍历
    9. {
    10. cout << e << " ";
    11. }
    12. cout << endl;
    13. }

    实际上范围for的底层原理 就是迭代器。它依靠begin()、end()来实现,且只认识begin()和end()。

    假如我把begin()的名称改成Begin(),那迭代器照样能用,而范围for就用不了了:它不认识Begin()。。。

    vector的增删

    尾插push_back()

    1. void push_back(const T& val)  
    2. {
    3. //先考虑容量够不够
    4. if (size() == capacity())
    5. {
    6. reserve(capacity() == 0 ? 4 : 2 * capacity());
    7. }
    8. *_finish = val;
    9. _finish++;
    10. }

    这里要注意:形参得被const修饰,并且传引用过去。

    传引用的话更省力,不然深拷贝代价大;有了const,形参才能接收常量字符串。

    尾删pop_back()

    1. void pop_back()
    2. {
    3. assert(_start<_finish);
    4. _finish--;
    5. }

    借insert和erase谈迭代器失效的问题

    insert()

    1. void insert(iterator pos, const T& val)
    2. {
    3. assert(pos >= _start);
    4. assert(pos <= _finish);
    5. //先考虑空间够不够
    6. if (_finish == _end_of_storage)
    7. {
    8. reserve(capacity() == 0 ? 4 : 2 * capacity());
    9. }
    10. //挪动数据
    11. iterator end = _finish - 1;
    12. while (end >= pos)
    13. {
    14. *(end + 1) = *end;
    15. end--;
    16. }
    17. //插入
    18. *pos = val;
    19. _finish++;
    20. }

    这样写其实还不够,一旦涉及扩容就会出现问题。我们来测试一下:

    1. void test2()
    2. {
    3. vector<int> v;
    4. v.push_back(1);
    5. v.push_back(2);
    6. v.push_back(3);
    7. v.pop_back();
    8. v.insert(v.begin(), 10);
    9. v.insert(v.begin(), 11);
    10. v.insert(v.begin(), 12);
    11. for (auto e : v)  
    12. {
    13. cout << e << " ";
    14. }
    15. cout << endl;
    16. }

    出现了随机值!

    究其原因,其实是reserve扩容 那步出了疏漏,使迭代器pos失效了。

    这就是迭代器失效问题

    也就是说,在扩容后,迭代器pos需要被更新一下:让原本指向旧空间的pos,现在指向新空间的同样位置。

    修改后:

    1. void insert(iterator pos, const T& val)
    2. {
    3. int flag_pos = pos - _start;   //先记录下pos的相对位置,以便之后更新pos
    4. assert(pos >= _start);
    5. assert(pos <= _finish);
    6. //考虑空间够不够
    7. if (_finish == _end_of_storage)
    8. {
    9. reserve(capacity() == 0 ? 4 : 2 * capacity());
    10. pos = _start + flag_pos;     //根据刚刚记录的位置,更新pos
    11. }
    12. //挪动数据
    13. iterator end = _finish - 1;
    14. while (end >= pos)
    15. {
    16. *(end + 1) = *end;
    17. end--;
    18. }
    19. //插入
    20. *pos = val;
    21. _finish++;
    22. }

    现在可以成功插入了:

    拓展思考:若将v.begin()传给pos时,采用引用传参,可行吗?

    void insert(iterator& pos, const T& val);

    不可行。这个问题很考验我们在类和对象那块的基础知识。

    我们来看看begin():

    1. iterator begin()
    2. {
    3. return _start;
    4. }

    它采用传值返回,返回的不是_start,而是它的拷贝出来的临时对象

    临时对象是具有常性的,所以pos没法作它的别名,我们只能拷贝一份它,存进pos里。

    erase()

    1. void erase(iterator pos)
    2. {
    3. assert(pos >= _start && pos < _finish ); //这里注意:不能<=_finish!因为它指向的是最后一个元素的后一个位置
    4. iterator begin = pos + 1;
    5. while (begin < _finish)
    6. {
    7. *(begin - 1) = *begin;
    8. begin++;
    9. }
    10. _finish--;
    11. }

    但是!看似平静无澜的erase(),其实暗含隐患:erase也会有迭代器失效的问题。

    现在我们用一个例子来展示出它的问题:现要求删除所有的偶数。

    v分两组,分别是A:{1,2,3,4,5}; B:{1,2,3,4}。

    A:

    1. void test3()
    2. {
    3. vector<int> v;
    4. v.push_back(1);
    5. v.push_back(2);
    6. v.push_back(3);
    7. v.push_back(4);
    8. v.push_back(5);
    9. vector<int>::iterator it = v.begin();
    10. while (it != v.end())
    11. {
    12. if (*it % 2 == 0)
    13. {
    14. v.erase(it);
    15. }
    16. it++;
    17. }
    18. for (auto e : v)
    19. {
    20. cout << e << " ";
    21. }
    22. cout << endl;
    23. }

    删除成功了。但如果v中是1 2 3 4,就不行。

    B:

    1. void test3()
    2. {
    3. vector<int> v;
    4. v.push_back(1);
    5. v.push_back(2);
    6. v.push_back(3);
    7. v.push_back(4);
    8. ……
    9. }

    程序崩溃了:

    这是因为迭代器失效了,我们用图来说明原因:

    而{1,2,3,4,5}仅仅是碰巧,被删的偶数后面正好跟着奇数,所以没有暴露错误。

    那对于erase中迭代器失效的情况,写C++的大佬是怎么处理的呢?

    处理的思路是:将返回值由void 改为iterator,返回删除后pos的位置。这样的话,删完后迭代器还是指向pos,就不会错过pos位置的比较。

    修改后的erase:

    1. iterator erase(iterator pos)
    2. {
    3. assert(pos >= _start && pos < _finish ); //这里注意:不能<=_finish!因为它指向的是最后一个元素的后一个位置
    4. iterator begin = pos + 1;
    5. while (begin < _finish)
    6. {
    7. *(begin - 1) = *begin;
    8. begin++;
    9. }
    10. _finish--;
    11. return pos;
    12. }

    测试:

    1. void test3()
    2. {
    3. vector<int> v;
    4. v.push_back(1);
    5. v.push_back(2);
    6. v.push_back(3);
    7. v.push_back(4);
    8. //要求删除所有的偶数
    9. vector<int>::iterator it = v.begin();
    10. while (it != v.end())
    11. {
    12. if (*it % 2 == 0)   //用if else语句,删完以后迭代器仍停在pos位置,而不会自增
    13. {
    14. it = v.erase(it);
    15. }
    16. else
    17. {
    18. it++;
    19. }
    20. }
    21. for (auto e : v)
    22. {
    23. cout << e << " ";
    24. }
    25. cout << endl;
    26. }

    注意这里测试的写法!!v.erase()后,要用迭代器去承接它的返回值,并且用if  else语句使it增长。这样才能防止 因访问失效的迭代器,而导致程序崩溃。

    如果还是这个写法:

    1. void test5() {
    2. vector<int> v1;
    3. v1.push_back(1);
    4. v1.push_back(2);
    5. v1.push_back(3);
    6. v1.push_back(4);
    7. vector<int>::iterator it = v1.begin();
    8. while (it != v1.end()) {
    9. if (*it % 2 == 0) {
    10. v1.erase(it);
    11. }
    12. it++;
    13. }
    14. for (auto e : v1) {
    15. cout << e << " ";
    16. }
    17. }

    那仍会使程序崩溃!!

    其实迭代器失效是不会报错的,报错是因为访问了失效的迭代器

    所以说,用erase时一定要小心。

    要想程序正常运行,一是 底层实现时,得返回iterator;

    二是用erase时,用if  else语句,并且用iterator去承接函数的返回值。

    迭代器失效的笔试题

    运用刚刚学过的知识,来解答这个问题吧!

    下面的程序运行结果是?

    1. int main()
    2. {
    3. int ar[] ={1,2,3,4,0,5,6,7,8,9};
    4. int n = sizeof(ar) / sizeof(int);
    5. vector<int> v(ar, ar+n);
    6. vector<int>::iterator it = v.begin();
    7. while(it != v.end())
    8. {
    9. if(*it != 0)
    10. cout<<*it;
    11. else
    12. v.erase(it);
    13. it++;
    14. }
    15. return 0;
    16. }

    A.程序运行崩溃
    B.1 2 3 4 5 0 6 7 8 9
    C.1 2 3 4 5 6 7 8 9
    D.1 2 3 4 6 7 8 9

    我们刚刚强调了,用erase时,写法是很讲究的。if  else语句+用迭代器承接返回值 才能让程序正常运行。这样写,会因访问失效的迭代器而使程序崩溃。选A。

    深拷贝的实现

    拷贝构造函数

    如果我们用默认的拷贝构造函数,进行vector的浅拷贝的话:

    1. void test4()
    2. {
    3. vector<int> v1;
    4. vector<int> v2(v1);
    5. }

    这是因为,浅拷贝仅能复制值,而不能复制一份同样的空间。

    这样v1、v2就指向了同一块空间,析构v1、v2时,同一块空间被析构了两次,所以程序崩溃了。

    所以,我们要手动实现vector的拷贝构造,实现深拷贝。

    ➡️Way1 传统写法:老老实实地开空间、拷数据。

    1. vector(vector& v)
    2. :_start(new T[v.capacity()])
    3. , _finish(_start + v.size())
    4. , _end_of_storage(_start + v.capacity())
    5. {
    6. memcpy(_start, v._start, sizeof(T) * v.size());
    7. }

    ➡️Way2 现代写法:本质是复用现成的代码,“构造新对象+将自己和新对象进行swap”。

    1. vector(const vector& v)  
    2. :_start(nullptr)
    3. , _finish(nullptr)
    4. , _end_of_storage(nullptr)
    5. {
    6. vector tmp(v.begin(), v.end());
    7. swap(_start, tmp._start);
    8. swap(_finish, tmp._finish);
    9. swap(_end_of_storage, tmp._end_of_storage);
    10. }

    赋值operator=

    1. vector& operator=(vector v)   //因为是传值传参,v就已经是实参的拷贝了,所以不需要再构造tmp
    2. {
    3. swap(_start, v._start);
    4. swap(_finish, v._finish);
    5. swap(_end_of_storage, v._end_of_storage);
    6. return *this;
    7. }

  • 相关阅读:
    Go 微服务开发框架 DMicro 的设计思路
    kprobe 内核实现原理
    【历史上的今天】11 月 2 日:蠕虫起源;NP 问题的提出者诞生;领英注册域名
    彻底搞懂硬盘相关的概念
    2023.9.7 关于 TCP / IP 的基本认知
    你知道吗?chrome自动更新到104版本,居然引起Java服务内存泄漏
    又一单SoC行泊一体域控发布!这家厂商将性能和成本“卷”到极致
    PyCharm控制台中英文显示切换
    『C语言进阶』字符函数和内存函数(2)
    爬虫使用代理IP不会被限的原因解析
  • 原文地址:https://blog.csdn.net/2301_76540463/article/details/133611956