• 解决deepspeed框架的bug:不保存调度器状态,模型训练重启时学习率从头开始


    deepspeed存在一个bug,即在训练时不保存调度器状态,因此如果训练中断后再重新开始训练,调度器还是会从头开始而不是接着上一个checkpoint的调度器状态来训练。这个bug在deepspeed的github中也有其他人提出:https://github.com/microsoft/DeepSpeed/issues/3875
    因此我们需要写一个保存调度器状态的代码,才可以解决这个问题。
    具体方法是加一个callback类,专门负责保存调度器的状态以及在训练重新开始时加载调度器的状态:
    先在训练文件中给trainer加一个callback

    from smoe.callbacks.save_model import SchedulerStateCallback
    trainer.add_callback(SchedulerStateCallback)
    
    • 1
    • 2
    class SchedulerStateCallback(TrainerCallback):
        def on_save(self, args: TrainingArguments, state: TrainerState, control: TrainerControl, **kwargs):
            if os.environ.get("RANK", "0") == "0":
                #scheduler = kwargs['lr_scheduler']
                scheduler = kwargs.get("lr_scheduler")
                if scheduler is None:
                    return 
                scheduler_state = scheduler.state_dict()
                #save_path = os.path.join(args.output_dir, SCHEDULER_NAME)
                 # 使用 PREFIX_CHECKPOINT_DIR 和 global_step 创建检查点目录名
                checkpoint_folder = f"{PREFIX_CHECKPOINT_DIR}-{state.global_step}"
                # 完整的检查点目录路径
                checkpoint_path = os.path.join(args.output_dir, checkpoint_folder)
                # 如果目录不存在,则创建它
                if not os.path.exists(checkpoint_path):
                    os.makedirs(checkpoint_path)
                # 完整的保存路径
                save_path = os.path.join(checkpoint_path, SCHEDULER_NAME)
                # 保存scheduler状态
                torch.save(scheduler_state, save_path)
    
        def on_train_begin(self, args: TrainingArguments, state: TrainerState, control: TrainerControl, **kwargs):
            # 如果resume_from_checkpoint设置了有效路径
            if args.resume_from_checkpoint is not None:
                load_path = os.path.join(args.resume_from_checkpoint, SCHEDULER_NAME)
                # 如果该路径下有保存的调度器状态,则加载它
                if os.path.exists(load_path):
                    #scheduler = kwargs['lr_scheduler']
                    scheduler = kwargs.get("lr_scheduler")
                    if scheduler is None:
                        return 
                    scheduler_state = torch.load(load_path)
                    scheduler.load_state_dict(scheduler_state)
    
    
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7
    • 8
    • 9
    • 10
    • 11
    • 12
    • 13
    • 14
    • 15
    • 16
    • 17
    • 18
    • 19
    • 20
    • 21
    • 22
    • 23
    • 24
    • 25
    • 26
    • 27
    • 28
    • 29
    • 30
    • 31
    • 32
    • 33
    • 34

    解决效果如下,我们可以看到,在chaeckpoint10重新开始训练的时候,学习率是接着之前的学习率开始的(5.5e-7),而不是从头开始(0.5e-7):
    在这里插入图片描述在这里插入图片描述

  • 相关阅读:
    T8161B T8403 T8448 ICS TRIPLEX 具有支持物联网边缘的计算机视觉
    C++ break 语句
    JAVA最全面试题汇总基础篇(一)
    2023腾讯云服务器优惠价格表_10月更新报价
    LeetCode第225题—用队列实践栈
    Redis快速入门
    武汉星起航跨境——中东电商蓬勃发展,亚马逊中东站点如何发货?
    c++中的string和vector
    python版本高,使用虚拟环境降版本
    Leetcode刷题详解——二分查找
  • 原文地址:https://blog.csdn.net/tongjingqi_/article/details/132700846