NLP预训练模型分层学习率衰减

最新推荐文章于 2025-05-30 16:18:40 发布

JY HUA

最新推荐文章于 2025-05-30 16:18:40 发布

阅读量830

点赞数 1

分类专栏：人工智能 nlp

本文链接：https://blog.youkuaiyun.com/CallMeYunzi/article/details/119891390

版权

nlp 同时被 2 个专栏收录

11 篇文章

订阅专栏

人工智能

5 篇文章

订阅专栏

# ref: <How to Fine-Tune BERT for Text Classification? >
    from transformers import AdamW
    # 分层学习率衰减
    # 基础学习率
    lr_base = 5e-6
    lr_classifier = 5e-5
    # 衰减系数
    xi = 0.95

    lr = dict()
    lr[23] = lr_base
    for k in range(23,0,-1):
        lr[k-1] = 0.95*lr[k]
    print('lr_decay: ', lr)

    adamw_lr = [{"params": model.roberta.encoder.layer[i].parameters(), "lr": lr[i]} for i in range(24)]
    adamw_lr.append({"params": model.classifier.parameters(),"lr": lr_classifier})
    print(adamw_lr)
    optimizer = AdamW(
        adamw_lr,
        lr=lr_classifier
    )
    # 在finetune时使用这个optimizer

根据论文<How to Fine-Tune BERT for Text Classification? >