检查点保存与恢复指南
在 ROLL 框架中,检查点(Checkpoint)机制允许您保存 训练过程中的模型状态,以便在需要时恢复训练。本文档将详细介绍如何配置和使用检查点保存与恢复功能。
检查点保存配置
ROLL 框架通过 checkpoint_config 参数来配置检查点保存的相关设置。以下是一个典型的配置示例:
checkpoint_config:
type: file_system
output_dir: /data/cpfs_0/rl_examples/models/${exp_name}
配置参数详解
-
type: 指定检查点存储的类型
- 目前支持
file_system,表示将检查点保存到文件系统中
- 目前支持
-
output_dir: 指定检查点保存的目录路径
- 可以使用变量,如
${exp_name}表示实验名称 - 框架会在该目录下自动创建时间戳子目录来区分不同的检查点
- 可以使用变量,如
检查点保存机制
ROLL 框架会在以下情况下自动保存检查点:
-
定期保存: 根据
save_steps参数设置的间隔自动保存save_steps: 100 # 每100步保存一次检查点 -
训练结束时: 在训练完成时自动保存最终检查点
-
手动保存: 在代码中可以调用相应的 API 手动保存检查点
恢复训练配置
要从检查点恢复训练,需要设置 resume_from_checkpoint 参数:
resume_from_checkpoint: false # 默认不恢复训练
要启用恢复训练功能,将该参数设置为检查点路径:
resume_from_checkpoint: /data/cpfs_0/rl_examples/models/exp_name/checkpoint-500