stanford_alpaca/configs/default_offload_opt_param.json

{
  "bf16": {
    "enabled": "auto"
  },
  "optimizer": {
    "type": "AdamW",
    "params": {
      "lr": "auto",
      "betas": "auto",
      "eps": "auto",
      "weight_decay": "auto"
    }
  },
  "scheduler": {
    "type": "WarmupDecayLR",
    "params": {
      "total_num_steps": "auto",
      "warmup_min_lr": "auto",
      "warmup_max_lr": "auto",
      "warmup_num_steps": "auto"
    }
  },
  "zero_optimization": {
    "stage": 3,
    "offload_optimizer": {
      "device": "cpu",
      "pin_memory": true
    },
    "offload_param": {
      "device": "cpu",
      "pin_memory": true
    },
    "overlap_comm": true,
    "contiguous_gradients": true,
    "sub_group_size": 1e9,
    "reduce_bucket_size": "auto",
    "stage3_prefetch_bucket_size": "auto",
    "stage3_param_persistence_threshold": "auto",
    "stage3_max_live_parameters": 1e9,
    "stage3_max_reuse_distance": 1e9,
    "stage3_gather_16bit_weights_on_model_save": false
  },
  "gradient_accumulation_steps": "auto",
  "gradient_clipping": "auto",
  "steps_per_print": 5,
  "train_batch_size": "auto",
  "train_micro_batch_size_per_gpu": "auto",
  "wall_clock_breakdown": false
}
migrate to latest main for hf transformers. 2023-04-15 18:48:27 -04:00			`{`
			`"bf16": {`
			`"enabled": "auto"`
			`},`
			`"optimizer": {`
			`"type": "AdamW",`
			`"params": {`
			`"lr": "auto",`
			`"betas": "auto",`
			`"eps": "auto",`
			`"weight_decay": "auto"`
			`}`
			`},`
			`"scheduler": {`
			`"type": "WarmupDecayLR",`
			`"params": {`
			`"total_num_steps": "auto",`
			`"warmup_min_lr": "auto",`
			`"warmup_max_lr": "auto",`
			`"warmup_num_steps": "auto"`
			`}`
			`},`
			`"zero_optimization": {`
			`"stage": 3,`
			`"offload_optimizer": {`
			`"device": "cpu",`
			`"pin_memory": true`
			`},`
			`"offload_param": {`
			`"device": "cpu",`
			`"pin_memory": true`
			`},`
			`"overlap_comm": true,`
			`"contiguous_gradients": true,`
			`"sub_group_size": 1e9,`
			`"reduce_bucket_size": "auto",`
			`"stage3_prefetch_bucket_size": "auto",`
			`"stage3_param_persistence_threshold": "auto",`
			`"stage3_max_live_parameters": 1e9,`
			`"stage3_max_reuse_distance": 1e9,`
			`"stage3_gather_16bit_weights_on_model_save": false`
			`},`
			`"gradient_accumulation_steps": "auto",`
			`"gradient_clipping": "auto",`
			`"steps_per_print": 5,`
			`"train_batch_size": "auto",`
			`"train_micro_batch_size_per_gpu": "auto",`
			`"wall_clock_breakdown": false`
			`}`