{
  "best_metric": 20.90273868497496,
  "best_model_checkpoint": "/workspace/mobtranslate-migmaq/runs/migmaq-v1-rc1/model/checkpoint-1440",
  "epoch": 7.9158620689655175,
  "eval_steps": 180,
  "global_step": 1440,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.1103448275862069,
      "grad_norm": 1.0960345268249512,
      "learning_rate": 1.7241379310344828e-05,
      "loss": 7.8123,
      "step": 20
    },
    {
      "epoch": 0.2206896551724138,
      "grad_norm": 0.9836035966873169,
      "learning_rate": 3.4482758620689657e-05,
      "loss": 7.5642,
      "step": 40
    },
    {
      "epoch": 0.3310344827586207,
      "grad_norm": 0.8543595671653748,
      "learning_rate": 5.172413793103449e-05,
      "loss": 6.7437,
      "step": 60
    },
    {
      "epoch": 0.4413793103448276,
      "grad_norm": 0.6166243553161621,
      "learning_rate": 6.896551724137931e-05,
      "loss": 5.8255,
      "step": 80
    },
    {
      "epoch": 0.5517241379310345,
      "grad_norm": 0.7834814786911011,
      "learning_rate": 8.620689655172413e-05,
      "loss": 5.3159,
      "step": 100
    },
    {
      "epoch": 0.6620689655172414,
      "grad_norm": 0.7816192507743835,
      "learning_rate": 9.96996996996997e-05,
      "loss": 4.9005,
      "step": 120
    },
    {
      "epoch": 0.7724137931034483,
      "grad_norm": 1.0438772439956665,
      "learning_rate": 9.81981981981982e-05,
      "loss": 4.7223,
      "step": 140
    },
    {
      "epoch": 0.8827586206896552,
      "grad_norm": 0.8962052464485168,
      "learning_rate": 9.66966966966967e-05,
      "loss": 4.5449,
      "step": 160
    },
    {
      "epoch": 0.993103448275862,
      "grad_norm": 1.033599853515625,
      "learning_rate": 9.51951951951952e-05,
      "loss": 4.4863,
      "step": 180
    },
    {
      "epoch": 0.993103448275862,
      "eval_bleu": 0.16765838926628987,
      "eval_chrf": 12.463361942763411,
      "eval_loss": 4.335728645324707,
      "eval_runtime": 65.7937,
      "eval_samples_per_second": 10.427,
      "eval_steps_per_second": 1.307,
      "step": 180
    },
    {
      "epoch": 1.0993103448275863,
      "grad_norm": 1.1378213167190552,
      "learning_rate": 9.36936936936937e-05,
      "loss": 4.1808,
      "step": 200
    },
    {
      "epoch": 1.2096551724137932,
      "grad_norm": 1.384518027305603,
      "learning_rate": 9.219219219219219e-05,
      "loss": 4.2477,
      "step": 220
    },
    {
      "epoch": 1.32,
      "grad_norm": 1.3660056591033936,
      "learning_rate": 9.069069069069069e-05,
      "loss": 4.2027,
      "step": 240
    },
    {
      "epoch": 1.430344827586207,
      "grad_norm": 1.3906512260437012,
      "learning_rate": 8.918918918918919e-05,
      "loss": 4.1059,
      "step": 260
    },
    {
      "epoch": 1.5406896551724136,
      "grad_norm": 1.6171739101409912,
      "learning_rate": 8.76876876876877e-05,
      "loss": 4.0805,
      "step": 280
    },
    {
      "epoch": 1.6510344827586207,
      "grad_norm": 1.6847319602966309,
      "learning_rate": 8.61861861861862e-05,
      "loss": 4.0101,
      "step": 300
    },
    {
      "epoch": 1.7613793103448274,
      "grad_norm": 1.429111361503601,
      "learning_rate": 8.468468468468469e-05,
      "loss": 4.0116,
      "step": 320
    },
    {
      "epoch": 1.8717241379310345,
      "grad_norm": 1.6324827671051025,
      "learning_rate": 8.318318318318319e-05,
      "loss": 3.9085,
      "step": 340
    },
    {
      "epoch": 1.9820689655172414,
      "grad_norm": 1.7615532875061035,
      "learning_rate": 8.168168168168169e-05,
      "loss": 3.9197,
      "step": 360
    },
    {
      "epoch": 1.9820689655172414,
      "eval_bleu": 0.48404126819549576,
      "eval_chrf": 15.359716652391825,
      "eval_loss": 3.8356380462646484,
      "eval_runtime": 79.0022,
      "eval_samples_per_second": 8.683,
      "eval_steps_per_second": 1.089,
      "step": 360
    },
    {
      "epoch": 2.0882758620689654,
      "grad_norm": 1.8370529413223267,
      "learning_rate": 8.018018018018019e-05,
      "loss": 3.7096,
      "step": 380
    },
    {
      "epoch": 2.1986206896551725,
      "grad_norm": 1.7629789113998413,
      "learning_rate": 7.867867867867868e-05,
      "loss": 3.836,
      "step": 400
    },
    {
      "epoch": 2.308965517241379,
      "grad_norm": 1.724611759185791,
      "learning_rate": 7.717717717717718e-05,
      "loss": 3.8296,
      "step": 420
    },
    {
      "epoch": 2.4193103448275863,
      "grad_norm": 1.6361961364746094,
      "learning_rate": 7.567567567567568e-05,
      "loss": 3.7803,
      "step": 440
    },
    {
      "epoch": 2.529655172413793,
      "grad_norm": 1.7837014198303223,
      "learning_rate": 7.417417417417419e-05,
      "loss": 3.8084,
      "step": 460
    },
    {
      "epoch": 2.64,
      "grad_norm": 1.6923669576644897,
      "learning_rate": 7.267267267267268e-05,
      "loss": 3.7476,
      "step": 480
    },
    {
      "epoch": 2.750344827586207,
      "grad_norm": 1.8435031175613403,
      "learning_rate": 7.117117117117116e-05,
      "loss": 3.6954,
      "step": 500
    },
    {
      "epoch": 2.860689655172414,
      "grad_norm": 2.0199050903320312,
      "learning_rate": 6.966966966966967e-05,
      "loss": 3.6329,
      "step": 520
    },
    {
      "epoch": 2.9710344827586206,
      "grad_norm": 1.7808223962783813,
      "learning_rate": 6.816816816816817e-05,
      "loss": 3.6888,
      "step": 540
    },
    {
      "epoch": 2.9710344827586206,
      "eval_bleu": 0.6223286620873894,
      "eval_chrf": 16.471575253145918,
      "eval_loss": 3.6013119220733643,
      "eval_runtime": 80.2696,
      "eval_samples_per_second": 8.546,
      "eval_steps_per_second": 1.071,
      "step": 540
    },
    {
      "epoch": 3.077241379310345,
      "grad_norm": 1.6735594272613525,
      "learning_rate": 6.666666666666667e-05,
      "loss": 3.5314,
      "step": 560
    },
    {
      "epoch": 3.187586206896552,
      "grad_norm": 1.9598361253738403,
      "learning_rate": 6.516516516516516e-05,
      "loss": 3.5681,
      "step": 580
    },
    {
      "epoch": 3.2979310344827586,
      "grad_norm": 2.051518678665161,
      "learning_rate": 6.366366366366366e-05,
      "loss": 3.6299,
      "step": 600
    },
    {
      "epoch": 3.4082758620689657,
      "grad_norm": 1.9495127201080322,
      "learning_rate": 6.216216216216216e-05,
      "loss": 3.5307,
      "step": 620
    },
    {
      "epoch": 3.5186206896551724,
      "grad_norm": 2.001026153564453,
      "learning_rate": 6.0660660660660665e-05,
      "loss": 3.57,
      "step": 640
    },
    {
      "epoch": 3.6289655172413795,
      "grad_norm": 2.182462215423584,
      "learning_rate": 5.915915915915916e-05,
      "loss": 3.5731,
      "step": 660
    },
    {
      "epoch": 3.739310344827586,
      "grad_norm": 2.3165998458862305,
      "learning_rate": 5.765765765765766e-05,
      "loss": 3.5554,
      "step": 680
    },
    {
      "epoch": 3.849655172413793,
      "grad_norm": 1.9868271350860596,
      "learning_rate": 5.615615615615616e-05,
      "loss": 3.546,
      "step": 700
    },
    {
      "epoch": 3.96,
      "grad_norm": 2.1633987426757812,
      "learning_rate": 5.465465465465466e-05,
      "loss": 3.5413,
      "step": 720
    },
    {
      "epoch": 3.96,
      "eval_bleu": 0.8660361185193649,
      "eval_chrf": 18.47887061026974,
      "eval_loss": 3.4398512840270996,
      "eval_runtime": 85.5688,
      "eval_samples_per_second": 8.017,
      "eval_steps_per_second": 1.005,
      "step": 720
    },
    {
      "epoch": 4.066206896551724,
      "grad_norm": 2.255176305770874,
      "learning_rate": 5.3153153153153155e-05,
      "loss": 3.3259,
      "step": 740
    },
    {
      "epoch": 4.176551724137931,
      "grad_norm": 2.254042387008667,
      "learning_rate": 5.165165165165166e-05,
      "loss": 3.408,
      "step": 760
    },
    {
      "epoch": 4.286896551724138,
      "grad_norm": 2.2617976665496826,
      "learning_rate": 5.015015015015015e-05,
      "loss": 3.4249,
      "step": 780
    },
    {
      "epoch": 4.397241379310345,
      "grad_norm": 2.180143356323242,
      "learning_rate": 4.8648648648648654e-05,
      "loss": 3.4719,
      "step": 800
    },
    {
      "epoch": 4.507586206896551,
      "grad_norm": 2.0861873626708984,
      "learning_rate": 4.714714714714715e-05,
      "loss": 3.4305,
      "step": 820
    },
    {
      "epoch": 4.617931034482758,
      "grad_norm": 2.2661542892456055,
      "learning_rate": 4.5645645645645645e-05,
      "loss": 3.4599,
      "step": 840
    },
    {
      "epoch": 4.7282758620689656,
      "grad_norm": 2.313872814178467,
      "learning_rate": 4.414414414414415e-05,
      "loss": 3.4394,
      "step": 860
    },
    {
      "epoch": 4.838620689655173,
      "grad_norm": 2.1619489192962646,
      "learning_rate": 4.264264264264264e-05,
      "loss": 3.4297,
      "step": 880
    },
    {
      "epoch": 4.94896551724138,
      "grad_norm": 2.3507044315338135,
      "learning_rate": 4.1141141141141144e-05,
      "loss": 3.3812,
      "step": 900
    },
    {
      "epoch": 4.94896551724138,
      "eval_bleu": 0.9134969735073716,
      "eval_chrf": 19.630807799535308,
      "eval_loss": 3.345947027206421,
      "eval_runtime": 83.0245,
      "eval_samples_per_second": 8.263,
      "eval_steps_per_second": 1.036,
      "step": 900
    },
    {
      "epoch": 5.055172413793104,
      "grad_norm": 2.1798341274261475,
      "learning_rate": 3.963963963963964e-05,
      "loss": 3.2178,
      "step": 920
    },
    {
      "epoch": 5.165517241379311,
      "grad_norm": 2.2657856941223145,
      "learning_rate": 3.813813813813814e-05,
      "loss": 3.3507,
      "step": 940
    },
    {
      "epoch": 5.275862068965517,
      "grad_norm": 2.2884743213653564,
      "learning_rate": 3.663663663663664e-05,
      "loss": 3.3596,
      "step": 960
    },
    {
      "epoch": 5.386206896551724,
      "grad_norm": 2.3985369205474854,
      "learning_rate": 3.513513513513514e-05,
      "loss": 3.3311,
      "step": 980
    },
    {
      "epoch": 5.496551724137931,
      "grad_norm": 2.3259048461914062,
      "learning_rate": 3.3633633633633635e-05,
      "loss": 3.3046,
      "step": 1000
    },
    {
      "epoch": 5.606896551724138,
      "grad_norm": 2.2352914810180664,
      "learning_rate": 3.213213213213213e-05,
      "loss": 3.3049,
      "step": 1020
    },
    {
      "epoch": 5.7172413793103445,
      "grad_norm": 2.2237415313720703,
      "learning_rate": 3.063063063063063e-05,
      "loss": 3.2475,
      "step": 1040
    },
    {
      "epoch": 5.827586206896552,
      "grad_norm": 2.3684418201446533,
      "learning_rate": 2.912912912912913e-05,
      "loss": 3.3834,
      "step": 1060
    },
    {
      "epoch": 5.937931034482759,
      "grad_norm": 2.3145265579223633,
      "learning_rate": 2.762762762762763e-05,
      "loss": 3.3205,
      "step": 1080
    },
    {
      "epoch": 5.937931034482759,
      "eval_bleu": 1.2834734566308728,
      "eval_chrf": 20.59770622137929,
      "eval_loss": 3.2714765071868896,
      "eval_runtime": 80.7764,
      "eval_samples_per_second": 8.493,
      "eval_steps_per_second": 1.065,
      "step": 1080
    },
    {
      "epoch": 6.0441379310344825,
      "grad_norm": 2.427734851837158,
      "learning_rate": 2.6126126126126128e-05,
      "loss": 3.1946,
      "step": 1100
    },
    {
      "epoch": 6.15448275862069,
      "grad_norm": 2.2713942527770996,
      "learning_rate": 2.4624624624624627e-05,
      "loss": 3.2442,
      "step": 1120
    },
    {
      "epoch": 6.264827586206897,
      "grad_norm": 2.415048837661743,
      "learning_rate": 2.3123123123123125e-05,
      "loss": 3.263,
      "step": 1140
    },
    {
      "epoch": 6.375172413793104,
      "grad_norm": 2.5164527893066406,
      "learning_rate": 2.1621621621621624e-05,
      "loss": 3.2656,
      "step": 1160
    },
    {
      "epoch": 6.48551724137931,
      "grad_norm": 2.3166003227233887,
      "learning_rate": 2.012012012012012e-05,
      "loss": 3.2448,
      "step": 1180
    },
    {
      "epoch": 6.595862068965517,
      "grad_norm": 2.4854772090911865,
      "learning_rate": 1.8618618618618618e-05,
      "loss": 3.2717,
      "step": 1200
    },
    {
      "epoch": 6.706206896551724,
      "grad_norm": 2.4885852336883545,
      "learning_rate": 1.7117117117117117e-05,
      "loss": 3.2473,
      "step": 1220
    },
    {
      "epoch": 6.816551724137931,
      "grad_norm": 2.4665870666503906,
      "learning_rate": 1.5615615615615616e-05,
      "loss": 3.2221,
      "step": 1240
    },
    {
      "epoch": 6.926896551724138,
      "grad_norm": 2.261301279067993,
      "learning_rate": 1.4114114114114116e-05,
      "loss": 3.2934,
      "step": 1260
    },
    {
      "epoch": 6.926896551724138,
      "eval_bleu": 1.1601988315075908,
      "eval_chrf": 20.71442465389354,
      "eval_loss": 3.2290875911712646,
      "eval_runtime": 80.9845,
      "eval_samples_per_second": 8.471,
      "eval_steps_per_second": 1.062,
      "step": 1260
    },
    {
      "epoch": 7.033103448275862,
      "grad_norm": 2.32366681098938,
      "learning_rate": 1.2612612612612611e-05,
      "loss": 3.175,
      "step": 1280
    },
    {
      "epoch": 7.1434482758620685,
      "grad_norm": 2.4811108112335205,
      "learning_rate": 1.1111111111111112e-05,
      "loss": 3.2413,
      "step": 1300
    },
    {
      "epoch": 7.253793103448276,
      "grad_norm": 2.476182699203491,
      "learning_rate": 9.60960960960961e-06,
      "loss": 3.191,
      "step": 1320
    },
    {
      "epoch": 7.364137931034483,
      "grad_norm": 2.410552501678467,
      "learning_rate": 8.108108108108109e-06,
      "loss": 3.2615,
      "step": 1340
    },
    {
      "epoch": 7.47448275862069,
      "grad_norm": 2.5023603439331055,
      "learning_rate": 6.606606606606607e-06,
      "loss": 3.2466,
      "step": 1360
    },
    {
      "epoch": 7.584827586206897,
      "grad_norm": 2.351749897003174,
      "learning_rate": 5.105105105105106e-06,
      "loss": 3.2014,
      "step": 1380
    },
    {
      "epoch": 7.695172413793103,
      "grad_norm": 2.4354088306427,
      "learning_rate": 3.603603603603604e-06,
      "loss": 3.1852,
      "step": 1400
    },
    {
      "epoch": 7.80551724137931,
      "grad_norm": 2.404743194580078,
      "learning_rate": 2.102102102102102e-06,
      "loss": 3.2569,
      "step": 1420
    },
    {
      "epoch": 7.9158620689655175,
      "grad_norm": 2.3349010944366455,
      "learning_rate": 6.006006006006006e-07,
      "loss": 3.2273,
      "step": 1440
    },
    {
      "epoch": 7.9158620689655175,
      "eval_bleu": 1.1713297280145971,
      "eval_chrf": 20.90273868497496,
      "eval_loss": 3.216315269470215,
      "eval_runtime": 82.475,
      "eval_samples_per_second": 8.318,
      "eval_steps_per_second": 1.043,
      "step": 1440
    }
  ],
  "logging_steps": 20,
  "max_steps": 1448,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 8,
  "save_steps": 180,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 3804968170156032.0,
  "train_batch_size": 8,
  "trial_name": null,
  "trial_params": null
}
