{
  "best_metric": 37.51884191837713,
  "best_model_checkpoint": "/workspace/models/kuku-yalanji-nllb-lora/tpi-proxy-full-v0.7.0-1.3b/checkpoint-3200",
  "epoch": 7.981314044605184,
  "eval_steps": 800,
  "global_step": 3312,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.12055455093429777,
      "grad_norm": 0.7011989951133728,
      "learning_rate": 1.8867924528301888e-05,
      "loss": 6.9341,
      "step": 50
    },
    {
      "epoch": 0.24110910186859555,
      "grad_norm": 0.4326478838920593,
      "learning_rate": 3.7735849056603776e-05,
      "loss": 5.9308,
      "step": 100
    },
    {
      "epoch": 0.3616636528028933,
      "grad_norm": 0.6046058535575867,
      "learning_rate": 5.660377358490566e-05,
      "loss": 4.6735,
      "step": 150
    },
    {
      "epoch": 0.4822182037371911,
      "grad_norm": 0.8925219774246216,
      "learning_rate": 7.547169811320755e-05,
      "loss": 3.8078,
      "step": 200
    },
    {
      "epoch": 0.6027727546714888,
      "grad_norm": 1.0035109519958496,
      "learning_rate": 9.433962264150944e-05,
      "loss": 3.2766,
      "step": 250
    },
    {
      "epoch": 0.7233273056057866,
      "grad_norm": 1.0991212129592896,
      "learning_rate": 9.885132917623893e-05,
      "loss": 2.988,
      "step": 300
    },
    {
      "epoch": 0.8438818565400844,
      "grad_norm": 1.2047384977340698,
      "learning_rate": 9.721037085658024e-05,
      "loss": 2.7979,
      "step": 350
    },
    {
      "epoch": 0.9644364074743822,
      "grad_norm": 1.266750693321228,
      "learning_rate": 9.556941253692157e-05,
      "loss": 2.6722,
      "step": 400
    },
    {
      "epoch": 1.0843881856540085,
      "grad_norm": 1.270340085029602,
      "learning_rate": 9.392845421726288e-05,
      "loss": 2.5752,
      "step": 450
    },
    {
      "epoch": 1.2049427365883063,
      "grad_norm": 1.4205182790756226,
      "learning_rate": 9.228749589760421e-05,
      "loss": 2.5062,
      "step": 500
    },
    {
      "epoch": 1.3254972875226039,
      "grad_norm": 1.3583706617355347,
      "learning_rate": 9.064653757794552e-05,
      "loss": 2.4355,
      "step": 550
    },
    {
      "epoch": 1.4460518384569019,
      "grad_norm": 1.4683573246002197,
      "learning_rate": 8.900557925828684e-05,
      "loss": 2.3854,
      "step": 600
    },
    {
      "epoch": 1.5666063893911994,
      "grad_norm": 1.3759533166885376,
      "learning_rate": 8.736462093862816e-05,
      "loss": 2.308,
      "step": 650
    },
    {
      "epoch": 1.6871609403254972,
      "grad_norm": 1.5599948167800903,
      "learning_rate": 8.572366261896948e-05,
      "loss": 2.2723,
      "step": 700
    },
    {
      "epoch": 1.807715491259795,
      "grad_norm": 1.4645884037017822,
      "learning_rate": 8.40827042993108e-05,
      "loss": 2.245,
      "step": 750
    },
    {
      "epoch": 1.9282700421940928,
      "grad_norm": 1.4733694791793823,
      "learning_rate": 8.244174597965212e-05,
      "loss": 2.1837,
      "step": 800
    },
    {
      "epoch": 1.9282700421940928,
      "eval_bleu": 5.745601620522283,
      "eval_chrf": 34.265476545988385,
      "eval_loss": 2.064488410949707,
      "eval_runtime": 571.7256,
      "eval_samples_per_second": 0.896,
      "eval_steps_per_second": 0.224,
      "step": 800
    },
    {
      "epoch": 2.048221820373719,
      "grad_norm": 1.4852279424667358,
      "learning_rate": 8.080078765999343e-05,
      "loss": 2.118,
      "step": 850
    },
    {
      "epoch": 2.168776371308017,
      "grad_norm": 1.4823975563049316,
      "learning_rate": 7.915982934033476e-05,
      "loss": 2.1111,
      "step": 900
    },
    {
      "epoch": 2.2893309222423146,
      "grad_norm": 1.4456065893173218,
      "learning_rate": 7.751887102067608e-05,
      "loss": 2.0722,
      "step": 950
    },
    {
      "epoch": 2.4098854731766126,
      "grad_norm": 1.540734052658081,
      "learning_rate": 7.587791270101739e-05,
      "loss": 2.0697,
      "step": 1000
    },
    {
      "epoch": 2.53044002411091,
      "grad_norm": 1.5800021886825562,
      "learning_rate": 7.423695438135872e-05,
      "loss": 2.0261,
      "step": 1050
    },
    {
      "epoch": 2.6509945750452077,
      "grad_norm": 1.6800216436386108,
      "learning_rate": 7.259599606170003e-05,
      "loss": 2.0175,
      "step": 1100
    },
    {
      "epoch": 2.7715491259795058,
      "grad_norm": 1.5690984725952148,
      "learning_rate": 7.095503774204136e-05,
      "loss": 1.9962,
      "step": 1150
    },
    {
      "epoch": 2.8921036769138038,
      "grad_norm": 1.6291311979293823,
      "learning_rate": 6.931407942238267e-05,
      "loss": 1.9929,
      "step": 1200
    },
    {
      "epoch": 3.0120554550934298,
      "grad_norm": 1.5064247846603394,
      "learning_rate": 6.767312110272399e-05,
      "loss": 1.9517,
      "step": 1250
    },
    {
      "epoch": 3.1326100060277273,
      "grad_norm": 1.5832884311676025,
      "learning_rate": 6.603216278306531e-05,
      "loss": 1.9241,
      "step": 1300
    },
    {
      "epoch": 3.2531645569620253,
      "grad_norm": 1.5303477048873901,
      "learning_rate": 6.439120446340663e-05,
      "loss": 1.8927,
      "step": 1350
    },
    {
      "epoch": 3.373719107896323,
      "grad_norm": 1.5153700113296509,
      "learning_rate": 6.275024614374794e-05,
      "loss": 1.8643,
      "step": 1400
    },
    {
      "epoch": 3.494273658830621,
      "grad_norm": 1.4146010875701904,
      "learning_rate": 6.110928782408927e-05,
      "loss": 1.8715,
      "step": 1450
    },
    {
      "epoch": 3.6148282097649185,
      "grad_norm": 1.6569846868515015,
      "learning_rate": 5.9468329504430584e-05,
      "loss": 1.8808,
      "step": 1500
    },
    {
      "epoch": 3.7353827606992165,
      "grad_norm": 1.65733802318573,
      "learning_rate": 5.7827371184771905e-05,
      "loss": 1.8694,
      "step": 1550
    },
    {
      "epoch": 3.855937311633514,
      "grad_norm": 1.6046892404556274,
      "learning_rate": 5.6186412865113225e-05,
      "loss": 1.8343,
      "step": 1600
    },
    {
      "epoch": 3.855937311633514,
      "eval_bleu": 7.503115982694941,
      "eval_chrf": 36.551720290372955,
      "eval_loss": 1.8029884099960327,
      "eval_runtime": 555.5788,
      "eval_samples_per_second": 0.922,
      "eval_steps_per_second": 0.23,
      "step": 1600
    },
    {
      "epoch": 3.976491862567812,
      "grad_norm": 1.5489532947540283,
      "learning_rate": 5.4545454545454546e-05,
      "loss": 1.8403,
      "step": 1650
    },
    {
      "epoch": 4.096443640747438,
      "grad_norm": 1.635941982269287,
      "learning_rate": 5.290449622579586e-05,
      "loss": 1.7682,
      "step": 1700
    },
    {
      "epoch": 4.216998191681736,
      "grad_norm": 1.568151593208313,
      "learning_rate": 5.126353790613718e-05,
      "loss": 1.7891,
      "step": 1750
    },
    {
      "epoch": 4.337552742616034,
      "grad_norm": 1.4998947381973267,
      "learning_rate": 4.962257958647851e-05,
      "loss": 1.7709,
      "step": 1800
    },
    {
      "epoch": 4.458107293550332,
      "grad_norm": 1.5191479921340942,
      "learning_rate": 4.798162126681983e-05,
      "loss": 1.7569,
      "step": 1850
    },
    {
      "epoch": 4.578661844484629,
      "grad_norm": 1.431417465209961,
      "learning_rate": 4.634066294716114e-05,
      "loss": 1.762,
      "step": 1900
    },
    {
      "epoch": 4.699216395418927,
      "grad_norm": 1.4758356809616089,
      "learning_rate": 4.4699704627502464e-05,
      "loss": 1.748,
      "step": 1950
    },
    {
      "epoch": 4.819770946353225,
      "grad_norm": 1.4748455286026,
      "learning_rate": 4.3058746307843785e-05,
      "loss": 1.7689,
      "step": 2000
    },
    {
      "epoch": 4.940325497287523,
      "grad_norm": 1.5516161918640137,
      "learning_rate": 4.1417787988185106e-05,
      "loss": 1.7382,
      "step": 2050
    },
    {
      "epoch": 5.060277275467149,
      "grad_norm": 1.599636435508728,
      "learning_rate": 3.977682966852642e-05,
      "loss": 1.7097,
      "step": 2100
    },
    {
      "epoch": 5.180831826401446,
      "grad_norm": 1.600692629814148,
      "learning_rate": 3.813587134886774e-05,
      "loss": 1.699,
      "step": 2150
    },
    {
      "epoch": 5.301386377335745,
      "grad_norm": 1.5314520597457886,
      "learning_rate": 3.649491302920906e-05,
      "loss": 1.7002,
      "step": 2200
    },
    {
      "epoch": 5.421940928270042,
      "grad_norm": 1.459515929222107,
      "learning_rate": 3.485395470955038e-05,
      "loss": 1.6944,
      "step": 2250
    },
    {
      "epoch": 5.54249547920434,
      "grad_norm": 1.6453644037246704,
      "learning_rate": 3.3212996389891696e-05,
      "loss": 1.6763,
      "step": 2300
    },
    {
      "epoch": 5.6630500301386375,
      "grad_norm": 1.5115506649017334,
      "learning_rate": 3.157203807023302e-05,
      "loss": 1.6918,
      "step": 2350
    },
    {
      "epoch": 5.783604581072936,
      "grad_norm": 1.7721775770187378,
      "learning_rate": 2.9931079750574338e-05,
      "loss": 1.6837,
      "step": 2400
    },
    {
      "epoch": 5.783604581072936,
      "eval_bleu": 8.383335110829314,
      "eval_chrf": 37.09317266048331,
      "eval_loss": 1.7199342250823975,
      "eval_runtime": 513.0241,
      "eval_samples_per_second": 0.998,
      "eval_steps_per_second": 0.25,
      "step": 2400
    },
    {
      "epoch": 5.9041591320072335,
      "grad_norm": 1.6087058782577515,
      "learning_rate": 2.8290121430915655e-05,
      "loss": 1.6787,
      "step": 2450
    },
    {
      "epoch": 6.0241109101868595,
      "grad_norm": 1.6394050121307373,
      "learning_rate": 2.6649163111256976e-05,
      "loss": 1.6557,
      "step": 2500
    },
    {
      "epoch": 6.144665461121157,
      "grad_norm": 1.540924072265625,
      "learning_rate": 2.5008204791598293e-05,
      "loss": 1.6515,
      "step": 2550
    },
    {
      "epoch": 6.265220012055455,
      "grad_norm": 1.6035399436950684,
      "learning_rate": 2.3367246471939614e-05,
      "loss": 1.6319,
      "step": 2600
    },
    {
      "epoch": 6.385774562989753,
      "grad_norm": 1.6761345863342285,
      "learning_rate": 2.172628815228093e-05,
      "loss": 1.6444,
      "step": 2650
    },
    {
      "epoch": 6.506329113924051,
      "grad_norm": 1.602921485900879,
      "learning_rate": 2.0085329832622252e-05,
      "loss": 1.6384,
      "step": 2700
    },
    {
      "epoch": 6.626883664858348,
      "grad_norm": 1.6224963665008545,
      "learning_rate": 1.844437151296357e-05,
      "loss": 1.651,
      "step": 2750
    },
    {
      "epoch": 6.747438215792646,
      "grad_norm": 1.593356728553772,
      "learning_rate": 1.680341319330489e-05,
      "loss": 1.6202,
      "step": 2800
    },
    {
      "epoch": 6.867992766726944,
      "grad_norm": 1.5904091596603394,
      "learning_rate": 1.516245487364621e-05,
      "loss": 1.6391,
      "step": 2850
    },
    {
      "epoch": 6.988547317661242,
      "grad_norm": 1.624224066734314,
      "learning_rate": 1.3521496553987528e-05,
      "loss": 1.6271,
      "step": 2900
    },
    {
      "epoch": 7.108499095840868,
      "grad_norm": 1.710815668106079,
      "learning_rate": 1.1880538234328849e-05,
      "loss": 1.617,
      "step": 2950
    },
    {
      "epoch": 7.229053646775165,
      "grad_norm": 1.4938088655471802,
      "learning_rate": 1.0239579914670168e-05,
      "loss": 1.607,
      "step": 3000
    },
    {
      "epoch": 7.349608197709464,
      "grad_norm": 1.533431887626648,
      "learning_rate": 8.598621595011487e-06,
      "loss": 1.6138,
      "step": 3050
    },
    {
      "epoch": 7.470162748643761,
      "grad_norm": 1.5799800157546997,
      "learning_rate": 6.957663275352806e-06,
      "loss": 1.5807,
      "step": 3100
    },
    {
      "epoch": 7.590717299578059,
      "grad_norm": 1.721688151359558,
      "learning_rate": 5.3167049556941254e-06,
      "loss": 1.6137,
      "step": 3150
    },
    {
      "epoch": 7.7112718505123565,
      "grad_norm": 1.7273796796798706,
      "learning_rate": 3.6757466360354454e-06,
      "loss": 1.624,
      "step": 3200
    },
    {
      "epoch": 7.7112718505123565,
      "eval_bleu": 8.745046033766966,
      "eval_chrf": 37.51884191837713,
      "eval_loss": 1.6889560222625732,
      "eval_runtime": 499.8576,
      "eval_samples_per_second": 1.024,
      "eval_steps_per_second": 0.256,
      "step": 3200
    },
    {
      "epoch": 7.831826401446655,
      "grad_norm": 1.5664873123168945,
      "learning_rate": 2.034788316376764e-06,
      "loss": 1.6079,
      "step": 3250
    },
    {
      "epoch": 7.9523809523809526,
      "grad_norm": 1.6601020097732544,
      "learning_rate": 3.938299967180834e-07,
      "loss": 1.6032,
      "step": 3300
    }
  ],
  "logging_steps": 50,
  "max_steps": 3312,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 8,
  "save_steps": 800,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 5.11259258573783e+16,
  "train_batch_size": 4,
  "trial_name": null,
  "trial_params": null
}
