{
  "model_id": "mobtranslate/kuku-yalanji-nllb-lora",
  "version": "v24.3-J69-rerun1",
  "run_id": "v24.3-J69-seed17-rerun1",
  "created_at": "2026-07-15T17:33:31.582296+00:00",
  "base_model": "/workspace/v24.1-lexical-calibration/base_model/merged",
  "base_model_revision": null,
  "license": "research-only; source-specific rights and upstream NLLB CC-BY-NC apply",
  "direction": "eng-gvn",
  "source_lang": "eng_Latn",
  "target_lang": "gvn_Latn",
  "target_lang_init_from": null,
  "source_lang_token_id": 256047,
  "target_lang_token_id": 256204,
  "token_adaptation": {
    "additional_special_tokens": [
      {
        "token": "<lexeme>",
        "token_id": 256205,
        "round_trip": true,
        "single_encoded_id": true,
        "is_special": true,
        "status": "new_token_decomposition_mean",
        "old_token_id": null,
        "decomposition_ids": [
          45,
          20228,
          1633,
          248123
        ],
        "decomposition_tokens": [
          "\u2581<",
          "lex",
          "eme",
          ">"
        ]
      }
    ],
    "trainable_tokens": [
      {
        "token": "<lexeme>",
        "token_id": 256205
      }
    ],
    "trainable_token_wrapper_modules": [
      "base_model.model.model.shared",
      "base_model.model.model.encoder.embed_tokens",
      "base_model.model.model.decoder.embed_tokens",
      "base_model.model.lm_head"
    ],
    "embedding_row_delta_audit": [
      {
        "token": "</s>",
        "selected_for_training": false,
        "input_delta_l2": 0.0,
        "input_delta_max_abs": 0.0,
        "input_changed": false,
        "output_delta_l2": 0.0,
        "output_delta_max_abs": 0.0,
        "output_changed": false
      },
      {
        "token": "<lexeme>",
        "selected_for_training": true,
        "input_delta_l2": 0.1110018715262413,
        "input_delta_max_abs": 0.01171875,
        "input_changed": true,
        "output_delta_l2": 0.1110018715262413,
        "output_delta_max_abs": 0.01171875,
        "output_changed": true
      },
      {
        "token": "<pad>",
        "selected_for_training": false,
        "input_delta_l2": 0.0,
        "input_delta_max_abs": 0.0,
        "input_changed": false,
        "output_delta_l2": 0.0,
        "output_delta_max_abs": 0.0,
        "output_changed": false
      },
      {
        "token": "eng_Latn",
        "selected_for_training": false,
        "input_delta_l2": 0.0,
        "input_delta_max_abs": 0.0,
        "input_changed": false,
        "output_delta_l2": 0.0,
        "output_delta_max_abs": 0.0,
        "output_changed": false
      },
      {
        "token": "gvn_Latn",
        "selected_for_training": false,
        "input_delta_l2": 0.0,
        "input_delta_max_abs": 0.0,
        "input_changed": false,
        "output_delta_l2": 0.0,
        "output_delta_max_abs": 0.0,
        "output_changed": false
      }
    ],
    "unselected_audit_rows_unchanged": true
  },
  "dataset": {
    "dataset_id": "v24.3-joint-lexeme-dose29",
    "release_sha256": "b45cf115c03b41134e481071f6c324fe3180bd73a77720afb8d00529a8dfde1b",
    "train_file": "/workspace/v24.3-joint-lexeme-dose29-rerun1/data/joint/train.eng-gvn.jsonl",
    "validation_file": "/workspace/v24.3-joint-lexeme-dose29-rerun1/data/joint/validation.eng-gvn.jsonl",
    "test_file": null,
    "file_sha256": {
      "train": "9f99ea3c4f2a10b1dac8e4439bc8418c5589fa0dbbb21b79c994980d479b39d0",
      "validation": "52aaf4768554b97c3b9a664858ccc5683d255cc03de5569d9f559cd6fc8587a1",
      "test": null
    },
    "split_rows": {
      "train": 115136,
      "validation": 128
    },
    "token_inventory": {
      "train": {
        "examples": 115136,
        "source_tokens": 1268518,
        "target_tokens": 1122677,
        "non_padding_tokens": 2391195,
        "counts_are_post_truncation": true,
        "by_task": {
          "dictionary_lexeme": {
            "examples": 78996,
            "source_tokens": 441902,
            "target_tokens": 384569,
            "non_padding_tokens": 826471
          },
          "synthetic_academic_parallel": {
            "examples": 33284,
            "source_tokens": 713552,
            "target_tokens": 704692,
            "non_padding_tokens": 1418244
          },
          "usage_example": {
            "examples": 2856,
            "source_tokens": 113064,
            "target_tokens": 33416,
            "non_padding_tokens": 146480
          }
        }
      },
      "validation": {
        "examples": 128,
        "source_tokens": 1740,
        "target_tokens": 1682,
        "non_padding_tokens": 3422,
        "counts_are_post_truncation": true,
        "by_task": {
          "dictionary_lexeme": {
            "examples": 64,
            "source_tokens": 357,
            "target_tokens": 312,
            "non_padding_tokens": 669
          },
          "synthetic_academic_parallel": {
            "examples": 64,
            "source_tokens": 1383,
            "target_tokens": 1370,
            "non_padding_tokens": 2753
          }
        }
      }
    },
    "max_train_samples": null,
    "max_validation_samples": null,
    "max_test_samples": null,
    "shuffle_before_cap": false
  },
  "training_args": {
    "epochs": 999.0,
    "max_steps": 3598,
    "batch_size": 32,
    "gradient_accumulation_steps": 1,
    "learning_rate": 0.0002,
    "lora_r": 32,
    "lora_alpha": 64,
    "lora_dropout": 0.0,
    "lora_target_modules": [
      "q_proj",
      "k_proj",
      "v_proj",
      "out_proj",
      "fc1",
      "fc2"
    ],
    "modules_to_save": [],
    "additional_special_tokens": [
      "<lexeme>"
    ],
    "trainable_tokens": [
      {
        "token": "<lexeme>",
        "token_id": 256205
      }
    ],
    "seed": 17,
    "ensure_weight_tying": true,
    "effective_ensure_weight_tying": true,
    "generation_num_beams": 1,
    "generation_no_repeat_ngram_size": 0,
    "generation_repetition_penalty": 1.0,
    "generation_length_penalty": 1.0,
    "save_total_limit": 4,
    "gradient_checkpointing": false,
    "full_determinism": true,
    "resume_from_checkpoint": null,
    "stop_after_steps": null,
    "load_best_model_at_end": false
  },
  "metrics": {
    "train": {
      "train_runtime": 3863.3048,
      "train_samples_per_second": 29.802,
      "train_steps_per_second": 0.931,
      "total_flos": 4.295975851661722e+16,
      "train_loss": 0.9481710318130145,
      "epoch": 1.0
    },
    "validation": {
      "eval_loss": 0.6718003749847412,
      "eval_bleu": 40.86405804072553,
      "eval_chrf": 68.7685241355621,
      "eval_runtime": 42.4036,
      "eval_samples_per_second": 3.019,
      "eval_steps_per_second": 0.094,
      "epoch": 1.0
    }
  },
  "trainer_state": {
    "best_model_checkpoint": "/workspace/v24.3-joint-lexeme-dose29-rerun1/models/J69/checkpoint-2700",
    "best_metric": 66.61229334586629,
    "global_step": 3598,
    "epoch": 1.0,
    "log_history": [
      {
        "loss": 2.1046,
        "grad_norm": 0.4140295088291168,
        "learning_rate": 1.1111111111111112e-05,
        "epoch": 0.0027793218454697055,
        "step": 10
      },
      {
        "loss": 1.8483,
        "grad_norm": 0.46193182468414307,
        "learning_rate": 2.2222222222222223e-05,
        "epoch": 0.005558643690939411,
        "step": 20
      },
      {
        "loss": 1.9831,
        "grad_norm": 0.30134496092796326,
        "learning_rate": 3.3333333333333335e-05,
        "epoch": 0.008337965536409116,
        "step": 30
      },
      {
        "loss": 1.9877,
        "grad_norm": 0.28117668628692627,
        "learning_rate": 4.4444444444444447e-05,
        "epoch": 0.011117287381878822,
        "step": 40
      },
      {
        "loss": 1.9154,
        "grad_norm": 0.31306493282318115,
        "learning_rate": 5.555555555555556e-05,
        "epoch": 0.013896609227348526,
        "step": 50
      },
      {
        "loss": 1.9655,
        "grad_norm": 0.370194673538208,
        "learning_rate": 6.666666666666667e-05,
        "epoch": 0.016675931072818232,
        "step": 60
      },
      {
        "loss": 1.9722,
        "grad_norm": 0.45251625776290894,
        "learning_rate": 7.777777777777778e-05,
        "epoch": 0.019455252918287938,
        "step": 70
      },
      {
        "loss": 1.7918,
        "grad_norm": 0.4766435921192169,
        "learning_rate": 8.888888888888889e-05,
        "epoch": 0.022234574763757644,
        "step": 80
      },
      {
        "loss": 1.881,
        "grad_norm": 0.5220038294792175,
        "learning_rate": 0.0001,
        "epoch": 0.02501389660922735,
        "step": 90
      },
      {
        "loss": 1.8093,
        "grad_norm": 0.37182119488716125,
        "learning_rate": 0.00011111111111111112,
        "epoch": 0.027793218454697052,
        "step": 100
      },
      {
        "loss": 1.8168,
        "grad_norm": 0.528815507888794,
        "learning_rate": 0.00012222222222222224,
        "epoch": 0.030572540300166758,
        "step": 110
      },
      {
        "loss": 1.7512,
        "grad_norm": 0.5603467226028442,
        "learning_rate": 0.00013333333333333334,
        "epoch": 0.033351862145636464,
        "step": 120
      },
      {
        "loss": 1.8719,
        "grad_norm": 0.41087475419044495,
        "learning_rate": 0.00014444444444444444,
        "epoch": 0.03613118399110617,
        "step": 130
      },
      {
        "loss": 1.8271,
        "grad_norm": 0.5450639128684998,
        "learning_rate": 0.00015555555555555556,
        "epoch": 0.038910505836575876,
        "step": 140
      },
      {
        "loss": 1.9108,
        "grad_norm": 0.7078911066055298,
        "learning_rate": 0.0001666666666666667,
        "epoch": 0.04168982768204558,
        "step": 150
      },
      {
        "loss": 1.7895,
        "grad_norm": 0.5440416932106018,
        "learning_rate": 0.00017777777777777779,
        "epoch": 0.04446914952751529,
        "step": 160
      },
      {
        "loss": 1.8499,
        "grad_norm": 0.6741238236427307,
        "learning_rate": 0.00018888888888888888,
        "epoch": 0.04724847137298499,
        "step": 170
      },
      {
        "loss": 1.745,
        "grad_norm": 0.6223885416984558,
        "learning_rate": 0.0002,
        "epoch": 0.0500277932184547,
        "step": 180
      },
      {
        "loss": 1.637,
        "grad_norm": 0.654057502746582,
        "learning_rate": 0.0001994148624926858,
        "epoch": 0.0528071150639244,
        "step": 190
      },
      {
        "loss": 1.802,
        "grad_norm": 0.47887322306632996,
        "learning_rate": 0.00019882972498537157,
        "epoch": 0.055586436909394105,
        "step": 200
      },
      {
        "loss": 1.8009,
        "grad_norm": 0.783930778503418,
        "learning_rate": 0.00019824458747805734,
        "epoch": 0.058365758754863814,
        "step": 210
      },
      {
        "loss": 1.847,
        "grad_norm": 0.9810641407966614,
        "learning_rate": 0.00019765944997074313,
        "epoch": 0.061145080600333516,
        "step": 220
      },
      {
        "loss": 1.7683,
        "grad_norm": 0.6390312910079956,
        "learning_rate": 0.0001970743124634289,
        "epoch": 0.06392440244580322,
        "step": 230
      },
      {
        "loss": 1.5858,
        "grad_norm": 0.7976217865943909,
        "learning_rate": 0.0001964891749561147,
        "epoch": 0.06670372429127293,
        "step": 240
      },
      {
        "loss": 1.6725,
        "grad_norm": 0.9233970046043396,
        "learning_rate": 0.0001959040374488005,
        "epoch": 0.06948304613674264,
        "step": 250
      },
      {
        "loss": 1.5629,
        "grad_norm": 0.9889336228370667,
        "learning_rate": 0.00019531889994148626,
        "epoch": 0.07226236798221233,
        "step": 260
      },
      {
        "loss": 1.6842,
        "grad_norm": 0.8263123035430908,
        "learning_rate": 0.00019473376243417202,
        "epoch": 0.07504168982768204,
        "step": 270
      },
      {
        "loss": 1.6994,
        "grad_norm": 0.7401031851768494,
        "learning_rate": 0.00019414862492685782,
        "epoch": 0.07782101167315175,
        "step": 280
      },
      {
        "loss": 1.6662,
        "grad_norm": 0.6099547147750854,
        "learning_rate": 0.00019356348741954359,
        "epoch": 0.08060033351862146,
        "step": 290
      },
      {
        "loss": 1.7344,
        "grad_norm": 0.9664725065231323,
        "learning_rate": 0.00019297834991222938,
        "epoch": 0.08337965536409116,
        "step": 300
      },
      {
        "loss": 1.5765,
        "grad_norm": 1.102137565612793,
        "learning_rate": 0.00019239321240491518,
        "epoch": 0.08615897720956087,
        "step": 310
      },
      {
        "loss": 1.6127,
        "grad_norm": 0.8319466710090637,
        "learning_rate": 0.00019180807489760094,
        "epoch": 0.08893829905503058,
        "step": 320
      },
      {
        "loss": 1.6298,
        "grad_norm": 0.8705776333808899,
        "learning_rate": 0.0001912229373902867,
        "epoch": 0.09171762090050027,
        "step": 330
      },
      {
        "loss": 1.625,
        "grad_norm": 0.6215114593505859,
        "learning_rate": 0.0001906377998829725,
        "epoch": 0.09449694274596998,
        "step": 340
      },
      {
        "loss": 1.6475,
        "grad_norm": 0.9244978427886963,
        "learning_rate": 0.0001900526623756583,
        "epoch": 0.09727626459143969,
        "step": 350
      },
      {
        "loss": 1.6164,
        "grad_norm": 1.0081429481506348,
        "learning_rate": 0.00018946752486834407,
        "epoch": 0.1000555864369094,
        "step": 360
      },
      {
        "loss": 1.5784,
        "grad_norm": 0.9833176732063293,
        "learning_rate": 0.00018888238736102986,
        "epoch": 0.1028349082823791,
        "step": 370
      },
      {
        "loss": 1.4971,
        "grad_norm": 1.0448380708694458,
        "learning_rate": 0.00018829724985371563,
        "epoch": 0.1056142301278488,
        "step": 380
      },
      {
        "loss": 1.5317,
        "grad_norm": 0.963756799697876,
        "learning_rate": 0.0001877121123464014,
        "epoch": 0.10839355197331851,
        "step": 390
      },
      {
        "loss": 1.6251,
        "grad_norm": 0.7907305955886841,
        "learning_rate": 0.0001871269748390872,
        "epoch": 0.11117287381878821,
        "step": 400
      },
      {
        "loss": 1.4419,
        "grad_norm": 1.3546243906021118,
        "learning_rate": 0.00018654183733177298,
        "epoch": 0.11395219566425792,
        "step": 410
      },
      {
        "loss": 1.5571,
        "grad_norm": 0.9288954138755798,
        "learning_rate": 0.00018595669982445875,
        "epoch": 0.11673151750972763,
        "step": 420
      },
      {
        "loss": 1.5006,
        "grad_norm": 1.1262363195419312,
        "learning_rate": 0.00018537156231714455,
        "epoch": 0.11951083935519734,
        "step": 430
      },
      {
        "loss": 1.5663,
        "grad_norm": 0.9970844984054565,
        "learning_rate": 0.00018478642480983034,
        "epoch": 0.12229016120066703,
        "step": 440
      },
      {
        "loss": 1.458,
        "grad_norm": 1.299085259437561,
        "learning_rate": 0.00018420128730251608,
        "epoch": 0.12506948304613674,
        "step": 450
      },
      {
        "loss": 1.5316,
        "grad_norm": 0.9666916131973267,
        "learning_rate": 0.00018361614979520188,
        "epoch": 0.12784880489160644,
        "step": 460
      },
      {
        "loss": 1.4571,
        "grad_norm": 0.9775465726852417,
        "learning_rate": 0.00018303101228788767,
        "epoch": 0.13062812673707616,
        "step": 470
      },
      {
        "loss": 1.6143,
        "grad_norm": 1.0702718496322632,
        "learning_rate": 0.00018244587478057344,
        "epoch": 0.13340744858254586,
        "step": 480
      },
      {
        "loss": 1.4133,
        "grad_norm": 1.0198723077774048,
        "learning_rate": 0.00018186073727325923,
        "epoch": 0.13618677042801555,
        "step": 490
      },
      {
        "loss": 1.4449,
        "grad_norm": 1.1751333475112915,
        "learning_rate": 0.00018127559976594503,
        "epoch": 0.13896609227348528,
        "step": 500
      },
      {
        "loss": 1.58,
        "grad_norm": 1.124013900756836,
        "learning_rate": 0.00018069046225863077,
        "epoch": 0.14174541411895497,
        "step": 510
      },
      {
        "loss": 1.4243,
        "grad_norm": 1.1146219968795776,
        "learning_rate": 0.00018010532475131656,
        "epoch": 0.14452473596442467,
        "step": 520
      },
      {
        "loss": 1.3418,
        "grad_norm": 0.9221692085266113,
        "learning_rate": 0.00017952018724400236,
        "epoch": 0.1473040578098944,
        "step": 530
      },
      {
        "loss": 1.3914,
        "grad_norm": 1.2927697896957397,
        "learning_rate": 0.00017893504973668812,
        "epoch": 0.15008337965536409,
        "step": 540
      },
      {
        "loss": 1.4291,
        "grad_norm": 1.2189618349075317,
        "learning_rate": 0.00017834991222937392,
        "epoch": 0.1528627015008338,
        "step": 550
      },
      {
        "loss": 1.3442,
        "grad_norm": 1.2801870107650757,
        "learning_rate": 0.0001777647747220597,
        "epoch": 0.1556420233463035,
        "step": 560
      },
      {
        "loss": 1.313,
        "grad_norm": 1.3508485555648804,
        "learning_rate": 0.00017717963721474545,
        "epoch": 0.1584213451917732,
        "step": 570
      },
      {
        "loss": 1.4554,
        "grad_norm": 0.9896947145462036,
        "learning_rate": 0.00017659449970743125,
        "epoch": 0.16120066703724292,
        "step": 580
      },
      {
        "loss": 1.3431,
        "grad_norm": 0.8964052796363831,
        "learning_rate": 0.00017600936220011704,
        "epoch": 0.16397998888271262,
        "step": 590
      },
      {
        "loss": 1.4533,
        "grad_norm": 1.3584518432617188,
        "learning_rate": 0.0001754242246928028,
        "epoch": 0.16675931072818231,
        "step": 600
      },
      {
        "loss": 1.3523,
        "grad_norm": 1.092515468597412,
        "learning_rate": 0.0001748390871854886,
        "epoch": 0.16953863257365204,
        "step": 610
      },
      {
        "loss": 1.3369,
        "grad_norm": 1.2471967935562134,
        "learning_rate": 0.0001742539496781744,
        "epoch": 0.17231795441912173,
        "step": 620
      },
      {
        "loss": 1.3657,
        "grad_norm": 1.297553539276123,
        "learning_rate": 0.00017366881217086014,
        "epoch": 0.17509727626459143,
        "step": 630
      },
      {
        "loss": 1.2446,
        "grad_norm": 1.4945882558822632,
        "learning_rate": 0.00017308367466354593,
        "epoch": 0.17787659811006115,
        "step": 640
      },
      {
        "loss": 1.3642,
        "grad_norm": 1.7191970348358154,
        "learning_rate": 0.00017249853715623173,
        "epoch": 0.18065591995553085,
        "step": 650
      },
      {
        "loss": 1.2716,
        "grad_norm": 1.278106451034546,
        "learning_rate": 0.0001719133996489175,
        "epoch": 0.18343524180100054,
        "step": 660
      },
      {
        "loss": 1.2181,
        "grad_norm": 1.4567068815231323,
        "learning_rate": 0.0001713282621416033,
        "epoch": 0.18621456364647027,
        "step": 670
      },
      {
        "loss": 1.1919,
        "grad_norm": 1.1871955394744873,
        "learning_rate": 0.00017074312463428908,
        "epoch": 0.18899388549193996,
        "step": 680
      },
      {
        "loss": 1.3186,
        "grad_norm": 1.064318060874939,
        "learning_rate": 0.00017015798712697485,
        "epoch": 0.19177320733740968,
        "step": 690
      },
      {
        "loss": 1.2643,
        "grad_norm": 1.5443544387817383,
        "learning_rate": 0.00016957284961966062,
        "epoch": 0.19455252918287938,
        "step": 700
      },
      {
        "loss": 1.2199,
        "grad_norm": 1.0379834175109863,
        "learning_rate": 0.0001689877121123464,
        "epoch": 0.19733185102834908,
        "step": 710
      },
      {
        "loss": 1.2775,
        "grad_norm": 1.4339805841445923,
        "learning_rate": 0.00016840257460503218,
        "epoch": 0.2001111728738188,
        "step": 720
      },
      {
        "loss": 1.2689,
        "grad_norm": 1.7690389156341553,
        "learning_rate": 0.00016781743709771797,
        "epoch": 0.2028904947192885,
        "step": 730
      },
      {
        "loss": 1.1829,
        "grad_norm": 1.3799852132797241,
        "learning_rate": 0.00016723229959040377,
        "epoch": 0.2056698165647582,
        "step": 740
      },
      {
        "loss": 1.2952,
        "grad_norm": 1.0880959033966064,
        "learning_rate": 0.00016664716208308954,
        "epoch": 0.2084491384102279,
        "step": 750
      },
      {
        "loss": 1.1756,
        "grad_norm": 0.9457182884216309,
        "learning_rate": 0.0001660620245757753,
        "epoch": 0.2112284602556976,
        "step": 760
      },
      {
        "loss": 1.2704,
        "grad_norm": 1.383113145828247,
        "learning_rate": 0.0001654768870684611,
        "epoch": 0.2140077821011673,
        "step": 770
      },
      {
        "loss": 1.294,
        "grad_norm": 1.0459240674972534,
        "learning_rate": 0.0001648917495611469,
        "epoch": 0.21678710394663703,
        "step": 780
      },
      {
        "loss": 1.2052,
        "grad_norm": 1.2870111465454102,
        "learning_rate": 0.00016430661205383266,
        "epoch": 0.21956642579210672,
        "step": 790
      },
      {
        "loss": 1.2649,
        "grad_norm": 1.4526729583740234,
        "learning_rate": 0.00016372147454651845,
        "epoch": 0.22234574763757642,
        "step": 800
      },
      {
        "loss": 1.0921,
        "grad_norm": 1.846928358078003,
        "learning_rate": 0.00016313633703920422,
        "epoch": 0.22512506948304614,
        "step": 810
      },
      {
        "loss": 1.2423,
        "grad_norm": 1.5239036083221436,
        "learning_rate": 0.00016255119953189,
        "epoch": 0.22790439132851584,
        "step": 820
      },
      {
        "loss": 1.1756,
        "grad_norm": 1.3172131776809692,
        "learning_rate": 0.00016196606202457578,
        "epoch": 0.23068371317398556,
        "step": 830
      },
      {
        "loss": 1.1734,
        "grad_norm": 1.5167595148086548,
        "learning_rate": 0.00016138092451726158,
        "epoch": 0.23346303501945526,
        "step": 840
      },
      {
        "loss": 1.2039,
        "grad_norm": 1.349012851715088,
        "learning_rate": 0.00016079578700994735,
        "epoch": 0.23624235686492495,
        "step": 850
      },
      {
        "loss": 1.1005,
        "grad_norm": 1.1730643510818481,
        "learning_rate": 0.00016021064950263314,
        "epoch": 0.23902167871039467,
        "step": 860
      },
      {
        "loss": 1.1946,
        "grad_norm": 1.320278286933899,
        "learning_rate": 0.0001596255119953189,
        "epoch": 0.24180100055586437,
        "step": 870
      },
      {
        "loss": 1.09,
        "grad_norm": 0.9002246260643005,
        "learning_rate": 0.00015904037448800467,
        "epoch": 0.24458032240133407,
        "step": 880
      },
      {
        "loss": 1.0499,
        "grad_norm": 1.1015177965164185,
        "learning_rate": 0.00015845523698069047,
        "epoch": 0.2473596442468038,
        "step": 890
      },
      {
        "loss": 1.1817,
        "grad_norm": 1.7522237300872803,
        "learning_rate": 0.00015787009947337626,
        "epoch": 0.2501389660922735,
        "step": 900
      },
      {
        "eval_loss": 1.0395417213439941,
        "eval_bleu": 31.364990029729668,
        "eval_chrf": 58.3898577852921,
        "eval_runtime": 42.676,
        "eval_samples_per_second": 2.999,
        "eval_steps_per_second": 0.094,
        "epoch": 0.2501389660922735,
        "step": 900
      },
      {
        "loss": 1.1484,
        "grad_norm": 1.428255558013916,
        "learning_rate": 0.00015728496196606203,
        "epoch": 0.2529182879377432,
        "step": 910
      },
      {
        "loss": 1.0764,
        "grad_norm": 1.135252594947815,
        "learning_rate": 0.00015669982445874783,
        "epoch": 0.2556976097832129,
        "step": 920
      },
      {
        "loss": 1.2365,
        "grad_norm": 1.3112901449203491,
        "learning_rate": 0.0001561146869514336,
        "epoch": 0.2584769316286826,
        "step": 930
      },
      {
        "loss": 1.1562,
        "grad_norm": 1.7242013216018677,
        "learning_rate": 0.00015552954944411936,
        "epoch": 0.2612562534741523,
        "step": 940
      },
      {
        "loss": 1.1331,
        "grad_norm": 1.1144850254058838,
        "learning_rate": 0.00015494441193680515,
        "epoch": 0.264035575319622,
        "step": 950
      },
      {
        "loss": 1.1032,
        "grad_norm": 1.4144283533096313,
        "learning_rate": 0.00015435927442949095,
        "epoch": 0.2668148971650917,
        "step": 960
      },
      {
        "loss": 1.1417,
        "grad_norm": 1.3410099744796753,
        "learning_rate": 0.00015377413692217672,
        "epoch": 0.2695942190105614,
        "step": 970
      },
      {
        "loss": 1.1226,
        "grad_norm": 1.7101255655288696,
        "learning_rate": 0.0001531889994148625,
        "epoch": 0.2723735408560311,
        "step": 980
      },
      {
        "loss": 1.0927,
        "grad_norm": 1.9083212614059448,
        "learning_rate": 0.00015260386190754828,
        "epoch": 0.27515286270150086,
        "step": 990
      },
      {
        "loss": 1.1131,
        "grad_norm": 1.3412920236587524,
        "learning_rate": 0.00015201872440023405,
        "epoch": 0.27793218454697055,
        "step": 1000
      },
      {
        "loss": 1.0512,
        "grad_norm": 1.5229618549346924,
        "learning_rate": 0.00015143358689291984,
        "epoch": 0.28071150639244025,
        "step": 1010
      },
      {
        "loss": 0.9792,
        "grad_norm": 1.5586941242218018,
        "learning_rate": 0.00015084844938560564,
        "epoch": 0.28349082823790994,
        "step": 1020
      },
      {
        "loss": 1.0279,
        "grad_norm": 1.6615018844604492,
        "learning_rate": 0.0001502633118782914,
        "epoch": 0.28627015008337964,
        "step": 1030
      },
      {
        "loss": 1.0815,
        "grad_norm": 1.12063729763031,
        "learning_rate": 0.0001496781743709772,
        "epoch": 0.28904947192884933,
        "step": 1040
      },
      {
        "loss": 1.0282,
        "grad_norm": 1.9666633605957031,
        "learning_rate": 0.00014909303686366296,
        "epoch": 0.2918287937743191,
        "step": 1050
      },
      {
        "loss": 0.9798,
        "grad_norm": 1.6202434301376343,
        "learning_rate": 0.00014850789935634876,
        "epoch": 0.2946081156197888,
        "step": 1060
      },
      {
        "loss": 1.0827,
        "grad_norm": 1.3234361410140991,
        "learning_rate": 0.00014792276184903453,
        "epoch": 0.2973874374652585,
        "step": 1070
      },
      {
        "loss": 0.957,
        "grad_norm": 1.2288326025009155,
        "learning_rate": 0.00014733762434172032,
        "epoch": 0.30016675931072817,
        "step": 1080
      },
      {
        "loss": 0.8825,
        "grad_norm": 1.2778434753417969,
        "learning_rate": 0.0001467524868344061,
        "epoch": 0.30294608115619787,
        "step": 1090
      },
      {
        "loss": 1.1411,
        "grad_norm": 1.1895047426223755,
        "learning_rate": 0.00014616734932709186,
        "epoch": 0.3057254030016676,
        "step": 1100
      },
      {
        "loss": 1.0162,
        "grad_norm": 1.9118584394454956,
        "learning_rate": 0.00014558221181977765,
        "epoch": 0.3085047248471373,
        "step": 1110
      },
      {
        "loss": 1.0447,
        "grad_norm": 1.5872502326965332,
        "learning_rate": 0.00014499707431246344,
        "epoch": 0.311284046692607,
        "step": 1120
      },
      {
        "loss": 1.0535,
        "grad_norm": 1.7727245092391968,
        "learning_rate": 0.0001444119368051492,
        "epoch": 0.3140633685380767,
        "step": 1130
      },
      {
        "loss": 1.0742,
        "grad_norm": 1.2673349380493164,
        "learning_rate": 0.000143826799297835,
        "epoch": 0.3168426903835464,
        "step": 1140
      },
      {
        "loss": 1.0535,
        "grad_norm": 1.6242469549179077,
        "learning_rate": 0.00014324166179052077,
        "epoch": 0.3196220122290161,
        "step": 1150
      },
      {
        "loss": 0.8432,
        "grad_norm": 1.7397310733795166,
        "learning_rate": 0.00014265652428320654,
        "epoch": 0.32240133407448585,
        "step": 1160
      },
      {
        "loss": 1.0957,
        "grad_norm": 1.0805168151855469,
        "learning_rate": 0.00014207138677589234,
        "epoch": 0.32518065591995554,
        "step": 1170
      },
      {
        "loss": 1.0128,
        "grad_norm": 1.5562666654586792,
        "learning_rate": 0.00014148624926857813,
        "epoch": 0.32795997776542524,
        "step": 1180
      },
      {
        "loss": 0.9449,
        "grad_norm": 1.4101382493972778,
        "learning_rate": 0.0001409011117612639,
        "epoch": 0.33073929961089493,
        "step": 1190
      },
      {
        "loss": 0.9858,
        "grad_norm": 1.4961520433425903,
        "learning_rate": 0.0001403159742539497,
        "epoch": 0.33351862145636463,
        "step": 1200
      },
      {
        "loss": 1.0111,
        "grad_norm": 1.5171849727630615,
        "learning_rate": 0.00013973083674663549,
        "epoch": 0.3362979433018344,
        "step": 1210
      },
      {
        "loss": 0.9343,
        "grad_norm": 1.8383678197860718,
        "learning_rate": 0.00013914569923932123,
        "epoch": 0.3390772651473041,
        "step": 1220
      },
      {
        "loss": 1.0233,
        "grad_norm": 1.9662550687789917,
        "learning_rate": 0.00013856056173200702,
        "epoch": 0.34185658699277377,
        "step": 1230
      },
      {
        "loss": 1.0285,
        "grad_norm": 1.3497370481491089,
        "learning_rate": 0.00013797542422469282,
        "epoch": 0.34463590883824347,
        "step": 1240
      },
      {
        "loss": 1.0515,
        "grad_norm": 1.725982904434204,
        "learning_rate": 0.00013739028671737858,
        "epoch": 0.34741523068371316,
        "step": 1250
      },
      {
        "loss": 1.0562,
        "grad_norm": 1.6530572175979614,
        "learning_rate": 0.00013680514921006438,
        "epoch": 0.35019455252918286,
        "step": 1260
      },
      {
        "loss": 0.9152,
        "grad_norm": 1.6330093145370483,
        "learning_rate": 0.00013622001170275017,
        "epoch": 0.3529738743746526,
        "step": 1270
      },
      {
        "loss": 0.9699,
        "grad_norm": 1.0460683107376099,
        "learning_rate": 0.0001356348741954359,
        "epoch": 0.3557531962201223,
        "step": 1280
      },
      {
        "loss": 0.9806,
        "grad_norm": 1.5580418109893799,
        "learning_rate": 0.0001350497366881217,
        "epoch": 0.358532518065592,
        "step": 1290
      },
      {
        "loss": 1.007,
        "grad_norm": 2.0592973232269287,
        "learning_rate": 0.0001344645991808075,
        "epoch": 0.3613118399110617,
        "step": 1300
      },
      {
        "loss": 0.9665,
        "grad_norm": 1.3635998964309692,
        "learning_rate": 0.00013387946167349327,
        "epoch": 0.3640911617565314,
        "step": 1310
      },
      {
        "loss": 1.1398,
        "grad_norm": 1.568021297454834,
        "learning_rate": 0.00013329432416617906,
        "epoch": 0.3668704836020011,
        "step": 1320
      },
      {
        "loss": 0.9148,
        "grad_norm": 2.066228151321411,
        "learning_rate": 0.00013270918665886486,
        "epoch": 0.36964980544747084,
        "step": 1330
      },
      {
        "loss": 0.9977,
        "grad_norm": 1.1922526359558105,
        "learning_rate": 0.0001321240491515506,
        "epoch": 0.37242912729294053,
        "step": 1340
      },
      {
        "loss": 0.8754,
        "grad_norm": 2.051551103591919,
        "learning_rate": 0.0001315389116442364,
        "epoch": 0.3752084491384102,
        "step": 1350
      },
      {
        "loss": 0.9025,
        "grad_norm": 1.1191948652267456,
        "learning_rate": 0.0001309537741369222,
        "epoch": 0.3779877709838799,
        "step": 1360
      },
      {
        "loss": 0.9634,
        "grad_norm": 1.243485927581787,
        "learning_rate": 0.00013036863662960795,
        "epoch": 0.3807670928293496,
        "step": 1370
      },
      {
        "loss": 0.8412,
        "grad_norm": 1.4225202798843384,
        "learning_rate": 0.00012978349912229375,
        "epoch": 0.38354641467481937,
        "step": 1380
      },
      {
        "loss": 1.0081,
        "grad_norm": 1.2499719858169556,
        "learning_rate": 0.00012919836161497954,
        "epoch": 0.38632573652028906,
        "step": 1390
      },
      {
        "loss": 0.9025,
        "grad_norm": 1.6100412607192993,
        "learning_rate": 0.0001286132241076653,
        "epoch": 0.38910505836575876,
        "step": 1400
      },
      {
        "loss": 0.8203,
        "grad_norm": 1.9911744594573975,
        "learning_rate": 0.00012802808660035108,
        "epoch": 0.39188438021122846,
        "step": 1410
      },
      {
        "loss": 0.8276,
        "grad_norm": 1.4758795499801636,
        "learning_rate": 0.00012744294909303687,
        "epoch": 0.39466370205669815,
        "step": 1420
      },
      {
        "loss": 1.0634,
        "grad_norm": 1.4166537523269653,
        "learning_rate": 0.00012685781158572264,
        "epoch": 0.39744302390216785,
        "step": 1430
      },
      {
        "loss": 0.866,
        "grad_norm": 1.478798508644104,
        "learning_rate": 0.00012627267407840843,
        "epoch": 0.4002223457476376,
        "step": 1440
      },
      {
        "loss": 0.8046,
        "grad_norm": 1.518876552581787,
        "learning_rate": 0.00012568753657109423,
        "epoch": 0.4030016675931073,
        "step": 1450
      },
      {
        "loss": 0.9057,
        "grad_norm": 1.5666396617889404,
        "learning_rate": 0.00012510239906378,
        "epoch": 0.405780989438577,
        "step": 1460
      },
      {
        "loss": 0.9224,
        "grad_norm": 1.593050241470337,
        "learning_rate": 0.00012451726155646576,
        "epoch": 0.4085603112840467,
        "step": 1470
      },
      {
        "loss": 0.8986,
        "grad_norm": 2.082044839859009,
        "learning_rate": 0.00012393212404915156,
        "epoch": 0.4113396331295164,
        "step": 1480
      },
      {
        "loss": 0.888,
        "grad_norm": 2.0891640186309814,
        "learning_rate": 0.00012334698654183735,
        "epoch": 0.41411895497498613,
        "step": 1490
      },
      {
        "loss": 0.8905,
        "grad_norm": 1.358191967010498,
        "learning_rate": 0.00012276184903452312,
        "epoch": 0.4168982768204558,
        "step": 1500
      },
      {
        "loss": 0.8238,
        "grad_norm": 1.4863574504852295,
        "learning_rate": 0.00012217671152720891,
        "epoch": 0.4196775986659255,
        "step": 1510
      },
      {
        "loss": 0.9423,
        "grad_norm": 1.2066727876663208,
        "learning_rate": 0.00012159157401989467,
        "epoch": 0.4224569205113952,
        "step": 1520
      },
      {
        "loss": 0.7907,
        "grad_norm": 1.4324455261230469,
        "learning_rate": 0.00012100643651258046,
        "epoch": 0.4252362423568649,
        "step": 1530
      },
      {
        "loss": 0.9682,
        "grad_norm": 1.3111741542816162,
        "learning_rate": 0.00012042129900526624,
        "epoch": 0.4280155642023346,
        "step": 1540
      },
      {
        "loss": 0.875,
        "grad_norm": 2.182124376296997,
        "learning_rate": 0.00011983616149795202,
        "epoch": 0.43079488604780436,
        "step": 1550
      },
      {
        "loss": 0.8221,
        "grad_norm": 1.8315985202789307,
        "learning_rate": 0.0001192510239906378,
        "epoch": 0.43357420789327406,
        "step": 1560
      },
      {
        "loss": 0.9896,
        "grad_norm": 1.3867039680480957,
        "learning_rate": 0.0001186658864833236,
        "epoch": 0.43635352973874375,
        "step": 1570
      },
      {
        "loss": 0.9384,
        "grad_norm": 1.614179253578186,
        "learning_rate": 0.00011808074897600935,
        "epoch": 0.43913285158421345,
        "step": 1580
      },
      {
        "loss": 0.7823,
        "grad_norm": 1.388555884361267,
        "learning_rate": 0.00011749561146869515,
        "epoch": 0.44191217342968314,
        "step": 1590
      },
      {
        "loss": 0.7731,
        "grad_norm": 1.1316096782684326,
        "learning_rate": 0.00011691047396138093,
        "epoch": 0.44469149527515284,
        "step": 1600
      },
      {
        "loss": 0.7917,
        "grad_norm": 1.9281110763549805,
        "learning_rate": 0.00011632533645406671,
        "epoch": 0.4474708171206226,
        "step": 1610
      },
      {
        "loss": 0.935,
        "grad_norm": 1.7171776294708252,
        "learning_rate": 0.0001157401989467525,
        "epoch": 0.4502501389660923,
        "step": 1620
      },
      {
        "loss": 0.9694,
        "grad_norm": 1.5820637941360474,
        "learning_rate": 0.00011515506143943829,
        "epoch": 0.453029460811562,
        "step": 1630
      },
      {
        "loss": 0.8795,
        "grad_norm": 1.323703646659851,
        "learning_rate": 0.00011456992393212404,
        "epoch": 0.4558087826570317,
        "step": 1640
      },
      {
        "loss": 0.7887,
        "grad_norm": 1.4957565069198608,
        "learning_rate": 0.00011398478642480983,
        "epoch": 0.45858810450250137,
        "step": 1650
      },
      {
        "loss": 0.8062,
        "grad_norm": 1.8945534229278564,
        "learning_rate": 0.00011339964891749561,
        "epoch": 0.4613674263479711,
        "step": 1660
      },
      {
        "loss": 0.714,
        "grad_norm": 1.5251452922821045,
        "learning_rate": 0.0001128145114101814,
        "epoch": 0.4641467481934408,
        "step": 1670
      },
      {
        "loss": 0.8684,
        "grad_norm": 1.431054711341858,
        "learning_rate": 0.00011222937390286719,
        "epoch": 0.4669260700389105,
        "step": 1680
      },
      {
        "loss": 0.824,
        "grad_norm": 1.121795654296875,
        "learning_rate": 0.00011164423639555297,
        "epoch": 0.4697053918843802,
        "step": 1690
      },
      {
        "loss": 0.7963,
        "grad_norm": 1.7896941900253296,
        "learning_rate": 0.00011105909888823874,
        "epoch": 0.4724847137298499,
        "step": 1700
      },
      {
        "loss": 0.7842,
        "grad_norm": 1.2749794721603394,
        "learning_rate": 0.00011047396138092452,
        "epoch": 0.4752640355753196,
        "step": 1710
      },
      {
        "loss": 0.7423,
        "grad_norm": 1.5560483932495117,
        "learning_rate": 0.0001098888238736103,
        "epoch": 0.47804335742078935,
        "step": 1720
      },
      {
        "loss": 0.9013,
        "grad_norm": 1.4849023818969727,
        "learning_rate": 0.00010930368636629608,
        "epoch": 0.48082267926625905,
        "step": 1730
      },
      {
        "loss": 0.8111,
        "grad_norm": 1.5528464317321777,
        "learning_rate": 0.00010871854885898188,
        "epoch": 0.48360200111172874,
        "step": 1740
      },
      {
        "loss": 0.8145,
        "grad_norm": 1.897931456565857,
        "learning_rate": 0.00010813341135166766,
        "epoch": 0.48638132295719844,
        "step": 1750
      },
      {
        "loss": 0.7912,
        "grad_norm": 1.4603521823883057,
        "learning_rate": 0.00010754827384435342,
        "epoch": 0.48916064480266813,
        "step": 1760
      },
      {
        "loss": 0.7772,
        "grad_norm": 1.7950726747512817,
        "learning_rate": 0.0001069631363370392,
        "epoch": 0.4919399666481378,
        "step": 1770
      },
      {
        "loss": 0.6913,
        "grad_norm": 1.4596202373504639,
        "learning_rate": 0.00010637799882972499,
        "epoch": 0.4947192884936076,
        "step": 1780
      },
      {
        "loss": 0.801,
        "grad_norm": 1.0710797309875488,
        "learning_rate": 0.00010579286132241078,
        "epoch": 0.4974986103390773,
        "step": 1790
      },
      {
        "loss": 0.7098,
        "grad_norm": 1.7335723638534546,
        "learning_rate": 0.00010520772381509656,
        "epoch": 0.500277932184547,
        "step": 1800
      },
      {
        "eval_loss": 0.7931228876113892,
        "eval_bleu": 34.04529754823484,
        "eval_chrf": 64.48607517273312,
        "eval_runtime": 42.7183,
        "eval_samples_per_second": 2.996,
        "eval_steps_per_second": 0.094,
        "epoch": 0.500277932184547,
        "step": 1800
      },
      {
        "loss": 0.9306,
        "grad_norm": 1.0163995027542114,
        "learning_rate": 0.00010462258630778234,
        "epoch": 0.5030572540300167,
        "step": 1810
      },
      {
        "loss": 0.8217,
        "grad_norm": 2.198115825653076,
        "learning_rate": 0.00010403744880046811,
        "epoch": 0.5058365758754864,
        "step": 1820
      },
      {
        "loss": 0.8926,
        "grad_norm": 1.5556522607803345,
        "learning_rate": 0.00010345231129315389,
        "epoch": 0.5086158977209561,
        "step": 1830
      },
      {
        "loss": 0.8042,
        "grad_norm": 1.499470591545105,
        "learning_rate": 0.00010286717378583967,
        "epoch": 0.5113952195664258,
        "step": 1840
      },
      {
        "loss": 0.7806,
        "grad_norm": 1.47234308719635,
        "learning_rate": 0.00010228203627852547,
        "epoch": 0.5141745414118954,
        "step": 1850
      },
      {
        "loss": 0.914,
        "grad_norm": 1.721991777420044,
        "learning_rate": 0.00010169689877121125,
        "epoch": 0.5169538632573653,
        "step": 1860
      },
      {
        "loss": 0.8043,
        "grad_norm": 1.593459963798523,
        "learning_rate": 0.00010111176126389703,
        "epoch": 0.519733185102835,
        "step": 1870
      },
      {
        "loss": 0.8101,
        "grad_norm": 1.5574313402175903,
        "learning_rate": 0.0001005266237565828,
        "epoch": 0.5225125069483046,
        "step": 1880
      },
      {
        "loss": 0.6948,
        "grad_norm": 1.370987892150879,
        "learning_rate": 9.994148624926858e-05,
        "epoch": 0.5252918287937743,
        "step": 1890
      },
      {
        "loss": 0.7938,
        "grad_norm": 1.3755780458450317,
        "learning_rate": 9.935634874195436e-05,
        "epoch": 0.528071150639244,
        "step": 1900
      },
      {
        "loss": 0.7416,
        "grad_norm": 1.7554758787155151,
        "learning_rate": 9.877121123464015e-05,
        "epoch": 0.5308504724847137,
        "step": 1910
      },
      {
        "loss": 0.8454,
        "grad_norm": 1.7844148874282837,
        "learning_rate": 9.818607372732592e-05,
        "epoch": 0.5336297943301834,
        "step": 1920
      },
      {
        "loss": 0.8501,
        "grad_norm": 1.3822129964828491,
        "learning_rate": 9.760093622001171e-05,
        "epoch": 0.5364091161756531,
        "step": 1930
      },
      {
        "loss": 0.7248,
        "grad_norm": 1.7859715223312378,
        "learning_rate": 9.70157987126975e-05,
        "epoch": 0.5391884380211228,
        "step": 1940
      },
      {
        "loss": 0.7495,
        "grad_norm": 1.0760029554367065,
        "learning_rate": 9.643066120538326e-05,
        "epoch": 0.5419677598665925,
        "step": 1950
      },
      {
        "loss": 0.9286,
        "grad_norm": 1.3241146802902222,
        "learning_rate": 9.584552369806906e-05,
        "epoch": 0.5447470817120622,
        "step": 1960
      },
      {
        "loss": 0.8068,
        "grad_norm": 1.3033974170684814,
        "learning_rate": 9.526038619075484e-05,
        "epoch": 0.547526403557532,
        "step": 1970
      },
      {
        "loss": 0.8309,
        "grad_norm": 1.403512954711914,
        "learning_rate": 9.46752486834406e-05,
        "epoch": 0.5503057254030017,
        "step": 1980
      },
      {
        "loss": 0.8311,
        "grad_norm": 1.3144944906234741,
        "learning_rate": 9.40901111761264e-05,
        "epoch": 0.5530850472484714,
        "step": 1990
      },
      {
        "loss": 0.6458,
        "grad_norm": 1.645932674407959,
        "learning_rate": 9.350497366881218e-05,
        "epoch": 0.5558643690939411,
        "step": 2000
      },
      {
        "loss": 0.6814,
        "grad_norm": 2.137310028076172,
        "learning_rate": 9.291983616149795e-05,
        "epoch": 0.5586436909394108,
        "step": 2010
      },
      {
        "loss": 0.6609,
        "grad_norm": 1.8444314002990723,
        "learning_rate": 9.233469865418374e-05,
        "epoch": 0.5614230127848805,
        "step": 2020
      },
      {
        "loss": 0.8411,
        "grad_norm": 1.7156598567962646,
        "learning_rate": 9.174956114686952e-05,
        "epoch": 0.5642023346303502,
        "step": 2030
      },
      {
        "loss": 0.7718,
        "grad_norm": 2.0496068000793457,
        "learning_rate": 9.116442363955529e-05,
        "epoch": 0.5669816564758199,
        "step": 2040
      },
      {
        "loss": 0.7309,
        "grad_norm": 1.2874308824539185,
        "learning_rate": 9.057928613224108e-05,
        "epoch": 0.5697609783212896,
        "step": 2050
      },
      {
        "loss": 0.755,
        "grad_norm": 1.6933300495147705,
        "learning_rate": 8.999414862492687e-05,
        "epoch": 0.5725403001667593,
        "step": 2060
      },
      {
        "loss": 0.6792,
        "grad_norm": 1.5075557231903076,
        "learning_rate": 8.940901111761265e-05,
        "epoch": 0.575319622012229,
        "step": 2070
      },
      {
        "loss": 0.717,
        "grad_norm": 1.6459001302719116,
        "learning_rate": 8.882387361029843e-05,
        "epoch": 0.5780989438576987,
        "step": 2080
      },
      {
        "loss": 0.7334,
        "grad_norm": 1.4591081142425537,
        "learning_rate": 8.823873610298421e-05,
        "epoch": 0.5808782657031685,
        "step": 2090
      },
      {
        "loss": 0.82,
        "grad_norm": 1.903427004814148,
        "learning_rate": 8.765359859566999e-05,
        "epoch": 0.5836575875486382,
        "step": 2100
      },
      {
        "loss": 0.7907,
        "grad_norm": 1.269168496131897,
        "learning_rate": 8.706846108835577e-05,
        "epoch": 0.5864369093941079,
        "step": 2110
      },
      {
        "loss": 0.5817,
        "grad_norm": 1.237375259399414,
        "learning_rate": 8.648332358104155e-05,
        "epoch": 0.5892162312395776,
        "step": 2120
      },
      {
        "loss": 0.7943,
        "grad_norm": 1.5938820838928223,
        "learning_rate": 8.589818607372733e-05,
        "epoch": 0.5919955530850473,
        "step": 2130
      },
      {
        "loss": 0.7878,
        "grad_norm": 1.3069621324539185,
        "learning_rate": 8.531304856641311e-05,
        "epoch": 0.594774874930517,
        "step": 2140
      },
      {
        "loss": 0.641,
        "grad_norm": 1.2887060642242432,
        "learning_rate": 8.47279110590989e-05,
        "epoch": 0.5975541967759866,
        "step": 2150
      },
      {
        "loss": 0.7156,
        "grad_norm": 1.7033811807632446,
        "learning_rate": 8.414277355178467e-05,
        "epoch": 0.6003335186214563,
        "step": 2160
      },
      {
        "loss": 0.6544,
        "grad_norm": 1.3568116426467896,
        "learning_rate": 8.355763604447046e-05,
        "epoch": 0.603112840466926,
        "step": 2170
      },
      {
        "loss": 0.6654,
        "grad_norm": 0.8526349663734436,
        "learning_rate": 8.297249853715624e-05,
        "epoch": 0.6058921623123957,
        "step": 2180
      },
      {
        "loss": 0.7027,
        "grad_norm": 2.007845878601074,
        "learning_rate": 8.238736102984202e-05,
        "epoch": 0.6086714841578654,
        "step": 2190
      },
      {
        "loss": 0.6089,
        "grad_norm": 1.4187250137329102,
        "learning_rate": 8.18022235225278e-05,
        "epoch": 0.6114508060033352,
        "step": 2200
      },
      {
        "loss": 0.6562,
        "grad_norm": 1.5305442810058594,
        "learning_rate": 8.121708601521358e-05,
        "epoch": 0.6142301278488049,
        "step": 2210
      },
      {
        "loss": 0.6893,
        "grad_norm": 1.2007344961166382,
        "learning_rate": 8.063194850789936e-05,
        "epoch": 0.6170094496942746,
        "step": 2220
      },
      {
        "loss": 0.7424,
        "grad_norm": 1.8552879095077515,
        "learning_rate": 8.004681100058514e-05,
        "epoch": 0.6197887715397443,
        "step": 2230
      },
      {
        "loss": 0.6859,
        "grad_norm": 1.5317975282669067,
        "learning_rate": 7.946167349327092e-05,
        "epoch": 0.622568093385214,
        "step": 2240
      },
      {
        "loss": 0.6576,
        "grad_norm": 2.109940528869629,
        "learning_rate": 7.88765359859567e-05,
        "epoch": 0.6253474152306837,
        "step": 2250
      },
      {
        "loss": 0.7508,
        "grad_norm": 1.2298418283462524,
        "learning_rate": 7.829139847864248e-05,
        "epoch": 0.6281267370761534,
        "step": 2260
      },
      {
        "loss": 0.6816,
        "grad_norm": 1.3538986444473267,
        "learning_rate": 7.770626097132827e-05,
        "epoch": 0.6309060589216231,
        "step": 2270
      },
      {
        "loss": 0.746,
        "grad_norm": 1.1908177137374878,
        "learning_rate": 7.712112346401405e-05,
        "epoch": 0.6336853807670928,
        "step": 2280
      },
      {
        "loss": 0.7993,
        "grad_norm": 1.1318070888519287,
        "learning_rate": 7.653598595669983e-05,
        "epoch": 0.6364647026125625,
        "step": 2290
      },
      {
        "loss": 0.8078,
        "grad_norm": 1.5441361665725708,
        "learning_rate": 7.595084844938561e-05,
        "epoch": 0.6392440244580322,
        "step": 2300
      },
      {
        "loss": 0.7411,
        "grad_norm": 1.4957458972930908,
        "learning_rate": 7.536571094207139e-05,
        "epoch": 0.642023346303502,
        "step": 2310
      },
      {
        "loss": 0.6281,
        "grad_norm": 1.059766411781311,
        "learning_rate": 7.478057343475717e-05,
        "epoch": 0.6448026681489717,
        "step": 2320
      },
      {
        "loss": 0.5841,
        "grad_norm": 1.3983445167541504,
        "learning_rate": 7.419543592744296e-05,
        "epoch": 0.6475819899944414,
        "step": 2330
      },
      {
        "loss": 0.7042,
        "grad_norm": 1.3938812017440796,
        "learning_rate": 7.361029842012873e-05,
        "epoch": 0.6503613118399111,
        "step": 2340
      },
      {
        "loss": 0.8477,
        "grad_norm": 1.8146742582321167,
        "learning_rate": 7.302516091281451e-05,
        "epoch": 0.6531406336853808,
        "step": 2350
      },
      {
        "loss": 0.7584,
        "grad_norm": 1.1325688362121582,
        "learning_rate": 7.244002340550031e-05,
        "epoch": 0.6559199555308505,
        "step": 2360
      },
      {
        "loss": 0.8167,
        "grad_norm": 1.1988415718078613,
        "learning_rate": 7.185488589818607e-05,
        "epoch": 0.6586992773763202,
        "step": 2370
      },
      {
        "loss": 0.7592,
        "grad_norm": 0.8537703156471252,
        "learning_rate": 7.126974839087186e-05,
        "epoch": 0.6614785992217899,
        "step": 2380
      },
      {
        "loss": 0.6157,
        "grad_norm": 1.336398959159851,
        "learning_rate": 7.068461088355765e-05,
        "epoch": 0.6642579210672596,
        "step": 2390
      },
      {
        "loss": 0.6364,
        "grad_norm": 1.6869962215423584,
        "learning_rate": 7.009947337624342e-05,
        "epoch": 0.6670372429127293,
        "step": 2400
      },
      {
        "loss": 0.7279,
        "grad_norm": 1.4955002069473267,
        "learning_rate": 6.95143358689292e-05,
        "epoch": 0.669816564758199,
        "step": 2410
      },
      {
        "loss": 0.7611,
        "grad_norm": 0.9639846682548523,
        "learning_rate": 6.892919836161499e-05,
        "epoch": 0.6725958866036688,
        "step": 2420
      },
      {
        "loss": 0.658,
        "grad_norm": 1.3936442136764526,
        "learning_rate": 6.834406085430076e-05,
        "epoch": 0.6753752084491385,
        "step": 2430
      },
      {
        "loss": 0.6369,
        "grad_norm": 1.0887020826339722,
        "learning_rate": 6.775892334698654e-05,
        "epoch": 0.6781545302946081,
        "step": 2440
      },
      {
        "loss": 0.6722,
        "grad_norm": 1.2021764516830444,
        "learning_rate": 6.717378583967232e-05,
        "epoch": 0.6809338521400778,
        "step": 2450
      },
      {
        "loss": 0.58,
        "grad_norm": 1.4362479448318481,
        "learning_rate": 6.65886483323581e-05,
        "epoch": 0.6837131739855475,
        "step": 2460
      },
      {
        "loss": 0.6546,
        "grad_norm": 1.6736342906951904,
        "learning_rate": 6.600351082504388e-05,
        "epoch": 0.6864924958310172,
        "step": 2470
      },
      {
        "loss": 0.6311,
        "grad_norm": 1.3882834911346436,
        "learning_rate": 6.541837331772966e-05,
        "epoch": 0.6892718176764869,
        "step": 2480
      },
      {
        "loss": 0.8076,
        "grad_norm": 1.1238460540771484,
        "learning_rate": 6.483323581041545e-05,
        "epoch": 0.6920511395219566,
        "step": 2490
      },
      {
        "loss": 0.725,
        "grad_norm": 1.5184351205825806,
        "learning_rate": 6.424809830310124e-05,
        "epoch": 0.6948304613674263,
        "step": 2500
      },
      {
        "loss": 0.6874,
        "grad_norm": 1.5520931482315063,
        "learning_rate": 6.366296079578701e-05,
        "epoch": 0.697609783212896,
        "step": 2510
      },
      {
        "loss": 0.6594,
        "grad_norm": 1.1347784996032715,
        "learning_rate": 6.307782328847279e-05,
        "epoch": 0.7003891050583657,
        "step": 2520
      },
      {
        "loss": 0.5981,
        "grad_norm": 1.0782485008239746,
        "learning_rate": 6.249268578115858e-05,
        "epoch": 0.7031684269038355,
        "step": 2530
      },
      {
        "loss": 0.7258,
        "grad_norm": 1.3466250896453857,
        "learning_rate": 6.190754827384435e-05,
        "epoch": 0.7059477487493052,
        "step": 2540
      },
      {
        "loss": 0.5458,
        "grad_norm": 1.4698735475540161,
        "learning_rate": 6.132241076653013e-05,
        "epoch": 0.7087270705947749,
        "step": 2550
      },
      {
        "loss": 0.6835,
        "grad_norm": 1.6065407991409302,
        "learning_rate": 6.073727325921592e-05,
        "epoch": 0.7115063924402446,
        "step": 2560
      },
      {
        "loss": 0.7253,
        "grad_norm": 0.9917827248573303,
        "learning_rate": 6.015213575190169e-05,
        "epoch": 0.7142857142857143,
        "step": 2570
      },
      {
        "loss": 0.7438,
        "grad_norm": 1.2688491344451904,
        "learning_rate": 5.956699824458748e-05,
        "epoch": 0.717065036131184,
        "step": 2580
      },
      {
        "loss": 0.5903,
        "grad_norm": 1.4485528469085693,
        "learning_rate": 5.898186073727326e-05,
        "epoch": 0.7198443579766537,
        "step": 2590
      },
      {
        "loss": 0.6934,
        "grad_norm": 1.8393375873565674,
        "learning_rate": 5.8396723229959036e-05,
        "epoch": 0.7226236798221234,
        "step": 2600
      },
      {
        "loss": 0.781,
        "grad_norm": 1.1079840660095215,
        "learning_rate": 5.7811585722644824e-05,
        "epoch": 0.7254030016675931,
        "step": 2610
      },
      {
        "loss": 0.6871,
        "grad_norm": 1.1297825574874878,
        "learning_rate": 5.722644821533061e-05,
        "epoch": 0.7281823235130628,
        "step": 2620
      },
      {
        "loss": 0.563,
        "grad_norm": 2.4137139320373535,
        "learning_rate": 5.664131070801638e-05,
        "epoch": 0.7309616453585325,
        "step": 2630
      },
      {
        "loss": 0.6087,
        "grad_norm": 1.1955472230911255,
        "learning_rate": 5.6056173200702166e-05,
        "epoch": 0.7337409672040022,
        "step": 2640
      },
      {
        "loss": 0.8348,
        "grad_norm": 1.0724763870239258,
        "learning_rate": 5.5471035693387954e-05,
        "epoch": 0.736520289049472,
        "step": 2650
      },
      {
        "loss": 0.5881,
        "grad_norm": 1.2351850271224976,
        "learning_rate": 5.488589818607373e-05,
        "epoch": 0.7392996108949417,
        "step": 2660
      },
      {
        "loss": 0.6355,
        "grad_norm": 1.2210818529129028,
        "learning_rate": 5.430076067875951e-05,
        "epoch": 0.7420789327404114,
        "step": 2670
      },
      {
        "loss": 0.6666,
        "grad_norm": 1.2278271913528442,
        "learning_rate": 5.37156231714453e-05,
        "epoch": 0.7448582545858811,
        "step": 2680
      },
      {
        "loss": 0.7498,
        "grad_norm": 1.3193840980529785,
        "learning_rate": 5.313048566413107e-05,
        "epoch": 0.7476375764313508,
        "step": 2690
      },
      {
        "loss": 0.6763,
        "grad_norm": 1.2186802625656128,
        "learning_rate": 5.254534815681685e-05,
        "epoch": 0.7504168982768205,
        "step": 2700
      },
      {
        "eval_loss": 0.7080053687095642,
        "eval_bleu": 36.834191198203946,
        "eval_chrf": 66.61229334586629,
        "eval_runtime": 41.8487,
        "eval_samples_per_second": 3.059,
        "eval_steps_per_second": 0.096,
        "epoch": 0.7504168982768205,
        "step": 2700
      },
      {
        "loss": 0.5665,
        "grad_norm": 1.5874916315078735,
        "learning_rate": 5.196021064950264e-05,
        "epoch": 0.7531962201222901,
        "step": 2710
      },
      {
        "loss": 0.6897,
        "grad_norm": 1.471414566040039,
        "learning_rate": 5.1375073142188414e-05,
        "epoch": 0.7559755419677598,
        "step": 2720
      },
      {
        "loss": 0.6559,
        "grad_norm": 0.9071055054664612,
        "learning_rate": 5.0789935634874195e-05,
        "epoch": 0.7587548638132295,
        "step": 2730
      },
      {
        "loss": 0.7094,
        "grad_norm": 1.334881067276001,
        "learning_rate": 5.020479812755998e-05,
        "epoch": 0.7615341856586992,
        "step": 2740
      },
      {
        "loss": 0.6073,
        "grad_norm": 1.105324149131775,
        "learning_rate": 4.9619660620245763e-05,
        "epoch": 0.7643135075041689,
        "step": 2750
      },
      {
        "loss": 0.5923,
        "grad_norm": 1.4565565586090088,
        "learning_rate": 4.903452311293154e-05,
        "epoch": 0.7670928293496387,
        "step": 2760
      },
      {
        "loss": 0.5876,
        "grad_norm": 1.5638223886489868,
        "learning_rate": 4.844938560561732e-05,
        "epoch": 0.7698721511951084,
        "step": 2770
      },
      {
        "loss": 0.5577,
        "grad_norm": 1.4914469718933105,
        "learning_rate": 4.7864248098303106e-05,
        "epoch": 0.7726514730405781,
        "step": 2780
      },
      {
        "loss": 0.6794,
        "grad_norm": 1.210353136062622,
        "learning_rate": 4.727911059098889e-05,
        "epoch": 0.7754307948860478,
        "step": 2790
      },
      {
        "loss": 0.6647,
        "grad_norm": 1.5976355075836182,
        "learning_rate": 4.669397308367466e-05,
        "epoch": 0.7782101167315175,
        "step": 2800
      },
      {
        "loss": 0.5793,
        "grad_norm": 1.2854108810424805,
        "learning_rate": 4.610883557636045e-05,
        "epoch": 0.7809894385769872,
        "step": 2810
      },
      {
        "loss": 0.7555,
        "grad_norm": 1.4772543907165527,
        "learning_rate": 4.552369806904623e-05,
        "epoch": 0.7837687604224569,
        "step": 2820
      },
      {
        "loss": 0.6369,
        "grad_norm": 1.509872317314148,
        "learning_rate": 4.4938560561732004e-05,
        "epoch": 0.7865480822679266,
        "step": 2830
      },
      {
        "loss": 0.669,
        "grad_norm": 2.4350647926330566,
        "learning_rate": 4.435342305441779e-05,
        "epoch": 0.7893274041133963,
        "step": 2840
      },
      {
        "loss": 0.6086,
        "grad_norm": 1.8682899475097656,
        "learning_rate": 4.376828554710357e-05,
        "epoch": 0.792106725958866,
        "step": 2850
      },
      {
        "loss": 0.5857,
        "grad_norm": 1.8308444023132324,
        "learning_rate": 4.3183148039789354e-05,
        "epoch": 0.7948860478043357,
        "step": 2860
      },
      {
        "loss": 0.6207,
        "grad_norm": 1.4512547254562378,
        "learning_rate": 4.2598010532475135e-05,
        "epoch": 0.7976653696498055,
        "step": 2870
      },
      {
        "loss": 0.5281,
        "grad_norm": 1.0981119871139526,
        "learning_rate": 4.2012873025160916e-05,
        "epoch": 0.8004446914952752,
        "step": 2880
      },
      {
        "loss": 0.6987,
        "grad_norm": 1.1227097511291504,
        "learning_rate": 4.1427735517846696e-05,
        "epoch": 0.8032240133407449,
        "step": 2890
      },
      {
        "loss": 0.6354,
        "grad_norm": 1.349419116973877,
        "learning_rate": 4.084259801053248e-05,
        "epoch": 0.8060033351862146,
        "step": 2900
      },
      {
        "loss": 0.6707,
        "grad_norm": 1.6693001985549927,
        "learning_rate": 4.025746050321826e-05,
        "epoch": 0.8087826570316843,
        "step": 2910
      },
      {
        "loss": 0.5555,
        "grad_norm": 1.5549803972244263,
        "learning_rate": 3.967232299590404e-05,
        "epoch": 0.811561978877154,
        "step": 2920
      },
      {
        "loss": 0.591,
        "grad_norm": 1.785648226737976,
        "learning_rate": 3.908718548858982e-05,
        "epoch": 0.8143413007226237,
        "step": 2930
      },
      {
        "loss": 0.5992,
        "grad_norm": 1.2887086868286133,
        "learning_rate": 3.85020479812756e-05,
        "epoch": 0.8171206225680934,
        "step": 2940
      },
      {
        "loss": 0.7092,
        "grad_norm": 1.1370317935943604,
        "learning_rate": 3.791691047396138e-05,
        "epoch": 0.8198999444135631,
        "step": 2950
      },
      {
        "loss": 0.6683,
        "grad_norm": 1.367082118988037,
        "learning_rate": 3.733177296664716e-05,
        "epoch": 0.8226792662590328,
        "step": 2960
      },
      {
        "loss": 0.5731,
        "grad_norm": 1.0612155199050903,
        "learning_rate": 3.6746635459332944e-05,
        "epoch": 0.8254585881045025,
        "step": 2970
      },
      {
        "loss": 0.6481,
        "grad_norm": 1.8601607084274292,
        "learning_rate": 3.6161497952018725e-05,
        "epoch": 0.8282379099499723,
        "step": 2980
      },
      {
        "loss": 0.5889,
        "grad_norm": 1.3319456577301025,
        "learning_rate": 3.557636044470451e-05,
        "epoch": 0.831017231795442,
        "step": 2990
      },
      {
        "loss": 0.6499,
        "grad_norm": 1.5521312952041626,
        "learning_rate": 3.499122293739029e-05,
        "epoch": 0.8337965536409117,
        "step": 3000
      },
      {
        "loss": 0.5202,
        "grad_norm": 1.5546648502349854,
        "learning_rate": 3.440608543007607e-05,
        "epoch": 0.8365758754863813,
        "step": 3010
      },
      {
        "loss": 0.5754,
        "grad_norm": 0.7544180154800415,
        "learning_rate": 3.3820947922761855e-05,
        "epoch": 0.839355197331851,
        "step": 3020
      },
      {
        "loss": 0.5376,
        "grad_norm": 1.0516163110733032,
        "learning_rate": 3.323581041544763e-05,
        "epoch": 0.8421345191773207,
        "step": 3030
      },
      {
        "loss": 0.7268,
        "grad_norm": 0.9787018299102783,
        "learning_rate": 3.265067290813341e-05,
        "epoch": 0.8449138410227904,
        "step": 3040
      },
      {
        "loss": 0.6491,
        "grad_norm": 1.4314815998077393,
        "learning_rate": 3.20655354008192e-05,
        "epoch": 0.8476931628682601,
        "step": 3050
      },
      {
        "loss": 0.6874,
        "grad_norm": 1.324827790260315,
        "learning_rate": 3.148039789350498e-05,
        "epoch": 0.8504724847137298,
        "step": 3060
      },
      {
        "loss": 0.6082,
        "grad_norm": 1.5152019262313843,
        "learning_rate": 3.089526038619075e-05,
        "epoch": 0.8532518065591995,
        "step": 3070
      },
      {
        "loss": 0.7667,
        "grad_norm": 1.2576498985290527,
        "learning_rate": 3.031012287887654e-05,
        "epoch": 0.8560311284046692,
        "step": 3080
      },
      {
        "loss": 0.4844,
        "grad_norm": 0.9412326812744141,
        "learning_rate": 2.972498537156232e-05,
        "epoch": 0.8588104502501389,
        "step": 3090
      },
      {
        "loss": 0.6217,
        "grad_norm": 1.187469244003296,
        "learning_rate": 2.91398478642481e-05,
        "epoch": 0.8615897720956087,
        "step": 3100
      },
      {
        "loss": 0.6016,
        "grad_norm": 1.1852264404296875,
        "learning_rate": 2.8554710356933877e-05,
        "epoch": 0.8643690939410784,
        "step": 3110
      },
      {
        "loss": 0.4414,
        "grad_norm": 1.1429516077041626,
        "learning_rate": 2.796957284961966e-05,
        "epoch": 0.8671484157865481,
        "step": 3120
      },
      {
        "loss": 0.517,
        "grad_norm": 1.570572853088379,
        "learning_rate": 2.7384435342305442e-05,
        "epoch": 0.8699277376320178,
        "step": 3130
      },
      {
        "loss": 0.6303,
        "grad_norm": 1.1809591054916382,
        "learning_rate": 2.6799297834991223e-05,
        "epoch": 0.8727070594774875,
        "step": 3140
      },
      {
        "loss": 0.631,
        "grad_norm": 1.0413581132888794,
        "learning_rate": 2.6214160327677007e-05,
        "epoch": 0.8754863813229572,
        "step": 3150
      },
      {
        "loss": 0.6164,
        "grad_norm": 1.1612534523010254,
        "learning_rate": 2.5629022820362785e-05,
        "epoch": 0.8782657031684269,
        "step": 3160
      },
      {
        "loss": 0.6026,
        "grad_norm": 1.1018447875976562,
        "learning_rate": 2.5043885313048566e-05,
        "epoch": 0.8810450250138966,
        "step": 3170
      },
      {
        "loss": 0.6073,
        "grad_norm": 1.2285889387130737,
        "learning_rate": 2.445874780573435e-05,
        "epoch": 0.8838243468593663,
        "step": 3180
      },
      {
        "loss": 0.6716,
        "grad_norm": 1.6262547969818115,
        "learning_rate": 2.3873610298420128e-05,
        "epoch": 0.886603668704836,
        "step": 3190
      },
      {
        "loss": 0.6884,
        "grad_norm": 1.1921401023864746,
        "learning_rate": 2.3288472791105912e-05,
        "epoch": 0.8893829905503057,
        "step": 3200
      },
      {
        "loss": 0.6217,
        "grad_norm": 1.3749579191207886,
        "learning_rate": 2.2703335283791693e-05,
        "epoch": 0.8921623123957755,
        "step": 3210
      },
      {
        "loss": 0.4955,
        "grad_norm": 0.9302161931991577,
        "learning_rate": 2.2118197776477474e-05,
        "epoch": 0.8949416342412452,
        "step": 3220
      },
      {
        "loss": 0.6861,
        "grad_norm": 1.1946569681167603,
        "learning_rate": 2.1533060269163255e-05,
        "epoch": 0.8977209560867149,
        "step": 3230
      },
      {
        "loss": 0.4447,
        "grad_norm": 1.4691694974899292,
        "learning_rate": 2.0947922761849036e-05,
        "epoch": 0.9005002779321846,
        "step": 3240
      },
      {
        "loss": 0.6073,
        "grad_norm": 1.4222508668899536,
        "learning_rate": 2.0362785254534817e-05,
        "epoch": 0.9032795997776543,
        "step": 3250
      },
      {
        "loss": 0.5341,
        "grad_norm": 1.5230867862701416,
        "learning_rate": 1.9777647747220598e-05,
        "epoch": 0.906058921623124,
        "step": 3260
      },
      {
        "loss": 0.5286,
        "grad_norm": 1.1844643354415894,
        "learning_rate": 1.919251023990638e-05,
        "epoch": 0.9088382434685937,
        "step": 3270
      },
      {
        "loss": 0.7289,
        "grad_norm": 1.1704039573669434,
        "learning_rate": 1.860737273259216e-05,
        "epoch": 0.9116175653140633,
        "step": 3280
      },
      {
        "loss": 0.7212,
        "grad_norm": 1.4930881261825562,
        "learning_rate": 1.802223522527794e-05,
        "epoch": 0.914396887159533,
        "step": 3290
      },
      {
        "loss": 0.5754,
        "grad_norm": 1.3442230224609375,
        "learning_rate": 1.743709771796372e-05,
        "epoch": 0.9171762090050027,
        "step": 3300
      },
      {
        "loss": 0.5899,
        "grad_norm": 1.3578684329986572,
        "learning_rate": 1.6851960210649502e-05,
        "epoch": 0.9199555308504724,
        "step": 3310
      },
      {
        "loss": 0.5864,
        "grad_norm": 1.2579971551895142,
        "learning_rate": 1.6266822703335287e-05,
        "epoch": 0.9227348526959422,
        "step": 3320
      },
      {
        "loss": 0.6355,
        "grad_norm": 1.314341425895691,
        "learning_rate": 1.5681685196021064e-05,
        "epoch": 0.9255141745414119,
        "step": 3330
      },
      {
        "loss": 0.601,
        "grad_norm": 1.0620858669281006,
        "learning_rate": 1.5096547688706847e-05,
        "epoch": 0.9282934963868816,
        "step": 3340
      },
      {
        "loss": 0.6049,
        "grad_norm": 1.2325353622436523,
        "learning_rate": 1.451141018139263e-05,
        "epoch": 0.9310728182323513,
        "step": 3350
      },
      {
        "loss": 0.5417,
        "grad_norm": 0.9464172124862671,
        "learning_rate": 1.3926272674078409e-05,
        "epoch": 0.933852140077821,
        "step": 3360
      },
      {
        "loss": 0.6688,
        "grad_norm": 1.453446865081787,
        "learning_rate": 1.334113516676419e-05,
        "epoch": 0.9366314619232907,
        "step": 3370
      },
      {
        "loss": 0.6055,
        "grad_norm": 1.1557977199554443,
        "learning_rate": 1.2755997659449972e-05,
        "epoch": 0.9394107837687604,
        "step": 3380
      },
      {
        "loss": 0.6085,
        "grad_norm": 1.08552885055542,
        "learning_rate": 1.2170860152135752e-05,
        "epoch": 0.9421901056142301,
        "step": 3390
      },
      {
        "loss": 0.5834,
        "grad_norm": 1.2602875232696533,
        "learning_rate": 1.1585722644821534e-05,
        "epoch": 0.9449694274596998,
        "step": 3400
      },
      {
        "loss": 0.5876,
        "grad_norm": 1.5725733041763306,
        "learning_rate": 1.1000585137507315e-05,
        "epoch": 0.9477487493051695,
        "step": 3410
      },
      {
        "loss": 0.5752,
        "grad_norm": 1.2837549448013306,
        "learning_rate": 1.0415447630193096e-05,
        "epoch": 0.9505280711506392,
        "step": 3420
      },
      {
        "loss": 0.5663,
        "grad_norm": 0.9232473373413086,
        "learning_rate": 9.830310122878877e-06,
        "epoch": 0.953307392996109,
        "step": 3430
      },
      {
        "loss": 0.5702,
        "grad_norm": 1.2556686401367188,
        "learning_rate": 9.245172615564658e-06,
        "epoch": 0.9560867148415787,
        "step": 3440
      },
      {
        "loss": 0.5578,
        "grad_norm": 1.138568639755249,
        "learning_rate": 8.660035108250439e-06,
        "epoch": 0.9588660366870484,
        "step": 3450
      },
      {
        "loss": 0.6894,
        "grad_norm": 1.1079130172729492,
        "learning_rate": 8.074897600936221e-06,
        "epoch": 0.9616453585325181,
        "step": 3460
      },
      {
        "loss": 0.6521,
        "grad_norm": 1.0000965595245361,
        "learning_rate": 7.4897600936220015e-06,
        "epoch": 0.9644246803779878,
        "step": 3470
      },
      {
        "loss": 0.7117,
        "grad_norm": 1.1308131217956543,
        "learning_rate": 6.9046225863077825e-06,
        "epoch": 0.9672040022234575,
        "step": 3480
      },
      {
        "loss": 0.5305,
        "grad_norm": 1.8153457641601562,
        "learning_rate": 6.319485078993564e-06,
        "epoch": 0.9699833240689272,
        "step": 3490
      },
      {
        "loss": 0.5736,
        "grad_norm": 1.1955033540725708,
        "learning_rate": 5.734347571679345e-06,
        "epoch": 0.9727626459143969,
        "step": 3500
      },
      {
        "loss": 0.6073,
        "grad_norm": 1.1305077075958252,
        "learning_rate": 5.149210064365126e-06,
        "epoch": 0.9755419677598666,
        "step": 3510
      },
      {
        "loss": 0.5432,
        "grad_norm": 1.875968098640442,
        "learning_rate": 4.564072557050907e-06,
        "epoch": 0.9783212896053363,
        "step": 3520
      },
      {
        "loss": 0.6327,
        "grad_norm": 1.0293177366256714,
        "learning_rate": 3.978935049736688e-06,
        "epoch": 0.981100611450806,
        "step": 3530
      },
      {
        "loss": 0.5867,
        "grad_norm": 1.6121056079864502,
        "learning_rate": 3.3937975424224693e-06,
        "epoch": 0.9838799332962757,
        "step": 3540
      },
      {
        "loss": 0.5826,
        "grad_norm": 1.166865348815918,
        "learning_rate": 2.8086600351082503e-06,
        "epoch": 0.9866592551417455,
        "step": 3550
      },
      {
        "loss": 0.6175,
        "grad_norm": 1.2993223667144775,
        "learning_rate": 2.223522527794032e-06,
        "epoch": 0.9894385769872152,
        "step": 3560
      },
      {
        "loss": 0.5528,
        "grad_norm": 1.318895936012268,
        "learning_rate": 1.638385020479813e-06,
        "epoch": 0.9922178988326849,
        "step": 3570
      },
      {
        "loss": 0.6268,
        "grad_norm": 1.0751056671142578,
        "learning_rate": 1.053247513165594e-06,
        "epoch": 0.9949972206781545,
        "step": 3580
      },
      {
        "loss": 0.6024,
        "grad_norm": 1.1337924003601074,
        "learning_rate": 4.681100058513751e-07,
        "epoch": 0.9977765425236242,
        "step": 3590
      },
      {
        "train_runtime": 3863.3048,
        "train_samples_per_second": 29.802,
        "train_steps_per_second": 0.931,
        "total_flos": 4.295975851661722e+16,
        "train_loss": 0.9481710318130145,
        "epoch": 1.0,
        "step": 3598
      },
      {
        "eval_loss": 0.6718003749847412,
        "eval_bleu": 40.86405804072553,
        "eval_chrf": 68.7685241355621,
        "eval_runtime": 42.4036,
        "eval_samples_per_second": 3.019,
        "eval_steps_per_second": 0.094,
        "epoch": 1.0,
        "step": 3598
      }
    ],
    "actual_training_exposure": {
      "examples": 115136,
      "source_tokens": 1268518,
      "target_tokens": 1122677,
      "non_padding_tokens": 2391195,
      "by_task": {
        "dictionary_lexeme": {
          "examples": 78996,
          "source_tokens": 441902,
          "target_tokens": 384569,
          "non_padding_tokens": 826471
        },
        "synthetic_academic_parallel": {
          "examples": 33284,
          "source_tokens": 713552,
          "target_tokens": 704692,
          "non_padding_tokens": 1418244
        },
        "usage_example": {
          "examples": 2856,
          "source_tokens": 113064,
          "target_tokens": 33416,
          "non_padding_tokens": 146480
        }
      },
      "unique_rows_seen": 115136,
      "presentations_per_seen_row": {
        "minimum": 1,
        "maximum": 1,
        "mean": 1.0
      },
      "accounting_scope": "current trainer process",
      "world_size": 1
    }
  },
  "artifacts": {
    "adapter_dir": "/workspace/v24.3-joint-lexeme-dose29-rerun1/models/J69/adapter",
    "merged_dir": null,
    "merge_embedding_canonicalization": null
  },
  "environment": {
    "python": "3.11.10",
    "platform": "Linux-5.15.0-139-generic-x86_64-with-glibc2.35",
    "torch": "2.4.1+cu124",
    "cuda_runtime": "12.4",
    "cuda_available": true,
    "gpu": "NVIDIA RTX A6000",
    "packages": {
      "accelerate": "1.14.0",
      "datasets": "4.8.5",
      "peft": "0.19.1",
      "sacrebleu": "2.6.0",
      "sentencepiece": "0.2.2",
      "transformers": "4.48.3"
    }
  }
}
