{
  "model_id": "mobtranslate/migmaq-nllb-lora",
  "version": "1.0.0-rc1",
  "run_id": "migmaq-v1-rc1",
  "created_at": "2026-07-12T10:48:28.136180+00:00",
  "base_model": "facebook/nllb-200-distilled-600M",
  "base_model_revision": "f8d333a098d19b4fd9a8b18f94170487ad3f821d",
  "license": "CC-BY-NC-4.0",
  "direction": "eng-mic",
  "source_lang": "eng_Latn",
  "target_lang": "mic_Latn",
  "target_lang_init_from": "tpi_Latn",
  "source_lang_token_id": 256047,
  "target_lang_token_id": 256204,
  "dataset": {
    "dataset_id": "migmaq-online-example-parallel-v1.0.0-20260712",
    "release_sha256": "805c225aeebf0596fa4f892d89cf930a23a395e2b58c1c059cb47a7092f86368",
    "train_file": "/workspace/mobtranslate-migmaq/data/migmaq-online-example-parallel-v1.0.0-20260712/training/train.eng-mic.jsonl",
    "validation_file": "/workspace/mobtranslate-migmaq/data/migmaq-online-example-parallel-v1.0.0-20260712/training/validation.eng-mic.jsonl",
    "test_file": null,
    "file_sha256": {
      "train": "58860018a474e520274a9db926748ce847090733201ca717df8ee16675caafdf",
      "validation": "b022484cc6f35b123d618ba96e3e4c459c4da83528cdf4aa1a1136e2e544a05c",
      "test": null
    },
    "split_rows": {
      "train": 5798,
      "validation": 686
    },
    "max_train_samples": null,
    "max_validation_samples": null,
    "max_test_samples": null,
    "shuffle_before_cap": true
  },
  "training_args": {
    "epochs": 8.0,
    "batch_size": 8,
    "gradient_accumulation_steps": 4,
    "learning_rate": 0.0001,
    "lora_r": 32,
    "lora_alpha": 64,
    "lora_dropout": 0.05,
    "lora_target_modules": [
      "q_proj",
      "k_proj",
      "v_proj",
      "out_proj",
      "fc1",
      "fc2"
    ],
    "modules_to_save": [
      "model.shared",
      "lm_head"
    ],
    "seed": 42,
    "ensure_weight_tying": true,
    "effective_ensure_weight_tying": false,
    "generation_num_beams": 4,
    "generation_no_repeat_ngram_size": 4,
    "generation_repetition_penalty": 1.15,
    "generation_length_penalty": 0.8,
    "save_total_limit": 3,
    "gradient_checkpointing": false,
    "resume_from_checkpoint": null
  },
  "metrics": {
    "train": {
      "train_runtime": 1623.2654,
      "train_samples_per_second": 28.575,
      "train_steps_per_second": 0.892,
      "total_flos": 3826883732926464.0,
      "train_loss": 3.790959213320063,
      "epoch": 7.96
    },
    "validation": {
      "eval_loss": 3.216315269470215,
      "eval_bleu": 1.1713297280145971,
      "eval_chrf": 20.90273868497496,
      "eval_runtime": 80.165,
      "eval_samples_per_second": 8.557,
      "eval_steps_per_second": 1.073,
      "epoch": 7.96
    }
  },
  "trainer_state": {
    "best_model_checkpoint": "/workspace/mobtranslate-migmaq/runs/migmaq-v1-rc1/model/checkpoint-1440",
    "best_metric": 20.90273868497496,
    "global_step": 1448,
    "epoch": 7.96,
    "log_history": [
      {
        "loss": 7.8123,
        "grad_norm": 1.0960345268249512,
        "learning_rate": 1.7241379310344828e-05,
        "epoch": 0.1103448275862069,
        "step": 20
      },
      {
        "loss": 7.5642,
        "grad_norm": 0.9836035966873169,
        "learning_rate": 3.4482758620689657e-05,
        "epoch": 0.2206896551724138,
        "step": 40
      },
      {
        "loss": 6.7437,
        "grad_norm": 0.8543595671653748,
        "learning_rate": 5.172413793103449e-05,
        "epoch": 0.3310344827586207,
        "step": 60
      },
      {
        "loss": 5.8255,
        "grad_norm": 0.6166243553161621,
        "learning_rate": 6.896551724137931e-05,
        "epoch": 0.4413793103448276,
        "step": 80
      },
      {
        "loss": 5.3159,
        "grad_norm": 0.7834814786911011,
        "learning_rate": 8.620689655172413e-05,
        "epoch": 0.5517241379310345,
        "step": 100
      },
      {
        "loss": 4.9005,
        "grad_norm": 0.7816192507743835,
        "learning_rate": 9.96996996996997e-05,
        "epoch": 0.6620689655172414,
        "step": 120
      },
      {
        "loss": 4.7223,
        "grad_norm": 1.0438772439956665,
        "learning_rate": 9.81981981981982e-05,
        "epoch": 0.7724137931034483,
        "step": 140
      },
      {
        "loss": 4.5449,
        "grad_norm": 0.8962052464485168,
        "learning_rate": 9.66966966966967e-05,
        "epoch": 0.8827586206896552,
        "step": 160
      },
      {
        "loss": 4.4863,
        "grad_norm": 1.033599853515625,
        "learning_rate": 9.51951951951952e-05,
        "epoch": 0.993103448275862,
        "step": 180
      },
      {
        "eval_loss": 4.335728645324707,
        "eval_bleu": 0.16765838926628987,
        "eval_chrf": 12.463361942763411,
        "eval_runtime": 65.7937,
        "eval_samples_per_second": 10.427,
        "eval_steps_per_second": 1.307,
        "epoch": 0.993103448275862,
        "step": 180
      },
      {
        "loss": 4.1808,
        "grad_norm": 1.1378213167190552,
        "learning_rate": 9.36936936936937e-05,
        "epoch": 1.0993103448275863,
        "step": 200
      },
      {
        "loss": 4.2477,
        "grad_norm": 1.384518027305603,
        "learning_rate": 9.219219219219219e-05,
        "epoch": 1.2096551724137932,
        "step": 220
      },
      {
        "loss": 4.2027,
        "grad_norm": 1.3660056591033936,
        "learning_rate": 9.069069069069069e-05,
        "epoch": 1.32,
        "step": 240
      },
      {
        "loss": 4.1059,
        "grad_norm": 1.3906512260437012,
        "learning_rate": 8.918918918918919e-05,
        "epoch": 1.430344827586207,
        "step": 260
      },
      {
        "loss": 4.0805,
        "grad_norm": 1.6171739101409912,
        "learning_rate": 8.76876876876877e-05,
        "epoch": 1.5406896551724136,
        "step": 280
      },
      {
        "loss": 4.0101,
        "grad_norm": 1.6847319602966309,
        "learning_rate": 8.61861861861862e-05,
        "epoch": 1.6510344827586207,
        "step": 300
      },
      {
        "loss": 4.0116,
        "grad_norm": 1.429111361503601,
        "learning_rate": 8.468468468468469e-05,
        "epoch": 1.7613793103448274,
        "step": 320
      },
      {
        "loss": 3.9085,
        "grad_norm": 1.6324827671051025,
        "learning_rate": 8.318318318318319e-05,
        "epoch": 1.8717241379310345,
        "step": 340
      },
      {
        "loss": 3.9197,
        "grad_norm": 1.7615532875061035,
        "learning_rate": 8.168168168168169e-05,
        "epoch": 1.9820689655172414,
        "step": 360
      },
      {
        "eval_loss": 3.8356380462646484,
        "eval_bleu": 0.48404126819549576,
        "eval_chrf": 15.359716652391825,
        "eval_runtime": 79.0022,
        "eval_samples_per_second": 8.683,
        "eval_steps_per_second": 1.089,
        "epoch": 1.9820689655172414,
        "step": 360
      },
      {
        "loss": 3.7096,
        "grad_norm": 1.8370529413223267,
        "learning_rate": 8.018018018018019e-05,
        "epoch": 2.0882758620689654,
        "step": 380
      },
      {
        "loss": 3.836,
        "grad_norm": 1.7629789113998413,
        "learning_rate": 7.867867867867868e-05,
        "epoch": 2.1986206896551725,
        "step": 400
      },
      {
        "loss": 3.8296,
        "grad_norm": 1.724611759185791,
        "learning_rate": 7.717717717717718e-05,
        "epoch": 2.308965517241379,
        "step": 420
      },
      {
        "loss": 3.7803,
        "grad_norm": 1.6361961364746094,
        "learning_rate": 7.567567567567568e-05,
        "epoch": 2.4193103448275863,
        "step": 440
      },
      {
        "loss": 3.8084,
        "grad_norm": 1.7837014198303223,
        "learning_rate": 7.417417417417419e-05,
        "epoch": 2.529655172413793,
        "step": 460
      },
      {
        "loss": 3.7476,
        "grad_norm": 1.6923669576644897,
        "learning_rate": 7.267267267267268e-05,
        "epoch": 2.64,
        "step": 480
      },
      {
        "loss": 3.6954,
        "grad_norm": 1.8435031175613403,
        "learning_rate": 7.117117117117116e-05,
        "epoch": 2.750344827586207,
        "step": 500
      },
      {
        "loss": 3.6329,
        "grad_norm": 2.0199050903320312,
        "learning_rate": 6.966966966966967e-05,
        "epoch": 2.860689655172414,
        "step": 520
      },
      {
        "loss": 3.6888,
        "grad_norm": 1.7808223962783813,
        "learning_rate": 6.816816816816817e-05,
        "epoch": 2.9710344827586206,
        "step": 540
      },
      {
        "eval_loss": 3.6013119220733643,
        "eval_bleu": 0.6223286620873894,
        "eval_chrf": 16.471575253145918,
        "eval_runtime": 80.2696,
        "eval_samples_per_second": 8.546,
        "eval_steps_per_second": 1.071,
        "epoch": 2.9710344827586206,
        "step": 540
      },
      {
        "loss": 3.5314,
        "grad_norm": 1.6735594272613525,
        "learning_rate": 6.666666666666667e-05,
        "epoch": 3.077241379310345,
        "step": 560
      },
      {
        "loss": 3.5681,
        "grad_norm": 1.9598361253738403,
        "learning_rate": 6.516516516516516e-05,
        "epoch": 3.187586206896552,
        "step": 580
      },
      {
        "loss": 3.6299,
        "grad_norm": 2.051518678665161,
        "learning_rate": 6.366366366366366e-05,
        "epoch": 3.2979310344827586,
        "step": 600
      },
      {
        "loss": 3.5307,
        "grad_norm": 1.9495127201080322,
        "learning_rate": 6.216216216216216e-05,
        "epoch": 3.4082758620689657,
        "step": 620
      },
      {
        "loss": 3.57,
        "grad_norm": 2.001026153564453,
        "learning_rate": 6.0660660660660665e-05,
        "epoch": 3.5186206896551724,
        "step": 640
      },
      {
        "loss": 3.5731,
        "grad_norm": 2.182462215423584,
        "learning_rate": 5.915915915915916e-05,
        "epoch": 3.6289655172413795,
        "step": 660
      },
      {
        "loss": 3.5554,
        "grad_norm": 2.3165998458862305,
        "learning_rate": 5.765765765765766e-05,
        "epoch": 3.739310344827586,
        "step": 680
      },
      {
        "loss": 3.546,
        "grad_norm": 1.9868271350860596,
        "learning_rate": 5.615615615615616e-05,
        "epoch": 3.849655172413793,
        "step": 700
      },
      {
        "loss": 3.5413,
        "grad_norm": 2.1633987426757812,
        "learning_rate": 5.465465465465466e-05,
        "epoch": 3.96,
        "step": 720
      },
      {
        "eval_loss": 3.4398512840270996,
        "eval_bleu": 0.8660361185193649,
        "eval_chrf": 18.47887061026974,
        "eval_runtime": 85.5688,
        "eval_samples_per_second": 8.017,
        "eval_steps_per_second": 1.005,
        "epoch": 3.96,
        "step": 720
      },
      {
        "loss": 3.3259,
        "grad_norm": 2.255176305770874,
        "learning_rate": 5.3153153153153155e-05,
        "epoch": 4.066206896551724,
        "step": 740
      },
      {
        "loss": 3.408,
        "grad_norm": 2.254042387008667,
        "learning_rate": 5.165165165165166e-05,
        "epoch": 4.176551724137931,
        "step": 760
      },
      {
        "loss": 3.4249,
        "grad_norm": 2.2617976665496826,
        "learning_rate": 5.015015015015015e-05,
        "epoch": 4.286896551724138,
        "step": 780
      },
      {
        "loss": 3.4719,
        "grad_norm": 2.180143356323242,
        "learning_rate": 4.8648648648648654e-05,
        "epoch": 4.397241379310345,
        "step": 800
      },
      {
        "loss": 3.4305,
        "grad_norm": 2.0861873626708984,
        "learning_rate": 4.714714714714715e-05,
        "epoch": 4.507586206896551,
        "step": 820
      },
      {
        "loss": 3.4599,
        "grad_norm": 2.2661542892456055,
        "learning_rate": 4.5645645645645645e-05,
        "epoch": 4.617931034482758,
        "step": 840
      },
      {
        "loss": 3.4394,
        "grad_norm": 2.313872814178467,
        "learning_rate": 4.414414414414415e-05,
        "epoch": 4.7282758620689656,
        "step": 860
      },
      {
        "loss": 3.4297,
        "grad_norm": 2.1619489192962646,
        "learning_rate": 4.264264264264264e-05,
        "epoch": 4.838620689655173,
        "step": 880
      },
      {
        "loss": 3.3812,
        "grad_norm": 2.3507044315338135,
        "learning_rate": 4.1141141141141144e-05,
        "epoch": 4.94896551724138,
        "step": 900
      },
      {
        "eval_loss": 3.345947027206421,
        "eval_bleu": 0.9134969735073716,
        "eval_chrf": 19.630807799535308,
        "eval_runtime": 83.0245,
        "eval_samples_per_second": 8.263,
        "eval_steps_per_second": 1.036,
        "epoch": 4.94896551724138,
        "step": 900
      },
      {
        "loss": 3.2178,
        "grad_norm": 2.1798341274261475,
        "learning_rate": 3.963963963963964e-05,
        "epoch": 5.055172413793104,
        "step": 920
      },
      {
        "loss": 3.3507,
        "grad_norm": 2.2657856941223145,
        "learning_rate": 3.813813813813814e-05,
        "epoch": 5.165517241379311,
        "step": 940
      },
      {
        "loss": 3.3596,
        "grad_norm": 2.2884743213653564,
        "learning_rate": 3.663663663663664e-05,
        "epoch": 5.275862068965517,
        "step": 960
      },
      {
        "loss": 3.3311,
        "grad_norm": 2.3985369205474854,
        "learning_rate": 3.513513513513514e-05,
        "epoch": 5.386206896551724,
        "step": 980
      },
      {
        "loss": 3.3046,
        "grad_norm": 2.3259048461914062,
        "learning_rate": 3.3633633633633635e-05,
        "epoch": 5.496551724137931,
        "step": 1000
      },
      {
        "loss": 3.3049,
        "grad_norm": 2.2352914810180664,
        "learning_rate": 3.213213213213213e-05,
        "epoch": 5.606896551724138,
        "step": 1020
      },
      {
        "loss": 3.2475,
        "grad_norm": 2.2237415313720703,
        "learning_rate": 3.063063063063063e-05,
        "epoch": 5.7172413793103445,
        "step": 1040
      },
      {
        "loss": 3.3834,
        "grad_norm": 2.3684418201446533,
        "learning_rate": 2.912912912912913e-05,
        "epoch": 5.827586206896552,
        "step": 1060
      },
      {
        "loss": 3.3205,
        "grad_norm": 2.3145265579223633,
        "learning_rate": 2.762762762762763e-05,
        "epoch": 5.937931034482759,
        "step": 1080
      },
      {
        "eval_loss": 3.2714765071868896,
        "eval_bleu": 1.2834734566308728,
        "eval_chrf": 20.59770622137929,
        "eval_runtime": 80.7764,
        "eval_samples_per_second": 8.493,
        "eval_steps_per_second": 1.065,
        "epoch": 5.937931034482759,
        "step": 1080
      },
      {
        "loss": 3.1946,
        "grad_norm": 2.427734851837158,
        "learning_rate": 2.6126126126126128e-05,
        "epoch": 6.0441379310344825,
        "step": 1100
      },
      {
        "loss": 3.2442,
        "grad_norm": 2.2713942527770996,
        "learning_rate": 2.4624624624624627e-05,
        "epoch": 6.15448275862069,
        "step": 1120
      },
      {
        "loss": 3.263,
        "grad_norm": 2.415048837661743,
        "learning_rate": 2.3123123123123125e-05,
        "epoch": 6.264827586206897,
        "step": 1140
      },
      {
        "loss": 3.2656,
        "grad_norm": 2.5164527893066406,
        "learning_rate": 2.1621621621621624e-05,
        "epoch": 6.375172413793104,
        "step": 1160
      },
      {
        "loss": 3.2448,
        "grad_norm": 2.3166003227233887,
        "learning_rate": 2.012012012012012e-05,
        "epoch": 6.48551724137931,
        "step": 1180
      },
      {
        "loss": 3.2717,
        "grad_norm": 2.4854772090911865,
        "learning_rate": 1.8618618618618618e-05,
        "epoch": 6.595862068965517,
        "step": 1200
      },
      {
        "loss": 3.2473,
        "grad_norm": 2.4885852336883545,
        "learning_rate": 1.7117117117117117e-05,
        "epoch": 6.706206896551724,
        "step": 1220
      },
      {
        "loss": 3.2221,
        "grad_norm": 2.4665870666503906,
        "learning_rate": 1.5615615615615616e-05,
        "epoch": 6.816551724137931,
        "step": 1240
      },
      {
        "loss": 3.2934,
        "grad_norm": 2.261301279067993,
        "learning_rate": 1.4114114114114116e-05,
        "epoch": 6.926896551724138,
        "step": 1260
      },
      {
        "eval_loss": 3.2290875911712646,
        "eval_bleu": 1.1601988315075908,
        "eval_chrf": 20.71442465389354,
        "eval_runtime": 80.9845,
        "eval_samples_per_second": 8.471,
        "eval_steps_per_second": 1.062,
        "epoch": 6.926896551724138,
        "step": 1260
      },
      {
        "loss": 3.175,
        "grad_norm": 2.32366681098938,
        "learning_rate": 1.2612612612612611e-05,
        "epoch": 7.033103448275862,
        "step": 1280
      },
      {
        "loss": 3.2413,
        "grad_norm": 2.4811108112335205,
        "learning_rate": 1.1111111111111112e-05,
        "epoch": 7.1434482758620685,
        "step": 1300
      },
      {
        "loss": 3.191,
        "grad_norm": 2.476182699203491,
        "learning_rate": 9.60960960960961e-06,
        "epoch": 7.253793103448276,
        "step": 1320
      },
      {
        "loss": 3.2615,
        "grad_norm": 2.410552501678467,
        "learning_rate": 8.108108108108109e-06,
        "epoch": 7.364137931034483,
        "step": 1340
      },
      {
        "loss": 3.2466,
        "grad_norm": 2.5023603439331055,
        "learning_rate": 6.606606606606607e-06,
        "epoch": 7.47448275862069,
        "step": 1360
      },
      {
        "loss": 3.2014,
        "grad_norm": 2.351749897003174,
        "learning_rate": 5.105105105105106e-06,
        "epoch": 7.584827586206897,
        "step": 1380
      },
      {
        "loss": 3.1852,
        "grad_norm": 2.4354088306427,
        "learning_rate": 3.603603603603604e-06,
        "epoch": 7.695172413793103,
        "step": 1400
      },
      {
        "loss": 3.2569,
        "grad_norm": 2.404743194580078,
        "learning_rate": 2.102102102102102e-06,
        "epoch": 7.80551724137931,
        "step": 1420
      },
      {
        "loss": 3.2273,
        "grad_norm": 2.3349010944366455,
        "learning_rate": 6.006006006006006e-07,
        "epoch": 7.9158620689655175,
        "step": 1440
      },
      {
        "eval_loss": 3.216315269470215,
        "eval_bleu": 1.1713297280145971,
        "eval_chrf": 20.90273868497496,
        "eval_runtime": 82.475,
        "eval_samples_per_second": 8.318,
        "eval_steps_per_second": 1.043,
        "epoch": 7.9158620689655175,
        "step": 1440
      },
      {
        "train_runtime": 1623.2654,
        "train_samples_per_second": 28.575,
        "train_steps_per_second": 0.892,
        "total_flos": 3826883732926464.0,
        "train_loss": 3.790959213320063,
        "epoch": 7.96,
        "step": 1448
      },
      {
        "eval_loss": 3.216315269470215,
        "eval_bleu": 1.1713297280145971,
        "eval_chrf": 20.90273868497496,
        "eval_runtime": 80.165,
        "eval_samples_per_second": 8.557,
        "eval_steps_per_second": 1.073,
        "epoch": 7.96,
        "step": 1448
      }
    ]
  },
  "artifacts": {
    "adapter_dir": "/workspace/mobtranslate-migmaq/runs/migmaq-v1-rc1/model/adapter",
    "merged_dir": "/workspace/mobtranslate-migmaq/runs/migmaq-v1-rc1/model/merged",
    "merge_embedding_canonicalization": {
      "shared_was_runtime_embedding": false,
      "canonicalized_shared_from_decoder": true,
      "encoder_decoder_tied": true,
      "output_head_tied": false,
      "materialized_serialization_keys": [
        "model.shared.weight",
        "model.encoder.embed_tokens.weight",
        "model.decoder.embed_tokens.weight"
      ]
    }
  },
  "environment": {
    "python": "3.11.10",
    "platform": "Linux-6.8.0-124-generic-x86_64-with-glibc2.35",
    "torch": "2.4.1+cu124",
    "cuda_runtime": "12.4",
    "cuda_available": true,
    "gpu": "NVIDIA A40",
    "packages": {
      "accelerate": "1.14.0",
      "datasets": "4.8.5",
      "peft": "0.19.1",
      "sacrebleu": "2.6.0",
      "sentencepiece": "0.2.2",
      "transformers": "4.48.3"
    }
  }
}
