{
  "schema_version": 1,
  "all_predictions_identical": true,
  "models": {
    "step2770": {
      "baseline_file": "/mnt/donto-data/donto-resources/research/translation-training/kuku-yalanji-runpod-2026-06-30/runpod/kuku-version-benchmark-runpod-20260714T100622Z/results/failed-seal-attempt-01/kuku-version-benchmark-runpod-a40-20260714T102858Z/predictions/step2770.predictions.json",
      "baseline_sha256": "9883f82e9afe131f7abae41751f5b9db167277f392da2e5b898f6359d4d94758",
      "candidate_file": "/mnt/donto-data/donto-resources/research/translation-training/kuku-yalanji-runpod-2026-06-30/runpod/kuku-version-benchmark-runpod-20260714T100622Z/results/kuku-version-benchmark-runpod-a40-r2-20260714T104027Z/predictions/step2770.predictions.json",
      "candidate_sha256": "9883f82e9afe131f7abae41751f5b9db167277f392da2e5b898f6359d4d94758",
      "rows": 340,
      "identical_predictions": 340,
      "mismatched_predictions": 0,
      "exact_prediction_parity_percent": 100.0,
      "metric_deltas_candidate_minus_baseline": {
        "bleu": 0.0,
        "chrf": 0.0,
        "exact_match": 0.0,
        "empty_outputs": 0.0,
        "source_copy_outputs": 0.0
      },
      "mismatches": []
    },
    "step3120": {
      "baseline_file": "/mnt/donto-data/donto-resources/research/translation-training/kuku-yalanji-runpod-2026-06-30/runpod/kuku-version-benchmark-runpod-20260714T100622Z/results/failed-seal-attempt-01/kuku-version-benchmark-runpod-a40-20260714T102858Z/predictions/step3120.predictions.json",
      "baseline_sha256": "907e99d87c67ebe6406ee2525687001e28329708502df2e9578a49ea5f838502",
      "candidate_file": "/mnt/donto-data/donto-resources/research/translation-training/kuku-yalanji-runpod-2026-06-30/runpod/kuku-version-benchmark-runpod-20260714T100622Z/results/kuku-version-benchmark-runpod-a40-r2-20260714T104027Z/predictions/step3120.predictions.json",
      "candidate_sha256": "907e99d87c67ebe6406ee2525687001e28329708502df2e9578a49ea5f838502",
      "rows": 340,
      "identical_predictions": 340,
      "mismatched_predictions": 0,
      "exact_prediction_parity_percent": 100.0,
      "metric_deltas_candidate_minus_baseline": {
        "bleu": 0.0,
        "chrf": 0.0,
        "exact_match": 0.0,
        "empty_outputs": 0.0,
        "source_copy_outputs": 0.0
      },
      "mismatches": []
    },
    "step4155_guarded": {
      "baseline_file": "/mnt/donto-data/donto-resources/research/translation-training/kuku-yalanji-runpod-2026-06-30/runpod/kuku-version-benchmark-runpod-20260714T100622Z/results/failed-seal-attempt-01/kuku-version-benchmark-runpod-a40-20260714T102858Z/predictions/step4155_guarded.predictions.json",
      "baseline_sha256": "f37637e726471400495598212e07056877981d910dc29041acf68ddd10f70a4b",
      "candidate_file": "/mnt/donto-data/donto-resources/research/translation-training/kuku-yalanji-runpod-2026-06-30/runpod/kuku-version-benchmark-runpod-20260714T100622Z/results/kuku-version-benchmark-runpod-a40-r2-20260714T104027Z/predictions/step4155_guarded.predictions.json",
      "candidate_sha256": "f37637e726471400495598212e07056877981d910dc29041acf68ddd10f70a4b",
      "rows": 340,
      "identical_predictions": 340,
      "mismatched_predictions": 0,
      "exact_prediction_parity_percent": 100.0,
      "metric_deltas_candidate_minus_baseline": {
        "bleu": 0.0,
        "chrf": 0.0,
        "exact_match": 0.0,
        "empty_outputs": 0.0,
        "source_copy_outputs": 0.0
      },
      "mismatches": []
    }
  }
}
